Veranstaltung einreichen
24. September - Treffen zu KI, ML und Computer Vision

24. September - Treffen zu KI, ML und Computer Vision

24 Sep 20264:00 PM UTCSan Francisco, United StatesOpen
LearnNetwork
CodeImageVideo

Beschreibung

Nehmen Sie an unserem virtuellen Treffen am 24. September teil, um Vorträge von Experten zu bahnbrechenden Themen in den Bereichen KI, ML und Computer Vision zu hören. Datum, Uhrzeit und Ort 24. September 2026, 9:00 - 11:00 Uhr PST, Online. Registrieren Sie sich für das Zoom-Meeting! Wie treiben die KI-Prinzipien von Mercedes-Benz unsere Innovationen voran? Bei Mercedes-Benz leiten unsere KI-Prinzipien jeden Schritt der Innovation und betonen verantwortungsvollen Einsatz, Sicherheit und Zuverlässigkeit, Erklärbarkeit und den Schutz der Privatsphäre. Diese Prinzipien sind mehr als nur Aussagen, sie prägen aktiv, wie wir KI-Systeme in realen Automobil- und Unternehmensumgebungen entwerfen, testen und implementieren. In diesem Vortrag werde ich darlegen, wie diese Prinzipien unsere jüngsten Forschungen zum effektiven Recycling von LoRA (Low-Rank Adaptation) inspiriert haben. Durch die Kombination theoretischer Analysen mit synthetischen Daten als Proxy für Unternehmensszenarien haben wir die Stärken und Grenzen modularer KI-Komponenten bei eingeschränktem Datenzugang aufgedeckt. Unsere Ergebnisse bieten praktische Hinweise, wann wiederverwendete LoRAs qualitativ hochwertige Ergebnisse liefern können. Über die Referentin Mei-Yen Chen ist Senior Data Scientist bei Mercedes-Benz Tech Innovation GmbH in Deutschland mit 10 Jahren Branchenerfahrung in KI und Datenlösungen. Sie leitet frühzeitige KI-Projekte in verschiedenen Geschäftsbereichen und arbeitet mit Forschungseinrichtungen zu maschinellem Lernen und verantwortungsvoller KI zusammen. Region Tokens als visuelles Primitive: Von der Erkennung zum Weltmodell Patch-basierte Tokenisierung ist die Standard-Schnittstelle zwischen Vision-Encodern und nachgelagerten Modellen geworden, dennoch tragen Patches keine semantische Struktur und skalieren schlecht mit Auflösung und zeitlicher Ausdehnung. Dieser Vortrag präsentiert ein Forschungsprogramm, das sich mit dem Austausch von Patch-Token durch regionale Repräsentationen beschäftigt – semantisch dichte Token, die in visuellen Entitäten anstelle von willkürlichen Rasterausschnitten verankert sind. Ich werde RELOCATE, REN und T-REN beschreiben, eine Weiterentwicklung von Methoden, die regionale Tokens durch Pooling erzeugen, sie mit regionalen Zielvorgaben trainieren und sie mit zeitlicher Kohärenz auf Video erweitern. Ich werde dann anstehenden Arbeiten vorstellen, die regionale Tokens in VLMs integrieren, um die visuelle Kontextkapazität direkt zu erweitern, und erste Ergebnisse zur zukünftigen Vorhersage von regionalen Trajektorien als Grundlage für Weltmodellierung. Die umfassendere These ist, dass regionale Tokens eine natürlichere Einheit der visuellen Berechnung als Patches sind und ihr Vorteil sich verstärkt, je komplexer die Aufgaben, die Auflösung und der zeitliche Horizont werden. Über den Redner Savya Khosla ist Doktorand im zweiten Jahr an der Universität von Illinois Urbana-Champaign, betreut von Prof. Derek Hoiem und Prof. Alex Schwing. Nutzung von Text-zu-Bild Diffusionsmodellen für konsistente Set-to-Set-Generierung Bildsammlungen sind die primäre Art und Weise, wie Menschen die Welt festhalten, doch Fortschritte bei der generativen Bearbeitung sind weitgehend auf diese Modalität nicht anwendbar. Wir schließen diese Lücke, indem wir Match-and-Fuse einführen - eine Zero-Shot, trainingsfreie Methode zur konsistenten Set-to-Set-Generierung aus Bildsammlungen, die ein gemeinsames visuelles Element teilen, sich jedoch in Blickwinkel, Erfassungszeit und umgebendem Inhalt unterscheiden. Unsere zentrale Idee ist ein einheitlicher graphbasierter Rahmen, der dichte Entsprechungen mit einem emergenten Prior in Text-zu-Bild-Diffusionsmodellen kombiniert, um kohärente Kanäle zu erzeugen. Wir erzielen erstklassige Konsistenz und visuelle Qualität und erschließen neue kreative Möglichkeiten für die Inhaltserstellung. Über die Referentin Kate Feingold ist Doktorandin der Computer Vision am Weizmann Institute of Science. Ihre Forschung befindet sich an der Schnittstelle von generativen Modellen, 3D/4D-Wahrnehmung und multimodalem Lernen, und konzentriert sich auf Probleme, wo Vision auf andere Modalitäten oder Paradigmen in kreativen Aufgaben stößt. Ertragsabschätzung von Kaffee in einer dichten Umgebung Diese Präsentation bietet einen detaillierten Ablauf zur Ertragsabschätzung von Kaffee in einer dichten Umgebung. Mit Fotos von vorbehandelten Kaffeepflanzen aus mehreren Kaffeeplantagen werden Details zu Vorverarbeitung, Annotation zur Erkennung von Interessengebieten (ROI), Objekt-Detektionstraining und Inferenzresultaten mit verschiedenen Yolo-Modellen sowie schließlich Segmentierung mit SAM2 und Yolo*-seg mit Trainings- und Inferenzresultaten zur Bestimmung der Anzahl von Roh-, unreifen, reifen und überreifen Kaffeekirschen sowie schließlich den Ertrag der gesamten Plantage dargestellt. All dies basiert auf realen Daten, die mit iPhones und Android-Phones erfasst wurden. Über den Redner Raghu M. Rao ist Berater, der an Anwendungen von KI-Modellen in der Computer Vision arbeitet. Zuvor war er bei AMD und Xilinx tätig. Er hat einen Ph.D. in Wireless Communications von der UCLA und ist Senior Member der IEEE. Seine aktuellen Interessen liegen in der Anwendung von KI in der Landwirtschaft, Gesundheitsversorgung und drahtlosen Kommunikation.

Veranstaltungsort

Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind

Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.

Related events

Plattform für künstliche Intelligenz

Preise auf der Website
Tickets kaufen