
23. Juli - Meetup zu AI, ML und Computer Vision
Beschreibung
Nehmen Sie an unserem virtuellen Meetup teil, um Vorträge von Experten zu bahnbrechenden Themen im Bereich AI, ML und Computer Vision zu hören. Datum, Uhrzeit und Ort 23. Juli 2026, 9:00 - 11:00 Uhr PST Online. Registrieren Sie sich für Zoom! Generative KI zur Erstellung von Video-Trailern: Von extraktiven Heuristiken zu autoregressiver Kreativität Der Bereich der automatischen Video-Trailer-Generierung durchläuft derzeit einen tiefgreifenden Paradigmenwechsel und wechselt von heuristischen Extraktionsmethoden zu tiefgreifender generativer Synthese. Während frühere Methoden stark auf Low-Level-Feature-Engineering, visuelle Salienz und regelbasierte Heuristiken setzten, ermöglichen aktuelle Fortschritte in großen Sprachmodellen (LLMs), multimodalen großen Sprachmodellen (MLLMs) und diffusionsbasierter Videosynthese Systeme, die nicht nur Schlüsselmomente identifizieren, sondern auch kohärente, emotional resonante Erzählungen erstellen. Diese Umfrage bietet eine umfassende technische Übersicht über diese Entwicklung, mit einem spezifischen Fokus auf generative Techniken, einschließlich autoregressiver Transformer, LLM-orchestrierter Pipelines und Text-zu-Video-Grundmodellen wie OpenAI's Sora und Googles Veo. Wir analysieren den architektonischen Fortschritt von Graph Convolutional Networks (GCNs) zu Trailer Generation Transformers (TGT), bewerten die wirtschaftlichen Auswirkungen der automatisierten Inhaltsgeschwindigkeit auf Plattformen für nutzergenerierte Inhalte (UGC) und diskutieren die ethischen Herausforderungen, die durch neuronale Hochfidelitätssynthese entstehen. Durch die Synthese von Erkenntnissen aus der aktuellen Literatur etabliert dieser Bericht eine neue Taxonomie für die KI-gesteuerte Trailer-Generierung im Zeitalter der Grundmodelle und legt nahe, dass zukünftige Werbevideosysteme über die extraktive Auswahl hinaus zur kontrollierbaren generativen Bearbeitung und semantischen Rekonstruktion von Trailern übergehen werden. Über den Referenten Abhishek Dharmaratnakar ist Engineering Leader bei Google, der YouTube Premium leitet. Seine Arbeit konzentriert sich auf die Schnittstelle zwischen Hyperscale-Medieninfrastruktur und generativer künstlicher Intelligenz, wobei er funktionsübergreifende Ingenieurorganisationen leitet, um zu redefinieren, wie Milliarden von Nutzern Inhalte konsumieren und erstellen. Agentensysteme beobachtbar, zuverlässig und testbar machen In diesem Vortrag teile ich praktische Lektionen aus dem Aufbau realer Agentensysteme in Computer Vision-Workflows mit dem Fokus darauf, wie man Evaluierungsschleifen, Beobachtbarkeitspipelines und Sandbox-Umgebungen gestaltet, die Agenten in der Praxis zuverlässig machen. Wir werden erkunden, wie man Verhalten end-to-end messen, Komponenten unabhängig testen und Feedback-Schleifen aufbauen kann, die Agenten helfen, sich im Laufe der Zeit zu verbessern, selbst wenn Werkzeuge, Modelle und Pipelines sich weiterentwickeln. Dieser Vortrag richtet sich an Ingenieure und Entwickler, die über Demos hinausgehen und lernen möchten, wie man Agentensysteme produktionsbereit macht. Über den Referenten Adonai Vera - Machine Learning Engineer & DevRel bei Voxel51. Mit über 7 Jahren Erfahrung im Aufbau von Computer Vision- und Machine Learning-Modellen mit TensorFlow, Docker, und OpenCV. Training-freie Entfernung von Objekten und ihren assoziierten Effekten in Videos Ich werde unsere aktuelle Arbeit, Object-WIPER, präsentieren, die sich darauf konzentriert, Objekte und deren assoziierte Effekte aus Videos zu entfernen. Anstatt Modelle für jede Bearbeitungsaufgabe feinzujustieren, nutzt unsere Methode die Vorwissen von vortrainierten Text-zu-Video-Modellen, um die Entfernung von Objekten und Effekten auf eine trainingsfreie Weise durchzuführen. Darüber hinaus kuratieren wir eine reale Benchmark für assoziierte Effekte und eine Bewertungsmetrik für eine realistischere Beurteilung der Videoobjektentfernung. Über den Referenten Saksham Singh Kushwaha ist Kandidat an der UT Dallas mit Forschungsinteressen in audio-visuellem Lernen, räumlichem Audio und Computer Vision. Ich habe meinen Master-Abschluss von der NYU und meinen Bachelor-Abschluss vom IIT Delhi erhalten. Modelle in Systeme umwandeln: Funktionierende KI-Architektur Dieser Vortrag untersucht, was es wirklich braucht, um „intelligente Systeme“ in der chaotischen, risikobehafteten Realität von Produktionsumgebungen zum Laufen zu bringen – nicht nur in Demos oder Pilotprojekten. Die meisten KI-Initiativen scheitern nicht, weil die Algorithmen schwach sind, sondern weil das umgebende System nicht darauf ausgelegt ist, Unsicherheit, Wandel und operationale Anforderungen zu bewältigen. Die Sitzung zeigt, wie man die Anliegen des Bauens und Verbesserns von Modellen von deren Nutzung im Tagesgeschäft trennt und wie man einen stabilen Kern von Regeln, Sicherheit und Geschäftsbedeutung schafft, rund um den sich intelligentere Komponenten entwickeln können. Anstatt KI als ein magisches Add-On zu betrachten, wird der Vortrag sie als eine Fähigkeit darstellen, die im Jargon, den Workflows und den Verantwortlichkeiten der Organisation verankert sein muss. Es wird gezeigt, wie man diesen Kern gestaltet, sodass neue Modelle, Werkzeuge und Datenquellen ohne Vertrauensverlust eingestöpselt, verglichen und ersetzt werden können. Die Teilnehmer werden mit einem klaren mentalen Modell und einer Reihe praktischer Designideen für die Umwandlung cleverer Prototypen in robuste, verständliche und anpassbare intelligente Systeme, auf die sich Menschen vor Ort verlassen können, nach Hause gehen. Über den Referenten Dr. Nikita Golovko ist ein erfahrener Lösungsarchitekt mit über 16 Jahren Erfahrung in der Gestaltung skalierbarer, sicherer und kosteneffizienter Softwarearchitekturen für industrielle und geschäftskritische Systeme.
Tools, die bei der Veranstaltung verwendet werden
OpenAI
TensorFlow
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
