
Open-Source Videoerstellung: Diffusions- & Transformermodelle - AI Build & Learn
Beschreibung
Willkommen bei AI Build & Learn, einem wöchentlichen AI-Engineering-Stream, in dem wir ein neues Thema auswählen und gemeinsam lernen, indem wir bauen. Diese Veranstaltung dreht sich um die Videoerzeugung mit AI, und knüpft dort an, wo die Bildgenerierung abgeschlossen hat. Wie bei Bildern verpflichten wir uns nicht an ein einzelnes Modell – wir werden mehrere erkunden und sehen, wie weit die Open-Source-Optionen gekommen sind. Open Source steht im Fokus, aber kommerzielle Modelle (Sora, Runway und andere) sind fair game, wenn Sie vergleichen möchten. Die meisten aktuellen Videomodelle bauen auf denselben Diffusions-Grundlagen wie die Bildgenerierung auf, die über die Zeit erweitert werden und zunehmend Transformer/DiT-Architekturen nutzen. Wir werden einige Open-Source-Modelle für Text-zu-Video und Bild-zu-Video ausprobieren und die praktischen Abwägungen besprechen: Qualität, Cliplänge, Geschwindigkeit und Hardwareanforderungen. Einige Dinge, die Sie recherchieren können, um zu beginnen: Open-Source-Modelle: * Wan 2.2 (Alibaba Tongyi): vielseitiges MoE-Modell: Text-zu-Video, Bild-zu-Video und Bearbeitung in einem * HunyuanVideo (Tencent): starke cineastische / fotorealistische Qualität * LTX-Video / LTX-2 (Lightricks): das schnelle; ~5s Clip in weniger als einer Minute auf einer einzelnen GPU * CogVideoX (Zhipu / THUDM): am besten im Folgen detaillierter, mehrteiliger Aufforderungen * Mochi 1 (Genmo): fließendes Matching-Modell, bekannt für flüssige, kohärente Bewegungen * Stable Video Diffusion (Stability AI): früheres Bild-zu-Video, immer noch weit verbreitet Werkzeuge: * Hugging Face Diffusers: Videopipelines: https://github.com/huggingface/diffusers * ComfyUI: nodebasierte Workflows (auch beliebt für Video): https://github.com/comfyanonymous/ComfyUI Ressourcen * GitHub: https://github.com/sagecodes/ai-build-and-learn * Veranstaltungskalender: https://luma.com/ai-builders-and-learners * Slack (Diskussion während der Woche): https://slack.flyte.org/ * Veranstaltet von Sage Elliott: https://www.linkedin.com/in/sageelliott/ In diesem Stream * Einführung in das Thema * Gemeinschaftsdiskussion * Praktische Beispiele Gemeinschaftsherausforderung (optional) Versuchen Sie, 30–90 Minuten während der Woche damit zu verbringen, etwas zu lernen oder zu bauen, das mit dem Thema zu tun hat, und teilen Sie dann, woran Sie in Slack arbeiten. Hinweis zu Flyte / Union Sie werden möglicherweise Flyte in einigen Demos sehen. Flyte ist eine Open-Source-AI-Orchestrierungsplattform, die von Union (wo ich arbeite) gepflegt wird, um skalierbare, langlebige und beobachtbare AI-Workflows zu erstellen. Sie müssen Flyte nicht verwenden, um teilzunehmen. * Union: https://www.union.ai/ * Flyte: https://flyte.org/ Hinterlassen Sie einen Kommentar mit Ideen für zukünftige Themen (Agenten, RAG, MLOps, Robotik, Frameworks und mehr).
Tools, die bei der Veranstaltung verwendet werden
Hugging Face
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
