
Відкритий код у генерації відео: моделі дифузії та трансформерів - AI Build & Learn
Опис
Ласкаво просимо на AI Build & Learn, щотижневий AI-інженерний стрім, де ми обираємо нову тему та вчимось, будуючи разом. Ця подія присвячена генерації відео з використанням AI, продовжуючи з того місця, де зупинилася подія з генерацією зображень. Як і у випадку із зображеннями, ми не зобов'язуємося до жодної єдиної моделі — ми дослідимо кілька з них і подивимось, наскільки далеко просунулись варіанти з відкритим кодом. Основна увага приділяється відкритому коду, але комерційні моделі (Sora, Runway та інші) також можуть бути розглянуті, якщо ви хочете порівняти. Більшість актуальних відеомоделей базується на тих же дифузійних основах, що й генерація зображень, розширених у часі та все частіше використовуютьтрансформер/DiT як основу. Ми спробуємо кілька відкритих моделей текст-у-відео та зображення-у-відео і обговоримо практичні компроміси: якість, тривалість кліпу, швидкість та вимоги до апаратного забезпечення. Декілька речей, які варто дослідити, щоб почати: Моделі з відкритим кодом: * Wan 2.2 (Alibaba Tongyi): універсальна модель MoE: текст-у-відео, зображення-у-відео та редагування в одному * HunyuanVideo (Tencent): висока кінематографічна / фотореалістична якість * LTX-Video / LTX-2 (Lightricks): швидка модель; ~5с кліп за менше ніж хвилину на одному GPU * CogVideoX (Zhipu / THUDM): найкращий у слідуванні детальним багаторазовим запитам * Mochi 1 (Genmo): модель, відзначена за плавність та зв'язність руху * Stable Video Diffusion (Stability AI): рання модель зображення-у-відео, все ще широко використовується Інструменти: * Hugging Face Diffusers: відеопотоки: https://github.com/huggingface/diffusers * ComfyUI: вузлові робочі процеси (також популярні для відео): https://github.com/comfyanonymous/ComfyUI Ресурси * GitHub: https://github.com/sagecodes/ai-build-and-learn * Календар подій: https://luma.com/ai-builders-and-learners * Slack (обговорюйте протягом тижня): https://slack.flyte.org/ * Ведучий: Седж Елліот: https://www.linkedin.com/in/sageelliott/ У цьому стрімі * Введення в тему * Обговорення спільноти * Практичні приклади Спільний виклик (довільно) Спробуйте витратити 30–90 хвилин протягом тижня на навчання або створення чогось, пов’язаного з темою, а потім поділіться тим, над чим ви працюєте, у Slack. Примітка про Flyte / Union Ви можете побачити використання Flyte в деяких демонстраціях. Flyte — це платформа оркестрації AI з відкритим кодом, що підтримується Union (де я працюю) для створення масштабованих, тривалих і спостережних AI-робочих процесів. Ви не повинні використовувати Flyte для участі. * Union: https://www.union.ai/ * Flyte: https://flyte.org/ Залиште коментар з ідеями для майбутніх тем (агенти, RAG, MLOps, робототехніка, фреймворки та інше).
Інструменти, що будуть використовуватись на події
Hugging Face
Місце проведення
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.
