
Генерация видео с открытым исходным кодом: модели диффузии и трансформеров - AI Build & Learn
Описание
Добро пожаловать на AI Build & Learn, еженедельный поток инженерии ИИ, где мы выбираем новую тему и обучаемся, строя вместе. Это событие посвящено генерации видео с помощью ИИ, продолжая с того места, где остановилось событие по генерации изображений. Как и в случае с изображениями, нет единой модели, к которой мы привязаны — мы исследуем несколько моделей и увидим, как далеко продвинулись опции с открытым исходным кодом. Основное внимание уделяется открытию исходному коду, но коммерческие модели (Sora, Runway и другие) также можно использовать для сравнения. Большинство современных видео моделей основаны на тех же диффузионных основах, что и генерация изображений, расширенных по времени и все чаще использующих трансформеры/DiT в качестве основы. Мы попробуем несколько моделей текст-видео и изображение-видео с открытым исходным кодом и обсудим практические компромиссы: качество, длина клипа, скорость и аппаратные требования. Некоторые вещи, которые стоит узнать, чтобы начать: Модели с открытым исходным кодом: * Wan 2.2 (Alibaba Tongyi): универсальная модель MoE: текст-видео, изображение-видео и редактирование в одном * HunyuanVideo (Tencent): сильное кинематографическое/фотореалистичное качество * LTX-Video/LTX-2 (Lightricks): быстрый вариант; ~5 сек клип менее чем за минуту на одном GPU * CogVideoX (Zhipu/THUDM): лучше всего подходит для подробных многосоставных подсказок * Mochi 1 (Genmo): модель соответствия потока, известная своей плавной и связной анимацией * Stable Video Diffusion (Stability AI): ранняя модель изображение-видео, все еще широко используемая Инструменты: * Hugging Face Diffusers: видео-пайплайн: https://github.com/huggingface/diffusers * ComfyUI: основанные на узлах рабочие процессы (также популярные для видео): https://github.com/comfyanonymous/ComfyUI Ресурсы * GitHub: https://github.com/sagecodes/ai-build-and-learn * Календарь событий: https://luma.com/ai-builders-and-learners * Slack (обсуждение на неделе): https://slack.flyte.org/ * Ведущий: Сейдж Эллиот: https://www.linkedin.com/in/sageelliott/ В этом потоке * Введение в тему * Обсуждение в сообществе * Практические примеры Вызов для сообщества (по желанию) Попробуйте потратить 30–90 минут в течение недели на изучение или создание чего-либо, связанного с темой, а затем поделитесь тем, над чем вы работаете, в Slack. Примечание о Flyte/Union Вы можете увидеть, как Flyte используется в некоторых демонстрациях. Flyte — это платформа оркестрации ИИ с открытым исходным кодом, поддерживаемая Union (где я работаю) для создания масштабируемых, надежных и наблюдаемых рабочих процессов ИИ. Вам не нужно использовать Flyte для участия. * Union: https://www.union.ai/ * Flyte: https://flyte.org/ Оставьте комментарий с идеями для будущих тем (агенты, RAG, MLOps, робототехника, фреймворки и многое другое).
Инструменты, которые будут использоваться на событии
Hugging Face
Место проведения
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.
