
Generowanie Wideo z Otwartym Źródłem: Modele Dyfuzji i Transformatorów - AI Buduj i Ucz się
Opis
Witaj w AI Buduj i Ucz się, cotygodniowym strumieniu inżynierii AI, gdzie wybieramy nowy temat i uczymy się, budując razem. To wydarzenie dotyczy generowania wideo z AI, kontynuując od miejsca, w którym zakończyło się wydarzenie związane z generowaniem obrazów. Podobnie jak w przypadku obrazów, nie ma jednego modelu, do którego jesteśmy zobowiązani — zbadamy kilka i zobaczymy, jak daleko dotarły opcje otwartego źródła. Otwarty kod źródłowy jest w centrum uwagi, ale modele komercyjne (Sora, Runway i inne) są również dozwolone, jeśli chcesz porównać. Większość aktualnych modeli wideo opiera się na tych samych fundamentach dyfuzji, co generowanie obrazów, rozwijanych w czasie i coraz częściej wykorzystujących transformator/DiT jako podstawę. Spróbujemy kilku modeli otwartego źródła do tekstu-wideo i obrazu-wideo i omówimy praktyczne kompromisy: jakość, długość klipu, szybkość i wymagania dotyczące sprzętu. Oto kilka rzeczy do sprawdzenia, aby zacząć: Modele otwartego źródła: * Wan 2.2 (Alibaba Tongyi): wszechstronny model MoE: tekst-wideo, obraz-wideo i edytowanie w jednym * HunyuanVideo (Tencent): mocna jakość kinowa / fotorealistyczna * LTX-Video / LTX-2 (Lightricks): szybki model; ~5s klip w mniej niż minutę na pojedynczym GPU * CogVideoX (Zhipu / THUDM): najlepszy w śledzeniu szczegółowych, wieloczęściowych wskazówek * Mochi 1 (Genmo): model dopasowujący przepływ znany z płynnego, spójnego ruchu * Stable Video Diffusion (Stability AI): wcześniejsze obrazy do wideo, nadal szeroko stosowane Narzędzia: * Hugging Face Diffusers: pipeline'y wideo: https://github.com/huggingface/diffusers * ComfyUI: oparte na węzłach przepływy pracy (popularne również w wideo): https://github.com/comfyanonymous/ComfyUI Zasoby * GitHub: https://github.com/sagecodes/ai-build-and-learn * Kalendarz Wydarzeń: https://luma.com/ai-builders-and-learners * Slack (Dyskusja w trakcie tygodnia): https://slack.flyte.org/ * Prowadzi Sage Elliott: https://www.linkedin.com\/in\/sageelliott\/ W tym strumieniu * Wprowadzenie do tematu * Dyskusja Społeczności * Praktyczne przykłady Wyzwanie społeczności (opcjonalne) Spróbuj poświęcić 30–90 minut w ciągu tygodnia na naukę lub budowanie czegoś związanego z tematem, a następnie podziel się tym, co robisz, na Slacku. Uwaga na temat Flyte / Union Możesz zobaczyć Flyte używane w niektórych demonstracjach. Flyte to platforma orkiestracji AI z otwartym kodem źródłowym utrzymywana przez Union (gdzie pracuję) do budowania skalowalnych, trwałych i obserwowalnych przepływów pracy AI. Nie musisz używać Flyte, aby uczestniczyć. * Union: https://www.union.ai\/ * Flyte: https://flyte.org/ Zostaw komentarz z pomysłami na przyszłe tematy (agenci, RAG, MLOps, robotyka, ramy i inne).
Narzędzia, które będą używane podczas wydarzeń
Hugging Face
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.
