
Génération de vidéo open-source : modèles de diffusion et de transformeurs - AI Build & Learn
Description
Bienvenue à AI Build & Learn, un flux hebdomadaire d'ingénierie IA où nous choisissons un nouveau sujet et apprenons en construisant ensemble. Cet événement concerne la génération de vidéo avec l'IA, en reprenant là où l'événement de génération d'images s'est arrêté. Comme pour les images, il n'y a pas de modèle unique auquel nous sommes engagés — nous explorerons plusieurs modèles et verrons jusqu'où les options open-source ont progressé. L'open-source est la priorité, mais les modèles commerciaux (Sora, Runway, et d'autres) sont également pertinents si vous souhaitez faire des comparaisons. La plupart des modèles vidéo actuels s'appuient sur les mêmes bases de diffusion que la génération d'images, étendues dans le temps et de plus en plus en utilisant des architectures de transformeur/DiT. Nous essaierons quelques modèles open-source de texte-à-vidéo et d'image-à-vidéo et discuterons des compromis pratiques : qualité, longueur de clip, vitesse et exigences matériels. Voici quelques éléments à consulter pour commencer : Modèles open-source : * Wan 2.2 (Alibaba Tongyi) : modèle MoE polyvalent : texte-à-vidéo, image-à-vidéo et édition en un * HunyuanVideo (Tencent) : qualité cinématographique / photoréaliste solide * LTX-Video / LTX-2 (Lightricks) : le rapide ; ~5s de clip en moins d'une minute sur un seul GPU * CogVideoX (Zhipu / THUDM) : le meilleur pour suivre des instructions détaillées et multiparties * Mochi 1 (Genmo) : modèle de correspondance de flux connu pour un mouvement fluide et cohérent * Stable Video Diffusion (Stability AI) : antérieur à l'image-à-vidéo, encore largement utilisé Outils : * Hugging Face Diffusers : pipelines vidéo : https://github.com/huggingface/diffusers * ComfyUI : flux de travaux basés sur des nœuds (populaire aussi pour la vidéo) : https://github.com/comfyanonymous/ComfyUI Ressources * GitHub : https://github.com/sagecodes/ai-build-and-learn * Calendrier des événements : https://luma.com/ai-builders-and-learners * Slack (discuss pendant la semaine) : https://slack.flyte.org/ * Hébergé par Sage Elliott : https://www.linkedin.com/in/sageelliott/ Dans ce flux * Introduction au sujet * Discussion communautaire * Exemples pratiques Défi communautaire (optionnel) Essayez de passer 30 à 90 minutes pendant la semaine à apprendre ou à construire quelque chose en rapport avec le sujet, puis partagez ce sur quoi vous travaillez sur Slack. Note sur Flyte / Union Vous pourriez voir Flyte utilisé dans certaines démonstrations. Flyte est une plateforme d'orchestration IA open-source maintenue par Union (où je travaille) pour construire des flux de travail IA évolutifs, durables et observables. Vous n'avez pas besoin d'utiliser Flyte pour participer. * Union : https://www.union.ai/ * Flyte : https://flyte.org/ Laissez un commentaire avec des idées pour futurs sujets (agents, RAG, MLOps, robotique, frameworks, etc.).
Outils qui seront utilisés lors de l`événement
Hugging Face
Lieu de l`événement
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.
