
La start-up allemande Black Forest Labs lance Flux 3, un modèle multimodal capable de générer par IA une vidéo d’une vingtaine de secondes. Après ses précédents modèles de text-to-image, la start-up allemande se lance dans la vidéo.
Black Forest Labs a élaboré Flux 3 sur le principe de “développer l’intelligence visuelle du monde réel “ en reposant sur une architecture unifiée d’images, de vidéos et d’audio. Les deux précédents modèles de la gamme Flux étaient confinés à la génération d’images, tandis que cette nouvelle version est le premier modèle de génération de vidéo public de la start-up.
Un modèle 2,8 fois plus rapide
La méthode d’entraînement du modèle est 2,8 fois plus rapide qu’une approche classique. Afin d’obtenir ce résultat, Flux 3 s’appuie sur Self-Flow, une méthode d’entraînement autosupervisé et propriétaire qui permet aux modèles d’apprendre la représentation et la génération simultanément. Selon Black Forest Labs, Flux 3 est capable de générer des vidéos, des images et de l’audio simultanément à partir d’un prompt et d’images et vidéos de référence. D’après l’entreprise, le modèle peut créer des vidéos d’une grande variété avec de l’audio jusqu’à 20 secondes en une seule génération.
En phase de test chez Audi
La start-up s’est rapidement associée à l’entreprise Mimic Robotics, une start-up suisse qui développe de la robotique humanoïde, afin de concevoir Flux-Mimic, un modèle de vidéo à action qui utilise le processus de prédiction vidéo de Flux 3 pour commander des bras robotisés. Une première version du modèle est actuellement testée sur les bras robotisés de la chaîne de production d’Audi, notamment sur l’assemblage de portières de SUV Q6 e-tron.
Flux 3 Image n’est pas disponible pour le moment, mais Flux 3 Vidéo est désormais disponible en accès anticipé.