Black Forest Labs a récemment dévoilé Flux 3, un modèle multimodal de nouvelle génération capable de générer des vidéos de 20 secondes avec audio intégré en une seule opération. Ce modèle apprend simultanément à partir d’images, de vidéos et d’audios au sein d’une architecture unifiée, répondant ainsi au besoin de comprendre comment les objets s’assemblent, comment les choses se déplacent et comment les événements sonnent. (bfl.ai)
Flux 3 repose sur l’architecture Self-Flow, qui aligne efficacement la génération et la compréhension multimodales au sein d’un même modèle. Cette approche permet au modèle de produire des vidéos avec audio natif, garantissant que le son correspond à l’impact visuel et que le mouvement respecte les lois physiques. (bfl.ai)
En générant des vidéos de 20 secondes avec audio intégré en une seule opération, Flux 3 offre une solution efficace pour la création de contenu multimédia. Cette capacité est particulièrement utile pour les studios créatifs, les développeurs de jeux et les équipes de production cinématographique qui nécessitent des outils puissants pour produire rapidement des vidéos de haute qualité. (bfl.ai)
La sortie de Flux 3 marque une avancée significative dans le domaine de l’intelligence visuelle, en permettant une compréhension et une génération multimodales cohérentes au sein d’un seul modèle. Cette innovation ouvre de nouvelles perspectives pour la création de contenu et l’interaction avec des environnements physiques et numériques. (bfl.ai)
(bfl.ai)


