Black Forest Labs presenta FLUX 3: immagini, video, audio e azioni robotiche da un unico modello
In una frase Black Forest Labs lancia FLUX 3, un modello multimodale unificato che genera immagini, video fino a 20 secondi con audio nativo sincronizzato e — tramite la variante Action sviluppata con la startup di robotica mimic — predizione di azioni per robot. Video e Action in early access dal 23 luglio.
Finora i laboratori AI costruivano un modello per le immagini, uno per i video, uno per l'audio, magari uno per i robot. Black Forest Labs — il laboratorio tedesco fondato dai creatori di Stable Diffusion — ha preso la strada opposta: FLUX 3 è un unico cervello che ha imparato tutte queste cose insieme, da un solo set di pesi.
Il pezzo più appariscente è il video: clip fino a 20 secondi generate da testo, immagini o filmati esistenti, con l'audio che nasce già dentro la scena — dialoghi, effetti sonori, rumore ambientale sincronizzati, anche in più lingue. Si possono concatenare le clip mantenendo coerenti i personaggi, controllare le transizioni con fotogrammi chiave e costruire sequenze multi-inquadratura: mattoni da montaggio, non solo spezzoni.
La parte più inattesa però riguarda i robot. Insieme alla startup zurighese mimic, il laboratorio ha addestrato una variante chiamata FLUX-mimic che predice azioni per la manipolazione robotica: lo stesso modello che immagina come si muove il mondo in un video può suggerire a un braccio robotico come muoversi davvero. Secondo quanto riportato, la variante robotica è già in prova su linee di produzione Audi.
L'idea di fondo: chi capisce la fisica del mondo abbastanza bene da filmarla in modo credibile, la capisce abbastanza bene da agirci dentro. È la scommessa dei "world model", e FLUX 3 è tra i primi a metterla in un prodotto.
Aziende
Black Forest Labs, mimic
Tool
FLUX 3
Tag
Fonti