Google lancia Veo 3.2: video 4K a 60fps con lip-sync nativo e audio integrato
In una frase Google DeepMind rilascia Veo 3.2, che porta la generazione video AI a 4K 60fps con sincronizzazione labiale nativa, coerenza multi-personaggio tra scene e audio generativo integrato, disponibile via Gemini API e Vertex AI.
Immagina di poter descrivere una scena a parole e ottenere in pochi minuti un video in altissima qualità, con persone che parlano in modo naturale, musica di sottofondo e suoni ambientali, tutto generato automaticamente da un sistema di intelligenza artificiale. Questo è quello che promette Google Veo 3.2.
La versione precedente di Veo aveva già impressionato molti, ma aveva alcuni limiti evidenti: i video erano spesso a bassa risoluzione, i personaggi cambiavano aspetto da una scena all'altra e le labbra non si muovevano in sincronia con il parlato. Veo 3.2 risolve tutti questi problemi in un colpo solo.
Con il nuovo modello è possibile generare video fino a 4K a 60 fotogrammi al secondo, una qualità paragonabile a quella di una produzione cinematografica professionale. Il sistema capisce chi sono i personaggi e li mantiene coerenti nel tempo: se nella prima scena c'è una donna con i capelli rossi, sarà la stessa in tutte le scene successive, senza trasformazioni strane. La sincronizzazione labiale significa che quando un personaggio parla, le labbra si muovono esattamente nel modo giusto, come in un film vero.
In aggiunta, Veo 3.2 genera automaticamente anche l'audio: dialoghi, effetti sonori e musica ambientale vengono creati insieme al video, senza bisogno di strumenti separati.
Chi può usarlo? Sviluppatori e aziende possono accedere al modello tramite l'API Gemini o la piattaforma cloud Vertex AI di Google. Il servizio si posiziona direttamente in competizione con Sora 2 di OpenAI, alzando ulteriormente il livello della corsa alla generazione video con l'AI.
Aziende
Google DeepMind
Tool
Veo 3.2, Vertex AI
Tag
Fonti