NVIDIA rilascia Nemotron-Labs-TwoTower, diffusion language model open-weight su backbone autoregressivo congelato
In una frase NVIDIA pubblica i pesi di Nemotron-Labs-TwoTower, un diffusion LM a due torri costruito sopra Nemotron-3-Nano-30B-A3B congelato: mantiene il 98,7% della qualità autoregressiva con throughput 2,42x.
Quasi tutti i modelli linguistici attuali scrivono il testo una parola alla volta, in sequenza, come una macchina da scrivere. I diffusion language model seguono invece l'approccio dei generatori di immagini: partono da una bozza rumorosa e la raffinano in parallelo, producendo molti token per ogni passaggio. Il vantaggio potenziale è la velocità; il problema storico è che la qualità del testo ne risentiva.
NVIDIA prova a prendere il meglio dei due mondi. Invece di addestrare un diffusion model da zero, TwoTower riusa un modello autoregressivo già addestrato (Nemotron-3-Nano-30B-A3B) e lo congela: una torre continua a leggere e comprendere il contesto come ha sempre fatto, mentre una seconda torre gemella, addestrata appositamente, genera il testo in parallelo con la tecnica della diffusione.
Il risultato pratico: secondo i numeri pubblicati, il modello conserva quasi tutta la qualità dell'originale (98,7%) ma produce testo con un throughput 2,42 volte superiore a parità di hardware. Per chi gestisce servizi di inferenza, la stessa GPU serve più del doppio delle richieste.
I pesi sono scaricabili liberamente da Hugging Face sotto la NVIDIA Nemotron Open Model License, quindi chiunque può verificarli, misurarli e integrarli nei propri stack. È un rilascio orientato alla ricerca più che al prodotto finito, ma indica una direzione precisa: rendere la generazione parallela un'opzione concreta anche per i modelli di testo.
Aziende
NVIDIA
Tool
Nemotron-Labs-TwoTower, Nemotron 3 Nano
Tag
Fonti