Mixture of Denoisers
Una strategia di pretraining (UL2, Google 2022) che addestra un singolo modello su molteplici obiettivi di denoising simultaneamente: language modeling left-to-right, predizione di span (span masking stile BERT con lunghezze e corruzioni variabili) e prefix language modeling. Unifica i punti di forza del pretraining stile GPT e stile T5. Il modello impara quando usare ciascuna modalità grazie a un token sentinella che ne segnala il tipo.
In pratica
Un ricercatore che vuole un modello flessibile sia per completamento che per question answering può usare UL2 o un checkpoint Flan-UL2 senza dover scegliere tra architettura encoder-decoder (T5) e decoder-only (GPT). In pratica, il token sentinella `[S2S]`, `[NLU]`, o `[NLG]` va preposto al prompt per attivare la modalità corretta — un dettaglio che impatta significativamente le performance e viene spesso omesso causando risultati scadenti.
Termini collegati
Visto in azione
112 voci che lo citano- Pietra miliareMeta rilascia Llama 4.1: tre modelli MoE open source con finestra da 10 milioni di token
- AltoGoogle I/O 2026: Gemini Ultra 3, Project Astra live, Veo 3.2 e contesto da 2 milioni di token
- Pietra miliareAnthropic lancia Claude Fable 5: nuova famiglia di modelli oltre la linea 4.x
- MedioVoice AI realtime: latenza sotto-secondo e multilingue diventano la norma
- AltoAtlas Electric di Boston Dynamics: modello fondazionale per la manipolazione addestrato su 10 milioni di ore robot
- MedioMistral lancia Devstral Small: modello di coding da 7B che gira su GPU consumer
- AltoMCP a 18 mesi: l'ecosistema dei server raggiunge la massa critica
- AltoFoundation model per robotica generale: nuovo step verso il "GPT della manipolazione"
- AltoMistral Small 4: tre modelli (reasoning + vision + coding) fusi in un solo open weight
- MedioGroq lancia GroqCloud 2.0: LPU Gen3, 2000 token/sec e data center europeo a Francoforte
- MedioNano Banana 2: Google rifà il modello d'immagine virale puntando a coerenza e testo
- AltoDeepSeek rilascia Janus Pro: un solo modello per capire e generare immagini
- AltoGemini 3 Pro e Flash: Google rilancia la sfida frontier
- Pietra miliareAlibaba lancia Qwen2.5-VL 72B: il miglior modello multimodale open source batte GPT-4o
- AltoOpenAI lancia o3-mini: ragionamento avanzato al costo minimo
- AltoMCP ecosystem 2025: Inspector, UI, registry, e adozione cross-vendor
- MedioClaude Haiku 4.5: il modello piccolo che eguaglia Sonnet 4 di maggio
- AltoRunway Gen-4: video AI con personaggi coerenti tra scene multiple
- MedioCline: l'agente coding open-source VS Code separa Plan e Act
- AltoApollo Research: i frontier model 'schemano' in eval — paper pubblicato