Salta al contenuto
AImpact
IT EN
Addestramento Avanzato Anche noto come: MoD · Mixed Denoising Objectives

Mixture of Denoisers

Una strategia di pretraining (UL2, Google 2022) che addestra un singolo modello su molteplici obiettivi di denoising simultaneamente: language modeling left-to-right, predizione di span (span masking stile BERT con lunghezze e corruzioni variabili) e prefix language modeling. Unifica i punti di forza del pretraining stile GPT e stile T5. Il modello impara quando usare ciascuna modalità grazie a un token sentinella che ne segnala il tipo.

CondividiLinkedInX

In pratica

Un ricercatore che vuole un modello flessibile sia per completamento che per question answering può usare UL2 o un checkpoint Flan-UL2 senza dover scegliere tra architettura encoder-decoder (T5) e decoder-only (GPT). In pratica, il token sentinella `[S2S]`, `[NLU]`, o `[NLG]` va preposto al prompt per attivare la modalità corretta — un dettaglio che impatta significativamente le performance e viene spesso omesso causando risultati scadenti.

Termini collegati

Visto in azione

112 voci che lo citano
  1. Meta rilascia Llama 4.1: tre modelli MoE open source con finestra da 10 milioni di token
    Pietra miliare
  2. Google I/O 2026: Gemini Ultra 3, Project Astra live, Veo 3.2 e contesto da 2 milioni di token
    Alto
  3. Anthropic lancia Claude Fable 5: nuova famiglia di modelli oltre la linea 4.x
    Pietra miliare
  4. Voice AI realtime: latenza sotto-secondo e multilingue diventano la norma
    Medio
  5. Atlas Electric di Boston Dynamics: modello fondazionale per la manipolazione addestrato su 10 milioni di ore robot
    Alto
  6. Mistral lancia Devstral Small: modello di coding da 7B che gira su GPU consumer
    Medio
  7. MCP a 18 mesi: l'ecosistema dei server raggiunge la massa critica
    Alto
  8. Foundation model per robotica generale: nuovo step verso il "GPT della manipolazione"
    Alto
  9. Mistral Small 4: tre modelli (reasoning + vision + coding) fusi in un solo open weight
    Alto
  10. Groq lancia GroqCloud 2.0: LPU Gen3, 2000 token/sec e data center europeo a Francoforte
    Medio
  11. Nano Banana 2: Google rifà il modello d'immagine virale puntando a coerenza e testo
    Medio
  12. DeepSeek rilascia Janus Pro: un solo modello per capire e generare immagini
    Alto
  13. Gemini 3 Pro e Flash: Google rilancia la sfida frontier
    Alto
  14. Alibaba lancia Qwen2.5-VL 72B: il miglior modello multimodale open source batte GPT-4o
    Pietra miliare
  15. OpenAI lancia o3-mini: ragionamento avanzato al costo minimo
    Alto
  16. MCP ecosystem 2025: Inspector, UI, registry, e adozione cross-vendor
    Alto
  17. Claude Haiku 4.5: il modello piccolo che eguaglia Sonnet 4 di maggio
    Medio
  18. Runway Gen-4: video AI con personaggi coerenti tra scene multiple
    Alto
  19. Cline: l'agente coding open-source VS Code separa Plan e Act
    Medio
  20. Apollo Research: i frontier model 'schemano' in eval — paper pubblicato
    Alto
← Tutti i termini