Salta al contenuto
AImpact
IT EN
Modelli Intermedio Anche noto come: Mixture of Experts · Miscela di esperti

MoE

/em-oh-ee/

Architettura in cui il modello è diviso in molti sotto-modelli specializzati ('esperti') e per ogni token viene attivata solo una piccola parte di essi.

CondividiLinkedInX

In pratica

Permette di avere modelli da centinaia di miliardi di parametri ma con il costo di inferenza di uno molto più piccolo. Mixtral, DeepSeek e GPT-4 lo usano. In pratica per chi usa l'API non cambia nulla, ma spiega rapporti qualità/prezzo sorprendenti.

Termini collegati

Visto in azione

24 voci che lo citano
  1. Z.ai apre GLM-5.3-Flash: il modello segreto Ox Alpha era suo, MIT e 320B MoE
    Alto
  2. Alibaba pubblica i pesi di Qwen3.8-Max: il primo modello di classe Max scaricabile
    Alto
  3. Moonshot AI lancia Kimi K3: 2.800 miliardi di parametri, il più grande modello open-weight di sempre
    Alto
  4. Thinking Machines Lab rilascia Inkling: MoE multimodale da 975B parametri con pesi aperti Apache 2.0
    Alto
  5. Meta rilascia Llama 4.1: tre modelli MoE open source con finestra da 10 milioni di token
    Pietra miliare
  6. DeepSeek V4 Preview: 1.6T parametri, contesto 1M e open weight in due taglie
    Pietra miliare
  7. Alibaba rilascia Qwen 3.5: MoE sparso multimodale, 262K di contesto, Apache 2.0
    Alto
  8. DeepSeek R2: la cinese rilancia il modello reasoning open-weight
    Alto
  9. Llama 4 Scout: 109B MoE multimodale con 10M di context e vision SOTA
    Alto
  10. Qwen 3: Alibaba rilascia una famiglia open weight da 0.6B a 235B con thinking nativo
    Alto
  11. Llama 4: Meta passa a MoE e multimodale nativo, ma la community accoglie con freddezza
    Alto
  12. DeepSeek-V3-0324: l'update silenzioso che mette in difficoltà il vendor lock-in
    Medio
  13. DeepSeek-V3: qualità GPT-4o a $0.55/M token tramite MLA e pipeline FP8
    Alto
  14. DeepSeek-V3: la Cina rilascia un modello frontier open a costo basso scioccante
    Pietra miliare
  15. DeepSeek-Coder-V2: qualita GPT-4 Turbo su coding con pesi aperti
    Alto
  16. DeepSeek-V2: Multi-head Latent Attention e il primo MoE cinese open ad alta efficienza
    Alto
  17. Mixtral 8x22B: il MoE Apache 2.0 di Mistral con 39B attivi
    Alto
  18. Snowflake Arctic: MoE 480B totale / 17B attivi, SOTA enterprise SQL
    Medio
  19. DBRX: il MoE open di Databricks da 132B totali e 36B attivi
    Medio
  20. Gemini 1.5 Pro: 1 milione di token nel contesto
    Alto
← Tutti i termini