Salta al contenuto
AImpact
IT EN
Modelli Base Anche noto come: Multimodale

Multimodal

Modello capace di gestire più tipi di input e output insieme: testo, immagini, audio, video. Non solo lettura ma anche generazione di più formati.

CondividiLinkedInX

In pratica

Claude e GPT-4 leggono immagini, Gemini gestisce video, alcuni modelli parlano in voce. Per chi costruisce prodotti significa poter analizzare foto di scontrini, screenshot, grafici senza un OCR separato. Attenzione: l'input visivo costa più token.

Termini collegati

Visto in azione

32 voci che lo citano
  1. Z.ai apre GLM-5.3-Flash: il modello segreto Ox Alpha era suo, MIT e 320B MoE
    Alto
  2. Meta rilascia Llama 4.1: tre modelli MoE open source con finestra da 10 milioni di token
    Pietra miliare
  3. Google I/O 2026: Gemini Ultra 3, Project Astra live, Veo 3.2 e contesto da 2 milioni di token
    Alto
  4. Mistral Small 4: tre modelli (reasoning + vision + coding) fusi in un solo open weight
    Alto
  5. Nano Banana 2: Google rifà il modello d'immagine virale puntando a coerenza e testo
    Medio
  6. Alibaba rilascia Qwen 3.5: MoE sparso multimodale, 262K di contesto, Apache 2.0
    Alto
  7. DeepSeek rilascia Janus Pro: un solo modello per capire e generare immagini
    Alto
  8. Gemini 3 Pro e Flash: Google rilancia la sfida frontier
    Alto
  9. Alibaba lancia Qwen2.5-VL 72B: il miglior modello multimodale open source batte GPT-4o
    Pietra miliare
  10. Ollama 1.0: prima versione stabile con multimodal, tool calling e Windows GA
    Alto
  11. Ollama supporto nativo modelli vision: VLM locali con un comando
    Medio
  12. Kimi VL Thinking (Moonshot AI): primo modello visivo open con ragionamento a catena di pensiero via RL
    Alto
  13. Llama 4: Meta passa a MoE e multimodale nativo, ma la community accoglie con freddezza
    Alto
  14. Gemini 2.0 Flash Thinking: ragionamento multimodale con chain-of-thought visivo
    Alto
  15. Gemini 2.0 Flash GA: Google porta il modello veloce e multimodale in produzione
    Alto
  16. SmolVLM2 (HuggingFace): VLM da 2.2B per video e immagini su hardware consumer
    Medio
  17. Gemini 2.0 Flash: multimodale nativo con output audio e immagini
    Pietra miliare
  18. Gemini 2.0 Flash: Google apre 'l'era agentica' e mostra Astra/Mariner/Jules
    Pietra miliare
  19. Pixtral: Mistral porta la visione nei modelli open europei
    Medio
  20. Llama 3.2: Meta porta visione e edge ai modelli aperti
    Alto
← Tutti i termini