In pratica
Claude e GPT-4 leggono immagini, Gemini gestisce video, alcuni modelli parlano in voce. Per chi costruisce prodotti significa poter analizzare foto di scontrini, screenshot, grafici senza un OCR separato. Attenzione: l'input visivo costa più token.
Termini collegati
Visto in azione
30 voci che lo citano- Pietra miliareMeta rilascia Llama 4.1: tre modelli MoE open source con finestra da 10 milioni di token
- AltoGoogle I/O 2026: Gemini Ultra 3, Project Astra live, Veo 3.2 e contesto da 2 milioni di token
- AltoMistral Small 4: tre modelli (reasoning + vision + coding) fusi in un solo open weight
- MedioNano Banana 2: Google rifà il modello d'immagine virale puntando a coerenza e testo
- AltoDeepSeek rilascia Janus Pro: un solo modello per capire e generare immagini
- AltoGemini 3 Pro e Flash: Google rilancia la sfida frontier
- Pietra miliareAlibaba lancia Qwen2.5-VL 72B: il miglior modello multimodale open source batte GPT-4o
- AltoOllama 1.0: prima versione stabile con multimodal, tool calling e Windows GA
- MedioOllama supporto nativo modelli vision: VLM locali con un comando
- AltoKimi VL Thinking (Moonshot AI): primo modello visivo open con ragionamento a catena di pensiero via RL
- AltoLlama 4: Meta passa a MoE e multimodale nativo, ma la community accoglie con freddezza
- AltoGemini 2.0 Flash Thinking: ragionamento multimodale con chain-of-thought visivo
- AltoGemini 2.0 Flash GA: Google porta il modello veloce e multimodale in produzione
- MedioSmolVLM2 (HuggingFace): VLM da 2.2B per video e immagini su hardware consumer
- Pietra miliareGemini 2.0 Flash: multimodale nativo con output audio e immagini
- Pietra miliareGemini 2.0 Flash: Google apre 'l'era agentica' e mostra Astra/Mariner/Jules
- MedioPixtral: Mistral porta la visione nei modelli open europei
- AltoLlama 3.2: Meta porta visione e edge ai modelli aperti
- MedioAgno (ex Phidata): framework agente leggero, multimodale e 10x più veloce
- Pietra miliareGoogle Gemini 1.0: multimodale nativo in tre taglie