DeepSeek testa V4-Flash-Vision-Exp: agenti multimodali a prezzo Flash
In una frase Il 21 agosto DeepSeek pubblica in API il modello sperimentale V4-Flash-Vision-Exp, variante multimodale di V4-Flash che aggiunge la visione: capacita agentiche su immagini e screenshot dichiarate vicine a Opus 4.8 di Anthropic, mantenendo la parita col testo di V4-Flash.
DeepSeek, il laboratorio cinese noto per i modelli potenti a prezzi bassissimi, ha messo a disposizione via API un modello sperimentale chiamato V4-Flash-Vision-Exp. La novita: il suo modello economico per il codice e gli agenti ora vede anche le immagini, quindi puo lavorare su screenshot, grafici e interfacce, non solo su testo.
Il punto interessante e cosa ci fa con quelle immagini. Non si limita a descriverle: le usa per agire. Un agente che vede lo schermo puo capire dove cliccare, leggere un grafico per rispondere a una domanda o correggere una interfaccia guardandola, avvicinandosi a quello che fanno i modelli di punta occidentali che costano molto di piu.
Bloomberg ha inquadrato il rilascio come un modello di prova pensato per rivaleggiare con Opus 4.8 di Anthropic sul terreno degli agenti multimodali. E un tassello del copione che DeepSeek ripete da due anni: prendere una capacita da modello premium e portarla nella fascia economica, costringendo i concorrenti a rivedere i prezzi. Trattandosi di una versione sperimentale, e pero presto per considerarla stabile per usi in produzione.
Aziende
DeepSeek
Tool
DeepSeek-V4-Flash-Vision-Exp
Tag
Fonti