Salta al contenuto
AImpact
IT EN
Medio AI multimodale · 1 min lettura

DeepSeek testa V4-Flash-Vision-Exp: agenti multimodali a prezzo Flash

In una frase Il 21 agosto DeepSeek pubblica in API il modello sperimentale V4-Flash-Vision-Exp, variante multimodale di V4-Flash che aggiunge la visione: capacita agentiche su immagini e screenshot dichiarate vicine a Opus 4.8 di Anthropic, mantenendo la parita col testo di V4-Flash.

Da rivedere Fonte ufficiale
CondividiLinkedInX
Livello di lettura

DeepSeek, il laboratorio cinese noto per i modelli potenti a prezzi bassissimi, ha messo a disposizione via API un modello sperimentale chiamato V4-Flash-Vision-Exp. La novita: il suo modello economico per il codice e gli agenti ora vede anche le immagini, quindi puo lavorare su screenshot, grafici e interfacce, non solo su testo.

Il punto interessante e cosa ci fa con quelle immagini. Non si limita a descriverle: le usa per agire. Un agente che vede lo schermo puo capire dove cliccare, leggere un grafico per rispondere a una domanda o correggere una interfaccia guardandola, avvicinandosi a quello che fanno i modelli di punta occidentali che costano molto di piu.

Bloomberg ha inquadrato il rilascio come un modello di prova pensato per rivaleggiare con Opus 4.8 di Anthropic sul terreno degli agenti multimodali. E un tassello del copione che DeepSeek ripete da due anni: prendere una capacita da modello premium e portarla nella fascia economica, costringendo i concorrenti a rivedere i prezzi. Trattandosi di una versione sperimentale, e pero presto per considerarla stabile per usi in produzione.

Aziende

DeepSeek

Tool

DeepSeek-V4-Flash-Vision-Exp

Tag

DeepSeekVisionAgentsBenchmark

Fonti