Alibaba lancia Qwen2.5-VL 72B: il miglior modello multimodale open source batte GPT-4o
In una frase Alibaba rilascia Qwen2.5-VL 72B con licenza Apache 2.0: supera GPT-4o su diversi benchmark multimodali e supporta documenti, grafici, video lunghi, OCR multilingua e azioni su interfacce UI.
Alibaba ha rilasciato Qwen2.5-VL 72B, un modello di intelligenza artificiale in grado di "vedere" e capire immagini, video, documenti e schermate di applicazioni. La notizia interessante è che si tratta di un modello completamente aperto (licenza Apache 2.0), il che significa che chiunque può scaricarlo, usarlo e modificarlo senza pagare nulla.
Cosa sa fare questo modello? Praticamente tutto quello che riguarda le immagini e i video: legge documenti scansionati in molte lingue, interpreta grafici e tabelle, analizza video fino a 20 minuti di durata, e può persino "usare" un'interfaccia grafica come farebbe un utente umano — cliccare bottoni, compilare moduli, navigare tra le schermate.
Il confronto con i modelli commerciali è il dato più sorprendente: su diversi test standard del settore, Qwen2.5-VL 72B supera GPT-4o di OpenAI, che fino a poco fa era considerato il punto di riferimento assoluto per i modelli multimodali.
Per chi usa strumenti come Ollama sul proprio computer, il modello è disponibile per essere eseguito in locale, anche se i 72 miliardi di parametri richiedono hardware potente (tipicamente una o più GPU da almeno 40-80 GB di VRAM totale).
Questo rilascio segna un momento importante per l'intelligenza artificiale open source: per la prima volta, un modello gratuito e aperto riesce a competere — e in certi casi battere — i migliori modelli a pagamento delle grandi aziende tecnologiche americane.
Aziende
Alibaba
Tool
Qwen2.5-VL, Ollama
Tag
Fonti