Salta al contenuto
AImpact
IT EN
Alto AI multimodale · 1 min lettura

DeepSeek rilascia Janus Pro: un solo modello per capire e generare immagini

In una frase Janus Pro è un modello multimodale unificato da 7 miliardi di parametri che comprende immagini e le genera da testo, superando DALL-E 3 e Stable Diffusion 3 sul benchmark GenEval. È open source e gira localmente.

Da rivedere Fonte ufficiale
CondividiLinkedInX
Livello di lettura

Fino a oggi, se volevi un'IA capace di analizzare un'immagine e allo stesso tempo crearne una nuova a partire da una descrizione testuale, dovevi usare due modelli separati. DeepSeek ha cambiato le carte in tavola con Janus Pro: un unico modello da 7 miliardi di parametri che fa entrambe le cose, e le fa bene.

Sul benchmark GenEval, che misura la qualità della generazione di immagini, Janus Pro supera sia DALL-E 3 di OpenAI sia Stable Diffusion 3 di Stability AI. Ma non è solo un generatore di immagini: è anche un ottimo modello visione-linguaggio, capace di rispondere a domande su foto, descrivere scene, leggere testi nelle immagini e ragionare su contenuti visivi.

Il tutto pesa 7 miliardi di parametri, una dimensione gestibile per chi ha hardware moderno. E cosa rende tutto questo ancora più interessante? È completamente open source. Chiunque può scaricarlo, eseguirlo localmente sul proprio computer senza mandare dati a server esterni, modificarlo e adattarlo alle proprie esigenze.

Per ricercatori e sviluppatori questo è un punto di svolta: un modello unificato riduce la complessità delle pipeline AI, abbassa i costi e apre la strada a applicazioni multimodali avanzate che prima richiedevano infrastrutture molto più pesanti.

Aziende

DeepSeek

Tool

Janus Pro

Tag

DeepSeekMultimodalImage GenerationVision Language Model

Fonti