OpenAI annuncia o3 — 87.5% su ARC-AGI riaccende il dibattito AGI
In una frase o3 raggiunge l'87.5% su ARC-AGI (sopra la soglia umana dell'85%), risolve problemi di matematica competitiva e scienza PhD. Il compute scaling a $2.000/task riaccende il dibattito sui tempi AGI.
OpenAI ha svelato il suo modello di ragionamento più potente, chiamato o3, e i risultati hanno causato un genuino fermento nella comunità di ricerca AI. Sul benchmark ARC-AGI — un test progettato per misurare l'intelligenza fluida e resistere alla memorizzazione — o3 ha ottenuto l'87.5%, sopra la media umana dell'85%. Può anche risolvere problemi di matematica a livello competitivo e rispondere a domande scientifiche di livello dottorale. Il problema è che alla massima potenza, eseguire un singolo task difficile può costare circa duemila dollari. È stato annunciato anche o3-mini, versione più piccola ed economica. Questi risultati hanno innescato un dibattito acceso: questo significa che l'AI ha raggiunto l'intelligenza generale umana?
Aziende
OpenAI
Tool
o3, o3-mini
Tag
Fonti