Cerebras lancia CS-3: 4 trilioni di transistor e Llama 4 Maverick a 1500 token/sec su singolo chip
In una frase Cerebras presenta il CS-3, il motore a scala wafer di terza generazione con 44 GB di SRAM on-chip, capace di eseguire Llama 4 Maverick a 1500 token al secondo su un singolo chip. Il primo deployment commerciale avviene nel cloud AI degli Emirati Arabi Uniti.
Immagina di dover spostare una tonnellata di sabbia da un punto all'altro. Puoi farlo con centinaia di carriole (come fa una GPU tradizionale, che sposta dati da memorie esterne ogni volta che lavora), oppure puoi costruire una gigantesca vasca direttamente sotto la sabbia, evitando qualsiasi trasferimento inutile. Cerebras ha scelto la seconda strada.
Il CS-3 è un chip delle dimensioni di un intero wafer di silicio — il disco grezzo che normalmente viene tagliato in centinaia di chip separati. Invece di tagliarlo, Cerebras lo usa tutto intero. Il risultato è un processore enorme, con 4 trilioni di transistor e 44 gigabyte di memoria SRAM direttamente sul chip, senza bisogno di accedere a RAM esterna.
Questo approccio cambia tutto sul fronte della velocità di inferenza, ovvero la fase in cui un modello AI risponde a una domanda. Con il CS-3, Llama 4 Maverick — uno dei modelli linguistici più avanzati disponibili — risponde generando 1500 token al secondo su un singolo chip. Per confronto, la maggior parte dei sistemi GPU di fascia alta arriva a 100-300 token al secondo su configurazioni multi-GPU molto più costose.
Il primo cliente commerciale è il cloud AI degli Emirati Arabi Uniti, a conferma che questa tecnologia interessa soprattutto grandi organizzazioni che necessitano di risposte AI ultra-rapide in tempo reale — dai chatbot aziendali ai sistemi di analisi finanziaria, fino alle applicazioni scientifiche.
Per il momento il CS-3 non è pensato per uso domestico o PMI: si tratta di infrastruttura enterprise e di ricerca. Ma il suo impatto indiretto si sentirà anche negli anni a venire, perché dimostra che l'architettura GPU non è l'unica via percorribile per l'AI ad alte prestazioni.
Aziende
Cerebras
Tool
CS-3 Cerebras Inference
Tag
Fonti