Salta al contenuto
AImpact
IT EN
Medio AI locale · 1 min lettura

Ollama 0.9: modelli multipli, GPU distribuite e API v2 per il runtime AI locale

In una frase Ollama 0.9 introduce il serving concorrente di piu modelli, la cache tra richieste, la distribuzione del carico su piu schede GPU e una REST API v2 con streaming JSON nativo.

Da rivedere Fonte ufficiale
CondividiLinkedInX
Livello di lettura

Immagina di avere una libreria dove, fino a ieri, potevi leggere un solo libro alla volta: dovevi posarlo sul banco, aspettare che il bibliotecario lo rimettesse a scaffale, e solo allora potevi chiederne un altro. Con Ollama 0.9 la libreria si trasforma: piu libri restano aperti contemporaneamente sul banco, pronti a essere consultati senza attese.

In termini pratici, questo significa che il tuo computer locale puo tenere in memoria piu modelli di intelligenza artificiale allo stesso tempo. Se stai usando un modello per scrivere codice e un altro per rispondere a domande in italiano, non devi piu aspettare che il primo venga scaricato dalla memoria prima di usare il secondo.

La novita della cache tra richieste e altrettanto utile: e come se il bibliotecario ricordasse esattamente dove avevi lasciato il segnalibro, invece di ricominciare a sfogliare il libro da capo ogni volta. Le risposte arrivano piu velocemente perche il modello conserva il contesto gia elaborato.

Chi ha piu schede video nel proprio computer (tipico nelle workstation di grafica o nei server di sviluppo) puo finalmente distribuire il lavoro su tutte, come avere piu operai invece di uno solo a trasportare casse pesanti. Il risultato e un aumento sensibile della velocita di elaborazione.

Infine, il nuovo installer per Windows e piu semplice da usare, e limage Docker e stata alleggerita, occupando meno spazio su disco. Ollama 0.9 e un passo importante per chi vuole usare AI potente direttamente sulla propria macchina, senza dipendere da servizi cloud.

Aziende

Ollama

Tool

Ollama, Docker

Tag

OllamaLocal LLMGPUDocker

Fonti