Salta al contenuto
AImpact
IT EN
Medio Voce & audio · 1 min lettura

Whisper large-v3-turbo in locale: 809M parametri, 8x più veloce, con whisper.cpp e faster-whisper

In una frase OpenAI rilascia large-v3-turbo: 809M parametri contro gli 1,55B di large-v3, ottenuti riducendo il decoder da 32 a 4 layer e rifinendo il modello per due epoche sulla sola trascrizione multilingue. Circa 8x più veloce e circa 6 GB di VRAM, con qualità vicina a large-v2 ma nessun supporto alla traduzione e un degrado marcato su thai e cantonese.

Verificato Fonte ufficiale
CondividiLinkedInX
Livello di lettura

Il 30 settembre 2024 OpenAI ha pubblicato una versione alleggerita del suo modello di trascrizione vocale: Whisper large-v3-turbo. Il problema che risolve è concreto — large-v3 era accurato ma lento, e trascrivere un'ora di riunione su un PC normale richiedeva tempi difficili da giustificare.

Il trucco è tutto nella struttura del modello. Whisper lavora in due fasi: prima "ascolta" l'audio (encoder), poi "scrive" il testo (decoder). OpenAI ha lasciato intatta la parte che ascolta e ha tagliato quella che scrive, portandola da 32 strati a 4 — gli stessi del modello più piccolo della famiglia — e poi ha rifinito il risultato per due passaggi di addestramento sui soli dati di trascrizione. Il modello passa da 1,55 miliardi a 809 milioni di parametri ed è circa otto volte più rapido, con circa 6 GB di memoria video necessari.

Il compromesso esiste ed è documentato. La qualità è paragonabile a quella della generazione precedente, large-v2, sulla maggior parte delle lingue, ma peggiora sensibilmente su thai e cantonese. E soprattutto: turbo non è stato addestrato sui dati di traduzione, quindi non serve per tradurre l'audio in un'altra lingua — solo per trascriverlo nella lingua in cui è parlato.

Per chi vuole tenere l'audio in casa (riunioni, chiamate, dettatura) è la variante che rende pratica la trascrizione locale: gira su una GPU consumer e non richiede alcun servizio esterno.

Aziende

OpenAI

Tool

Whisper large-v3-turbo, whisper.cpp, faster-whisper

Tag

Fonti