Quando si usa un'API AI in un'app reale, si invia spesso lo stesso blocco di testo ogni volta: un lungo system prompt, un documento legale o un intero codebase. Senza caching, si paga per elaborare quel testo ogni singola volta. Anthropic aveva già introdotto il caching dei prompt, ma con una finestra temporale breve e senza supporto multi-turno. Questo aggiornamento risolve entrambi i problemi. La cache ora dura un'ora intera, sufficiente per la maggior parte delle sessioni utente e dei job in background. Supporta anche il caching multi-turno: lo stesso contesto in cache può servire più scambi consecutivi senza essere rielaborato. Il risparmio sui costi è notevole: i token in cache vengono fatturati a circa il 10% della tariffa normale, un taglio del 90%. Per le app enterprise che includono documenti lunghi o system prompt a ogni chiamata, si traduce in riduzioni significative della bolletta mensile.
Aziende
Anthropic
Tool
Claude API
Tag
Fonti