In pratica
È il motore dietro ChatGPT, Claude, Gemini. Quando integri un LLM nel tuo prodotto paghi a token e ottieni un servizio che capisce e produce testo. La qualità dipende molto dal modello scelto e dal prompt che gli fornisci.
Termini collegati
Visto in azione
64 voci che lo citano- AltoMoonshot AI lancia Kimi K3: 2.800 miliardi di parametri, il più grande modello open-weight di sempre
- AltoSpaceXAI presenta Grok 4.5, modello di punta a 2/6 dollari per milione di token
- MedioMistral lancia Devstral Small: modello di coding da 7B che gira su GPU consumer
- AltoFigure AI: Figure 02 raggiunge l'autonomia completa nel magazzino senza supervisione umana
- MedioLocal AI 2025: Ollama, MLX LM, Apple Foundation Models triplicano la velocità
- MedioPrivate LLM: modelli fino a 7B direttamente su iPhone e Mac, completamente offline
- MediovLLM v0.7: chunked prefill default e v1 engine ridisegnato
- MedioOllama 0.9.0: arriva il supporto ai modelli con thinking
- AltoNVIDIA NIM 1.0: inferenza LLM containerizzata con API OpenAI-compatibile
- MedioWebLLM e LLM in WASM: inferenza LLM nel browser tramite WebGPU senza server
- MedioContinuous Batching per LLM Serving: survey e stato dell'arte di Orca, vLLM, SGLang, TGI
- AltoDeepMind: 60+ casi di Specification Gaming nei LLM documentati
- MedioFlashInfer 0.2: libreria attention per LLM serving con paged KV cache e RoPE fusion
- AltoDisaggregazione prefill/decode: GPU separate per TTFT basso e alto throughput
- AltoKV Cache Quantization FP8/INT8: doppia la densità di utenti per GPU
- AltoAnythingLLM 1.0: lo stack RAG locale completo per uso enterprise
- MedioLLM Compressor: toolkit unificato per quantizzazione e sparsità con integrazione vLLM nativa
- MedioCyberSecEval 2: benchmark Meta per la sicurezza degli LLM
- MedioDify 0.7: workflow agentici visivi con RAG integrato e 10+ LLM
- MedioDrEureka: LLM automatizza il trasferimento simulazione-reale senza tuning manuale