Questo calcolatore di costi LLM gratuito stima quanto ti costa far girare un grande modello di linguaggio in produzione. Scegli due modelli, inserisci i tuoi token di Input e di Output (o delle parole, che converte per te) e il tuo volume mensile di chiamate, e attiva il Prompt Caching e l'elaborazione in batch per vedere il risparmio. Mostra il costo per chiamata e al mese per i due modelli affiancati, sulla base dei prezzi di listino attuali del 2026, così tu possa stimare un budget o scegliere il modello più economico prima di scrivere una riga di codice. Tutto gira nel tuo browser: nessuna iscrizione, nessuna chiave API, niente lascia il tuo dispositivo.
Lo strumento
Informazioni su questo strumento
Come funzionano davvero i prezzi degli LLM
Quasi ogni API LLM fattura per token, non per richiesta, e indica il prezzo per milione di token. Un token è grosso modo quattro caratteri di testo inglese, quindi circa 750 parole fanno circa 1.000 token. Il tuo calcolo per una chiamata è semplicemente i token di Input inviati moltiplicati per il prezzo di Input più i token di Output prodotti moltiplicati per il prezzo di Output, riferiti ai tuoi veri numeri di token. Poiché i fornitori indicano per milione, il calcolatore qui sopra fa questa divisione per te e moltiplica per il tuo volume mensile per un vero costo mensile.
Perché Input e Output non costano uguale
I token di Output costano quasi sempre un multiplo dei token di Input, perché produrre testo è più intensivo in calcolo che leggerlo. Nei modelli Claude del 2026, l'Output vale per esempio cinque volte il prezzo di Input (circa USD 5 in Input e USD 25 in Output per milione di token per Opus, circa USD 3 e USD 15 per Sonnet, e circa USD 1 e USD 5 per Haiku). È per questo che un chatbot che dà risposte lunghe può costare molto più di un chatbot dalle risposte brevi, e perché ridurre la lunghezza dell'Output è spesso la più grande leva singola sulla tua fattura. Il calcolatore separa i due lati, così tu veda esattamente dove va il denaro.
Prompt Caching e sconti batch
Due funzioni possono ridurre drasticamente i tuoi costi, e gli interruttori qui sopra rappresentano le due. Il Prompt Caching riutilizza un grande inizio immutato (un System Prompt, definizioni di strumenti o documenti recuperati), così l'Input ripetuto sia fatturato a circa un decimo del prezzo di Input normale; tocca solo il lato Input, per questo il calcolatore sconta solo l'Input. L'elaborazione in batch esegue job non urgenti in asincrono a circa la metà del prezzo dei due lati, in cambio di un'elaborazione più lenta nel migliore dei casi. Se il tuo carico riutilizza contesto o tollera la latenza, questi due impostazioni contano spesso più della scelta del modello.
Scegliere il modello più economico che funziona ancora
Il modello più economico non è sempre la scelta migliore: un modello più debole che ha bisogno di tre riprese può costare più di un modello più forte che riesce al primo colpo. La via onesta è iniziare con il modello più piccolo che risolve la task in modo affidabile, misurare il suo vero consumo di token e salire di gamma solo quando la qualità lo esige chiaramente. Usa questo calcolatore con il nostro confronto Opus vs Sonnet vs Haiku e il nostro articolo sulla scelta del modello per adattare il modello alla task, e stima la fattura prima di impegnarti. Per grandi volumi, combina un modello di testa forte con un modello più economico per le sotto-task strette.
