Ce calculateur de coûts LLM gratuit estime ce que vous coûte l'exploitation d'un grand modèle de langage en production. Choisissez deux modèles, saisissez vos tokens d'Input et d'Output (ou des mots, qu'il convertit pour vous) et votre volume mensuel d'appels, et activez le Prompt Caching et le traitement par batch pour voir l'économie. Il affiche le coût par appel et par mois pour les deux modèles côte à côte, sur la base des prix catalogue actuels de 2026, pour que vous puissiez estimer un budget ou choisir le modèle le moins cher avant d'écrire une ligne de code. Tout tourne dans votre navigateur : aucune inscription, aucune clé d'API, rien ne quitte votre appareil.
L'outil
À propos de cet outil
Comment les prix des LLM fonctionnent vraiment
Presque toute API LLM facture par token, pas par requête, et indique le prix par million de tokens. Un token, c'est grosso modo quatre caractères de texte anglais, donc environ 750 mots font à peu près 1 000 tokens. Votre calcul pour un appel est simplement les tokens d'Input envoyés multipliés par le prix d'Input plus les tokens d'Output produits multipliés par le prix d'Output, ramenés à vos vrais nombres de tokens. Parce que les fournisseurs indiquent par million, le calculateur ci-dessus fait cette division pour vous et multiplie par votre volume mensuel pour un vrai coût mensuel.
Pourquoi Input et Output ne coûtent pas pareil
Les tokens d'Output coûtent presque toujours un multiple des tokens d'Input, car produire du texte est plus intensif en calcul que le lire. Chez les modèles Claude de 2026, l'Output vaut par exemple cinq fois le prix d'Input (environ USD 5 en Input et USD 25 en Output par million de tokens pour Opus, environ USD 3 et USD 15 pour Sonnet, et environ USD 1 et USD 5 pour Haiku). C'est pourquoi un chatbot qui donne de longues réponses peut coûter bien plus qu'un chatbot aux réponses courtes, et pourquoi réduire la longueur de l'Output est souvent le plus grand levier isolé sur votre facture. Le calculateur sépare les deux côtés, pour que vous voyiez exactement où va l'argent.
Prompt Caching et remises batch
Deux fonctions peuvent réduire drastiquement vos coûts, et les commutateurs ci-dessus représentent les deux. Le Prompt Caching réutilise un grand début inchangé (un System Prompt, des définitions d'outils ou des documents récupérés), pour que l'Input répété soit facturé à environ un dixième du prix d'Input normal ; il ne touche que le côté Input, c'est pourquoi le calculateur ne remise que l'Input. Le traitement par batch exécute des jobs non urgents en asynchrone à environ la moitié du prix des deux côtés, en échange d'un traitement plus lent au mieux. Si votre charge réutilise du contexte ou tolère la latence, ces deux réglages comptent souvent plus que le choix du modèle.
Choisir le modèle le moins cher qui fonctionne encore
Le modèle le moins cher n'est pas toujours le meilleur choix : un modèle plus faible qui a besoin de trois reprises peut coûter plus qu'un modèle plus fort qui réussit du premier coup. La voie honnête est de démarrer avec le plus petit modèle qui résout la tâche de façon fiable, de mesurer sa vraie consommation de tokens et de ne monter en gamme que lorsque la qualité l'exige clairement. Utilisez ce calculateur avec notre comparatif Opus vs Sonnet vs Haiku et notre article sur le choix de modèle pour ajuster le modèle à la tâche, et estimez la facture avant de vous engager. Pour du gros volume, combinez un modèle de tête fort avec un modèle moins cher pour les sous-tâches étroites.
