En bref
Le Prompt Caching est une fonction qui stocke l'état traité d'une portion répétée de prompt, pour que les requêtes suivantes la réutilisent au lieu de repayer son traitement. Quand de nombreuses requêtes partagent le même long début - un gros System Prompt, des définitions d'outils ou un document que vous interrogez sans cesse -, le caching laisse le modèle sauter le recalcul, ce qui réduit à la fois les coûts et la latence. Dans l'API Claude par exemple, une lecture de cache coûte environ un dixième du prix d'Input normal, une remise d'environ 90 pour cent sur la portion cachée.
Comment fonctionne le Prompt Caching
Vous marquez un point de votre prompt comme cache breakpoint. Le fournisseur stocke l'état encodé de tout ce qui précède ce point, et la requête suivante qui commence par exactement les mêmes octets lit dans le cache au lieu de recalculer. Le hit doit être exact : si ne serait-ce qu'un token diffère au début, c'est un cache miss et vous payez plein tarif. L'ordre compte aussi, car le prompt est haché comme Tools, puis System Prompt, puis Messages.
- Placez le contenu stable et répété devant (Tools, System Prompt, longs documents).
- Marquez ensuite un cache breakpoint ; le début jusque-là est mis en cache.
- Une requête ultérieure au début identique lit le cache à moindre coût.
Ce que cela coûte et économise
Il y a un petit surcoût pour écrire le cache et une grosse économie pour le lire. Dans l'API Claude, une écriture de cache coûte environ 1,25 fois l'Input normal pour une durée de vie de 5 minutes (ou 2 fois pour 1 heure), tandis qu'une lecture de cache coûte environ 0,1 fois l'Input, une économie d'environ 90 pour cent. Le cache est éphémère, avec une courte durée de vie qui se réinitialise à chaque lecture, donc une conversation active garde son cache chaud sans repayer le coût d'écriture.
Quand l'utiliser
Le Prompt Caching se paie chaque fois que vous réutilisez un grand début stable sur de nombreux appels : un long System Prompt, un jeu fixe de définitions d'outils, un document de connaissances ou un chat multi-étapes où le contexte initial reste identique. Il n'aide pas pour les prompts uniques qui ne se répètent jamais. Parce que l'économie ne vaut que pour le début inchangé, structurez vos prompts pour que les parties constantes viennent en premier et les parties variables en dernier.
