Calcul d’amortissement de prompt système
Données
| Tokens du prompt système | 1 200 |
|---|---|
| Nombre d’appels | 1 000 |
| Prix en entrée (par million de tokens) | 3 $ |
| Remise sur lecture en cache | 90 % |
Calcul d’amortissement de prompt système
Estime ce que la mise en cache des prompts économise sur un long prompt système renvoyé à chaque appel d’un LLM. Compare le coût non mis en cache de la répétition du préfixe au coût réduit de la lecture en cache.
Données
Prompt système
Tarification et mise en cache
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Amortissement du prompt système
L’amortissement du prompt système est la pratique consistant à répartir le coût d’un préfixe de prompt fixe sur de nombreux appels au lieu de le payer intégralement à chacun. Un prompt système — les instructions, le persona et le contexte stable qui précèdent le message de l’utilisateur — est renvoyé à chaque requête, car le modèle ne conserve rien entre les appels. Sans intervention, mille requêtes paient ce préfixe mille fois. La mise en cache des prompts stocke le préfixe une fois et sert aux requêtes ultérieures une copie à tarif réduit, de sorte que le coût fixe est amorti sur le volume d’appels. Ce calculateur oppose les totaux avec et sans cache et indique l’économie obtenue.
Pourquoi le prompt se répète
Un modèle est sans état : chaque appel est indépendant, et tout ce que le modèle doit connaître doit figurer dans l’entrée de cet appel. Un long prompt système n’est donc pas un coût d’installation unique mais une taxe par appel, facturée au tarif des tokens d’entrée à chaque fois. Plus le prompt est long et plus il est envoyé souvent, plus la part de la facture qu’il consomme est grande — ce qui est précisément la condition dans laquelle la mise en cache rapporte le plus.
Comment la mise en cache modifie le calcul
Au premier appel, le fournisseur écrit le préfixe dans un cache, facturé à peu près au tarif d’entrée normal. Chaque appel ultérieur qui réutilise le même préfixe le relit avec une forte remise — souvent de l’ordre d’un dixième du tarif standard. Le préfixe répété est ainsi facturé au tarif du cache pour toutes les requêtes sauf la première.
La formule
Pour un prompt système de tokens à un prix d’entrée par million, le coût non mis en cache d’un envoi unique et le total non mis en cache sur appels sont
CcallCu=106tsysp=Ccall⋅nAvec une remise sur lecture en cache , chaque lecture en cache coûte , et le total avec cache paie le préfixe complet une fois au premier appel plus une lecture à tarif réduit à chaque appel :
Cc=Ccall(1−d)n+Ccall,Csave=Cu−CcExemple chiffré
Prenons un prompt système de 2 400 tokens à un prix d’entrée de $3 par million, envoyé sur 6 000 appels avec une remise de 90 % sur la lecture en cache. Le coût par appel non mis en cache est
Ccall=1062400×3=$0,0072de sorte que le total non mis en cache est
Cu=0,0072×6000=$43,20Une lecture en cache coûte 0{,}0072 \times (1 - 0{,}90) = \0{,}00072$, ce qui donne un total avec cache
Cc=0,00072×6000+0,0072=4,32+0,0072=$4,33L’économie est de 43{,}20 - 4{,}33 = \38{,}87$, soit une réduction d’environ 90 % de la part du prompt système dans la facture. La remise ne s’applique qu’au préfixe fixe ; le message utilisateur variable de chaque appel est facturé normalement dans les deux cas.
Remarques et variantes
Le modèle suppose que le préfixe est stable et réutilisé pendant que le cache est chaud. Les caches expirent après une période d’inactivité, de sorte que des appels très espacés peuvent repayer le coût d’écriture ; les longueurs minimales pour la mise en cache et la tarification exacte de l’écriture varient selon le fournisseur. Un prompt court ou un faible nombre d’appels laisse peu à amortir. L’économie est la plus grande pour un prompt long, stable et appelé fréquemment sur une courte fenêtre.
Application
Ce calculateur se concentre sur le préfixe du prompt système. Pour modéliser la mise en cache sur un mélange quelconque de tokens d’entrée avec et sans cache au sein d’un même appel, voir le Calculateur d'économies du cache d'invite. Pour chiffrer l’usage de tokens par appel dont ces valeurs sont tirées, voir le Calculateur de coût en jetons.
Questions fréquentes (FAQ)
Que signifie amortir un prompt système ?
Un prompt système est un préfixe fixe renvoyé à chaque appel ; sans mise en cache, son coût en entrée se répète intégralement à chaque requête — mille appels paient le prompt mille fois.
L’amortir consiste à payer pour stocker le prompt une seule fois, puis à réutiliser cette copie stockée à un tarif réduit, de sorte que le coût fixe se répartit finement sur le volume d’appels au lieu d’être répété au prix fort. Plus le prompt est long et plus le nombre d’appels est élevé, plus il y a à amortir.
Comment la mise en cache des prompts réduit-elle le coût ?
Au premier appel, le fournisseur écrit le préfixe du prompt dans un cache et le facture au tarif d’entrée normal, ou presque. À chaque appel ultérieur qui réutilise le même préfixe, la portion mise en cache est relue avec une forte remise — souvent de l’ordre d’un dixième du tarif standard.
Le préfixe répété est donc facturé au tarif du cache pour toutes les requêtes sauf la première, et c’est de là que vient l’économie. Le modèle traite toujours la partie variable de chaque prompt au tarif normal.
Quand la mise en cache n’en vaut-elle pas la peine ?
La mise en cache est rentable lorsque le même préfixe est réutilisé souvent et rapidement. Un prompt court offre peu à amortir, et l’économie reste faible en valeur absolue.
Les caches expirent aussi après une période d’inactivité, de sorte que des appels très espacés peuvent chacun payer le coût d’écriture sans bénéficier d’une lecture. Et si le préfixe change d’un appel à l’autre — instructions différentes ou contexte tournant — il n’y a aucun bloc stable à mettre en cache. La mise en cache aide le plus avec un prompt long, stable et appelé fréquemment.
Mentions légales
Il s’agit d’un modèle simplifié : les coûts d’écriture en cache, les fenêtres d’expiration et les longueurs minimales pour la mise en cache varient selon le fournisseur et sont approximés ici. Les prix publiés et les taux de remise évoluent dans le temps. Vérifiez les tarifs en vigueur, les conditions de mise en cache et le nombre exact de tokens auprès de votre fournisseur avant de vous fier à un chiffre pour la facturation.