Calculadora de Amortização de Prompt de Sistema
Entradas
| Tokens do Prompt de Sistema | 1.200 |
|---|---|
| Número de Chamadas | 1.000 |
| Preço de Entrada (por 1M de tokens) | 3 $ |
| Desconto de Leitura em Cache | 90 % |
Calculadora de Amortização de Prompt de Sistema
Estime quanto o cache de prompt economiza em um prompt de sistema longo que é reenviado a cada chamada do LLM. Compare o custo sem cache de repetir o prefixo com o custo reduzido com cache.
Entradas
Prompt de Sistema
Preços e Cache
Resultados
Insira um valor para ver os resultados.
Detalhes
Amortização de prompt de sistema
Amortização de prompt de sistema é a prática de diluir o custo de um prefixo de prompt fixo entre muitas chamadas, em vez de pagá-lo por inteiro em cada uma. Um prompt de sistema — as instruções, a persona e o contexto estável que precedem a mensagem do usuário — é reenviado a cada requisição, porque o modelo não retém nada entre as chamadas. Sem intervenção, mil requisições pagam por esse prefixo mil vezes. O cache de prompt armazena o prefixo uma vez e serve às requisições posteriores uma cópia com desconto, de modo que o custo fixo é amortizado ao longo do volume de chamadas. Esta calculadora contrasta os totais sem cache e com cache e informa a economia.
Por que o prompt recorre
Um modelo não tem estado: cada chamada é independente, e tudo o que o modelo precisa saber tem de estar presente na entrada daquela chamada. Um prompt de sistema longo, portanto, não é um custo de configuração único, mas um imposto por chamada, cobrado pela tarifa de tokens de entrada a cada vez. Quanto mais longo o prompt e mais frequentemente ele é enviado, maior a parcela da fatura que ele consome — que é exatamente a condição em que o cache rende mais.
Como o cache muda a aritmética
Na primeira chamada, o provedor escreve o prefixo em um cache, faturado a aproximadamente a tarifa normal de entrada. Cada chamada posterior que reutiliza o mesmo prefixo o lê de volta com um desconto acentuado — muitas vezes em torno de um décimo da tarifa padrão. O prefixo repetido é, assim, cobrado pela tarifa de cache em todas as requisições, exceto na primeira.
A fórmula
Com um prompt de sistema de tokens a um preço de entrada por milhão, o custo sem cache de enviá-lo uma vez e o total sem cache ao longo de chamadas são
CcallCu=106tsysp=Ccall⋅nCom um desconto de leitura em cache , cada leitura em cache custa , e o total com cache paga o prefixo completo uma vez na primeira chamada mais uma leitura com desconto em cada chamada:
Cc=Ccall(1−d)n+Ccall,Csave=Cu−CcExemplo resolvido
Considere um prompt de sistema de 2.400 tokens a um preço de entrada de $3 por milhão, enviado ao longo de 6.000 chamadas com um desconto de leitura em cache de 90%. O custo por chamada sem cache é
Ccall=1062400×3=$0.0072de modo que o total sem cache é
Cu=0.0072×6000=$43.20Uma leitura em cache custa 0.0072 \times (1 - 0.90) = \0.00072$, resultando em um total com cache
Cc=0.00072×6000+0.0072=4.32+0.0072=$4.33A economia é 43.20 - 4.33 = \38.87$, cerca de uma redução de 90% na parcela da fatura referente ao prompt de sistema. O desconto se aplica apenas ao prefixo fixo; a mensagem variável do usuário em cada chamada é faturada normalmente em ambos os casos.
Observações e variações
O modelo pressupõe que o prefixo é estável e reutilizado enquanto o cache está quente. Os caches expiram após um período de inatividade, de modo que chamadas muito espaçadas podem repagar o custo de escrita; os comprimentos mínimos para cache e o preço exato da escrita variam por provedor. Um prompt curto ou uma contagem de chamadas baixa deixa pouco a amortizar. A economia é maior para um prompt longo, estável e chamado com frequência em uma janela curta.
Aplicação
Esta calculadora se concentra no prefixo do prompt de sistema. Para modelar o cache em uma mistura arbitrária de tokens de entrada com e sem cache dentro de uma única chamada, consulte a Calculadora de Economia com Cache de Prompt. Para precificar o uso de tokens por chamada subjacente do qual esses valores derivam, consulte a Calculadora de Custo por Token.
Perguntas frequentes (FAQ)
O que significa amortizar um prompt de sistema?
Um prompt de sistema é um prefixo fixo reenviado a cada chamada, de modo que, sem cache, seu custo de entrada recorre por inteiro em cada requisição — mil chamadas pagam pelo prompt mil vezes.
Amortizá-lo significa pagar para armazenar o prompt uma vez e depois reutilizar essa cópia armazenada a uma tarifa reduzida, de modo que o custo fixo seja diluído ao longo do volume de chamadas em vez de repetido a preço cheio. Quanto mais longo o prompt e maior a quantidade de chamadas, mais há a amortizar.
Como o cache de prompt reduz o custo?
Na primeira chamada, o provedor escreve o prefixo do prompt em um cache, faturando-o pela tarifa normal de entrada ou próximo dela. Em cada chamada posterior que reutiliza o mesmo prefixo, a parte em cache é lida de volta com um desconto acentuado — comumente em torno de um décimo da tarifa padrão.
O prefixo repetido é, portanto, cobrado pela tarifa de cache em todas as requisições, exceto na primeira, e é daí que vem a economia. O modelo ainda processa a parte variável de cada prompt pela tarifa normal.
Quando o cache não compensa?
O cache compensa quando o mesmo prefixo é reutilizado com frequência e em pouco tempo. Um prompt curto tem pouco a amortizar, então a economia é pequena em termos absolutos.
Os caches também expiram após um período de inatividade, de modo que chamadas muito espaçadas podem cada uma pagar o custo de escrita sem se beneficiar de uma leitura. E, se o prefixo muda entre as chamadas — instruções diferentes ou contexto rotativo —, não há um bloco estável para armazenar em cache. O cache ajuda mais com um prompt longo, estável e chamado com frequência.
Aviso legal
Este é um modelo simplificado: custos de escrita em cache, janelas de expiração e comprimentos mínimos para cache variam por provedor e são aproximados aqui. Os preços e as taxas de desconto divulgados mudam com o tempo. Confirme as tarifas atuais, os termos de cache e as contagens exatas de tokens com seu provedor antes de usar um valor para faturamento.