Calculadora de Sobrecarga de Tokens de Chamada de Funções
Entradas
| Número de Ferramentas | 5 |
|---|---|
| Tokens por Ferramenta | 80 |
| Número de Chamadas | 1.000 |
| Preço de Entrada (por 1M de tokens) | 3 $ |
| Tokens de Envoltório | 16 |
Calculadora de Sobrecarga de Tokens de Chamada de Funções
Estime os tokens de entrada e o custo de expor ferramentas a um LLM. As definições de ferramentas — nome, descrição e esquema de parâmetros — são enviadas a cada chamada, usando-se ou não uma ferramenta.
Entradas
Ferramentas
Volume e Preços
Tokens de Envoltório
Resultados
Insira um valor para ver os resultados.
Detalhes
Sobrecarga de tokens de chamada de funções
Sobrecarga de tokens de chamada de funções é o custo do lado da entrada de disponibilizar ferramentas a um modelo de linguagem grande. Para deixar o modelo decidir se e como chamar uma ferramenta, o provedor serializa a definição de cada ferramenta — seu nome, uma descrição em linguagem natural e um esquema JSON de seus parâmetros — no prompt que o modelo lê. Essas definições são feitas de tokens e são enviadas a cada requisição, usando-se ou não uma ferramenta ao final. Esta calculadora isola essa sobrecarga fixa por chamada e o custo recorrente que ela produz ao longo de um volume de chamadas.
Por que as ferramentas são faturadas a cada chamada
Um modelo não tem estado entre requisições: ele não lembra nada de uma chamada para a seguinte, então as ferramentas que ele pode usar têm de ser descritas de novo a cada vez. Não há como registrar uma ferramenta uma vez e referir-se a ela de forma barata depois — a definição completa viaja na entrada de cada chamada. Uma requisição em que o modelo responde diretamente, sem invocar nada, ainda paga pelas definições, porque elas foram fornecidas para que a opção existisse. O custo, portanto, cresce com o número de ferramentas expostas e a verbosidade de seus esquemas, multiplicado pela frequência com que você chama o modelo.
A fórmula
Com ferramentas a tokens cada e tokens de envoltório emoldurando o bloco de ferramentas, a sobrecarga por chamada é
tcall=m⋅ttool+twAo longo de chamadas, a sobrecarga total e seu custo a um preço de entrada por milhão de tokens são
TC=tcall⋅n=106TpA divisão por converte a cotação por milhão em uma tarifa por token. As definições de ferramentas são lidas pelo modelo, então são faturadas pela tarifa de entrada, em geral a menor entre os dois preços divulgados.
Exemplo resolvido
Considere um agente que expõe 14 ferramentas cujas definições têm em média 120 tokens cada, com 18 tokens de envoltório emoldurando o bloco. A sobrecarga por chamada é
tcall=14×120+18=1698 tokensExecutada ao longo de 25.000 chamadas a um preço de entrada de $3 por milhão de tokens, o custo da sobrecarga é
TC=1698×25000=42450000 tokens=10642450000×3=$127.35Esses $127,35 são gastos antes que qualquer mensagem do usuário ou resposta do modelo seja contada — pagam apenas para descrever as ferramentas em cada requisição. Rotear o agente para expor somente o punhado de ferramentas relevantes a cada tarefa, em vez de todas as 14, reduziria esse valor em várias vezes.
Observações e variações
O valor por ferramenta depende fortemente de quão ricamente cada ferramenta é descrita: descrições detalhadas de parâmetros e muitos campos opcionais inflam o esquema, enquanto uma definição concisa permanece compacta. A sobrecarga medida aqui é puramente o bloco de ferramentas; os tokens da conversa e quaisquer argumentos de chamada de ferramenta que o modelo emite são separados. O cache de prompt pode reduzir o custo repetido quando o bloco de ferramentas é estável entre as chamadas, já que uma leitura em cache é faturada a uma tarifa reduzida.
Aplicação
A sobrecarga de chamada de funções recai sobre o lado da entrada da fatura. Sua contrapartida do lado da saída — a estrutura JSON que o modelo escreve de volta quando restringido a um esquema — é tratada pela Calculadora de Sobrecarga de Saída Estruturada. Para precificar o uso de tokens por chamada subjacente do qual essa sobrecarga deriva, consulte a Calculadora de Custo por Token.
Perguntas frequentes (FAQ)
Por que as ferramentas custam tokens?
Para que o modelo chame uma ferramenta, ele precisa saber que ela existe e como usá-la. O provedor serializa o nome de cada ferramenta, sua descrição em linguagem natural e o esquema JSON de parâmetros no prompt que o modelo lê.
Esse bloco serializado é feito de tokens e é processado no lado da entrada de cada requisição, de modo que as ferramentas que você expõe se somam à contagem de tokens de entrada antes que o modelo escreva uma única palavra de resposta.
Como reduzir a sobrecarga das ferramentas?
Exponha apenas as ferramentas relevantes para a tarefa atual, em vez do catálogo inteiro a cada chamada — rotear ou filtrar o conjunto de ferramentas é a maior alavanca. Enxugar descrições de parâmetros verbosas e remover parâmetros opcionais raramente usados reduz cada definição.
Como a sobrecarga é paga por chamada, a economia se acumula em cargas de trabalho de alto volume, e um conjunto de ferramentas mais enxuto também tende a melhorar a precisão de seleção de ferramentas do modelo.
As definições de ferramentas são enviadas a cada chamada?
Sim. O modelo não tem estado entre requisições, então as definições de ferramentas são incluídas na entrada de cada chamada, e não registradas uma única vez. Mesmo uma requisição em que o modelo responde diretamente, sem invocar nenhuma ferramenta, ainda paga pelas definições, porque elas foram enviadas para que a opção estivesse disponível.
O cache de prompt pode reduzir o custo repetido quando o bloco de ferramentas é estável entre as chamadas, já que uma leitura em cache é faturada a uma tarifa reduzida.
Aviso legal
Os valores de tokens são estimativas que dependem do tokenizador do modelo e de como o provedor serializa as definições de ferramentas. Os preços divulgados mudam com o tempo e podem não incluir descontos de cache ou de lote. Confirme as tarifas atuais e as contagens exatas de tokens com seu provedor antes de usar um valor para faturamento.