Calculadora de sobrecoste de tokens por function calling
Datos de entrada
| Número de herramientas | 5 |
|---|---|
| Tokens por herramienta | 80 |
| Número de llamadas | 1.000 |
| Precio de entrada (por 1 M de tokens) | 3 $ |
| Tokens de envoltorio | 16 |
Calculadora de sobrecoste de tokens por function calling
Estima los tokens de entrada y el coste de exponer herramientas a un LLM. Las definiciones de las herramientas — nombre, descripción y esquema de parámetros — se envían en cada llamada, se use o no una herramienta.
Datos de entrada
Herramientas
Volumen y precios
Tokens de envoltorio
Resultados
Introduce un valor para ver los resultados.
Detalles
Sobrecoste de tokens por function calling
El sobrecoste de tokens por function calling es el coste, en el lado de la entrada, de poner herramientas a disposición de un modelo de lenguaje grande. Para que el modelo decida si invoca una herramienta y cómo hacerlo, el proveedor serializa la definición de cada herramienta — su nombre, una descripción en lenguaje natural y un esquema JSON de sus parámetros — dentro del prompt que el modelo lee. Esas definiciones están compuestas de tokens y se envían en cada solicitud, se acabe usando una herramienta o no. Esta calculadora aísla ese sobrecoste fijo por llamada y el coste recurrente que produce a lo largo de un volumen de llamadas.
Por qué las herramientas se facturan en cada llamada
Un modelo no conserva estado entre solicitudes: no recuerda nada de una llamada a la siguiente, por lo que las herramientas que puede usar deben describirse de nuevo cada vez. No existe forma de registrar una herramienta una sola vez y referirse a ella de manera económica más adelante — la definición completa viaja en la entrada de cada llamada. Una solicitud en la que el modelo responde directamente, sin invocar nada, paga igualmente por las definiciones, porque se suministraron para que la opción existiera. El coste, por tanto, escala con el número de herramientas expuestas y con la extensión de sus esquemas, multiplicado por la frecuencia con la que se llama al modelo.
La fórmula
Con herramientas a tokens cada una y tokens de envoltorio que enmarcan el bloque de herramientas, el sobrecoste por llamada es
tcall=m⋅ttool+twA lo largo de llamadas, el sobrecoste total y su coste a un precio de entrada por millón de tokens son
TC=tcall⋅n=106TpLa división entre convierte la tarifa por millón en una tarifa por token. Las definiciones de herramientas las lee el modelo, así que se facturan a la tarifa de entrada, que suele ser el menor de los dos precios publicados.
Ejemplo resuelto
Considérese un agente que expone 14 herramientas cuyas definiciones promedian 120 tokens cada una, con 18 tokens de envoltorio que enmarcan el bloque. El sobrecoste por llamada es
tcall=14×120+18=1698 tokensEjecutado en 25,000 llamadas a un precio de entrada de $3 por millón de tokens, el coste del sobrecoste es
TC=1698×25000=42450000 tokens=10642450000×3=$127,35Esos $127,35 se gastan antes de contar ningún mensaje del usuario ni respuesta del modelo — solo pagan por describir las herramientas en cada solicitud. Enrutar el agente para que exponga únicamente el puñado de herramientas pertinentes a cada tarea, en lugar de las 14, reduciría esta cifra varias veces.
Notas y variaciones
La cifra por herramienta depende en gran medida de la riqueza con que se describe cada una: las descripciones de parámetros detalladas y los muchos campos opcionales inflan el esquema, mientras que una definición escueta se mantiene compacta. El sobrecoste medido aquí es exclusivamente el bloque de herramientas; los tokens de la conversación y los argumentos de llamada que el modelo emite son algo aparte. El almacenamiento en caché de prompts puede reducir el coste repetido cuando el bloque de herramientas se mantiene estable entre llamadas, ya que una lectura en caché se factura a una tarifa reducida.
Aplicación
El sobrecoste por function calling recae en el lado de la entrada de la factura. Su contrapartida del lado de la salida — la estructura JSON que el modelo escribe de vuelta cuando se le restringe a un esquema — la trata la Calculadora de sobrecarga de salida estructurada (JSON). Para calcular el uso de tokens por llamada subyacente del que se extrae este sobrecoste, véase la Calculadora de coste de tokens.
Preguntas frecuentes (FAQ)
¿Por qué las herramientas cuestan tokens?
Para que el modelo pueda invocar una herramienta, debe saber que la herramienta existe y cómo usarla. El proveedor serializa el nombre de cada herramienta, su descripción en lenguaje natural y el esquema JSON de sus parámetros dentro del prompt que lee el modelo.
Ese bloque serializado está compuesto de tokens y se procesa en el lado de entrada de cada solicitud, de modo que las herramientas expuestas se suman al recuento de tokens de entrada antes de que el modelo escriba una sola palabra de respuesta.
¿Cómo se puede reducir el sobrecoste de las herramientas?
Conviene exponer solo las herramientas pertinentes a la tarea actual en lugar del catálogo completo en cada llamada — enrutar o filtrar el conjunto de herramientas es la palanca de mayor efecto. Recortar descripciones de parámetros extensas y eliminar parámetros opcionales de uso poco frecuente reduce cada definición.
Como el sobrecoste se paga por llamada, el ahorro se acumula en cargas de trabajo de alto volumen, y un conjunto de herramientas más reducido también suele mejorar la precisión del modelo al seleccionar la herramienta.
¿Las definiciones de herramientas se envían en cada llamada?
Sí. El modelo no conserva estado entre solicitudes, por lo que las definiciones de herramientas se incluyen en la entrada de cada llamada en lugar de registrarse una sola vez. Incluso una solicitud en la que el modelo responde directamente sin invocar ninguna herramienta paga igualmente por las definiciones, porque se enviaron para que la opción estuviera disponible.
El almacenamiento en caché de prompts puede reducir el coste repetido cuando el bloque de herramientas se mantiene estable entre llamadas, ya que una lectura en caché se factura a una tarifa reducida.
Aviso legal
Las cifras de tokens son estimaciones que dependen del tokenizador del modelo y de cómo el proveedor serializa las definiciones de herramientas. Los precios publicados cambian con el tiempo y pueden no incluir descuentos por caché o por procesamiento por lotes. Conviene verificar las tarifas vigentes y los recuentos exactos de tokens con el proveedor antes de utilizar una cifra para la facturación.
Recomendaciones
Calculadora de sobrecarga de salida estructurada (JSON)
Estima los tokens de salida y el coste adicionales de pedir a un LLM que devuelva JSON conforme a un esquema (schema): los nombres de campo, los marcadores de tipo y la puntuación que rodean a los valores propiamente dichos.
Calculadora de coste de tokens
Calcula el coste de una sola llamada a la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del número de tokens de entrada y de salida y de los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.