Calculadora de amortización del prompt de sistema
Datos de entrada
| Tokens del prompt de sistema | 1.200 |
|---|---|
| Número de llamadas | 1.000 |
| Precio de entrada (por 1M de tokens) | 3 $ |
| Descuento de lectura de caché | 90 % |
Calculadora de amortización del prompt de sistema
Estima cuánto ahorra el almacenamiento en caché de prompts sobre un prompt de sistema largo que se reenvía en cada llamada al LLM. Compara el coste sin caché de repetir el prefijo frente al coste rebajado con caché.
Datos de entrada
Prompt de sistema
Precio y caché
Resultados
Introduce un valor para ver los resultados.
Detalles
Amortización del prompt de sistema
La amortización del prompt de sistema es la práctica de repartir el coste de un prefijo fijo entre muchas llamadas en lugar de pagarlo por completo en cada una. Un prompt de sistema (las instrucciones, la persona y el contexto estable que preceden al mensaje del usuario) se reenvía en cada solicitud, porque el modelo no retiene nada entre llamadas. Sin intervención, mil solicitudes pagan ese prefijo mil veces. El almacenamiento en caché de prompts guarda el prefijo una vez y sirve a las solicitudes posteriores una copia rebajada, de modo que el coste fijo se amortiza a lo largo del volumen de llamadas. Esta calculadora contrasta los totales sin caché y con caché y comunica el ahorro.
Por qué se repite el prompt
Un modelo es sin estado: cada llamada es independiente, y todo lo que el modelo deba conocer ha de estar presente en la entrada de esa llamada. Un prompt de sistema largo no es, por tanto, un coste de configuración único, sino un impuesto por llamada, cobrado a la tarifa de tokens de entrada cada vez. Cuanto más largo es el prompt y más a menudo se envía, mayor es la parte de la factura que consume, que es precisamente la condición en la que la caché aporta más.
Cómo cambia la aritmética la caché
En la primera llamada el proveedor escribe el prefijo en una caché, facturado aproximadamente a la tarifa de entrada normal. Cada llamada posterior que reutiliza el mismo prefijo lo vuelve a leer con un fuerte descuento, a menudo alrededor de una décima parte de la tarifa estándar. El prefijo repetido se cobra así a la tarifa de caché en todas las solicitudes salvo la primera.
La fórmula
Con un prompt de sistema de tokens a un precio de entrada por millón, el coste sin caché de enviarlo una vez y el total sin caché a lo largo de llamadas son
CcallCu=106tsysp=Ccall⋅nCon un descuento de lectura de caché , cada lectura en caché cuesta , y el total con caché paga el prefijo completo una vez en la primera llamada más una lectura rebajada en cada llamada:
Cc=Ccall(1−d)n+Ccall,Csave=Cu−CcEjemplo resuelto
Considérese un prompt de sistema de 2400 tokens a un precio de entrada de $3 por millón, enviado a lo largo de 6000 llamadas con un descuento de lectura de caché del 90 %. El coste sin caché por llamada es
Ccall=1062400×3=$0,0072por lo que el total sin caché es
Cu=0,0072×6000=$43,20Una lectura en caché cuesta 0{,}0072 \times (1 - 0{,}90) = \0{,}00072$, lo que da un total con caché
Cc=0,00072×6000+0,0072=4,32+0,0072=$4,33El ahorro es 43{,}20 - 4{,}33 = \38{,}87$, aproximadamente una reducción del 90 % en la parte de la factura correspondiente al prompt de sistema. El descuento se aplica solo al prefijo fijo; el mensaje variable del usuario en cada llamada se factura con normalidad en ambos casos.
Notas y variaciones
El modelo supone que el prefijo es estable y se reutiliza mientras la caché está caliente. Las cachés caducan tras un periodo de inactividad, de modo que las llamadas muy espaciadas pueden volver a pagar el coste de escritura; las longitudes mínimas almacenables en caché y el precio exacto de escritura varían según el proveedor. Un prompt corto o un número bajo de llamadas dejan poco que amortizar. El ahorro es mayor para un prompt largo y estable llamado con frecuencia en una ventana breve.
Aplicación
Esta calculadora se centra en el prefijo del prompt de sistema. Para modelar la caché sobre una mezcla arbitraria de tokens de entrada en caché y sin caché dentro de una sola llamada, véase la Calculadora de ahorro por caché de mensajes. Para fijar el precio del uso de tokens por llamada subyacente del que proceden estas cifras, véase la Calculadora de coste de tokens.
Preguntas frecuentes (FAQ)
¿Qué significa amortizar un prompt de sistema?
Un prompt de sistema es un prefijo fijo que se reenvía en cada llamada, de modo que sin caché su coste de entrada se repite por completo en cada solicitud: mil llamadas pagan el prompt mil veces.
Amortizarlo significa pagar por almacenar el prompt una vez y luego reutilizar esa copia almacenada a una tarifa reducida, de manera que el coste fijo se reparte de forma fina entre el volumen de llamadas en lugar de repetirse a precio completo. Cuanto más largo es el prompt y mayor es el número de llamadas, más hay que amortizar.
¿Cómo reduce el coste el almacenamiento en caché de prompts?
En la primera llamada el proveedor escribe el prefijo del prompt en una caché y lo factura a la tarifa de entrada normal o cercana a ella. En cada llamada posterior que reutiliza el mismo prefijo, la parte en caché se vuelve a leer con un fuerte descuento, habitualmente alrededor de una décima parte de la tarifa estándar.
El prefijo repetido se cobra por tanto a la tarifa de caché en todas las solicitudes salvo la primera, que es de donde procede el ahorro. El modelo sigue procesando la parte variable de cada prompt a la tarifa normal.
¿Cuándo no compensa el almacenamiento en caché?
El almacenamiento en caché compensa cuando el mismo prefijo se reutiliza con frecuencia y pronto. Un prompt corto tiene poco que amortizar, por lo que el ahorro es pequeño en términos absolutos.
Las cachés también caducan tras un periodo de inactividad, de modo que las llamadas muy espaciadas pueden pagar cada una el coste de escritura sin beneficiarse de una lectura. Y si el prefijo cambia entre llamadas (instrucciones distintas o contexto rotativo) no hay un bloque estable que almacenar en caché. La caché ayuda más con un prompt largo, estable y llamado con frecuencia.
Aviso legal
Este es un modelo simplificado: los costes de escritura en caché, las ventanas de caducidad y las longitudes mínimas almacenables en caché varían según el proveedor y aquí se aproximan. Los precios publicados y las tasas de descuento cambian con el tiempo. Verifica las tarifas actuales, las condiciones de caché y los recuentos exactos de tokens con tu proveedor antes de basar una cifra de facturación en este resultado.
Recomendaciones
Calculadora de ahorro por caché de mensajes
Estima la reducción del coste de entrada que produce la caché de mensajes, en la que una parte de los tokens de entrada se sirve desde la caché a una tarifa con descuento y el resto se factura al precio de entrada completo.
Calculadora de coste de tokens
Calcula el coste de una sola llamada a la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del número de tokens de entrada y de salida y de los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.