Calculadora de planificación de límites de tasa de LLM
Datos de entrada
| Tokens por minuto (TPM) | 2.000.000 |
|---|---|
| Solicitudes por minuto (RPM) | 10.000 |
| Tokens por solicitud | 2.000 |
| Latencia media de la solicitud (segundos) | 20 |
Calculadora de planificación de límites de tasa de LLM
Datos de entrada
Límites del proveedor
Carga de trabajo
Resultados
Introduce un valor para ver los resultados.
Detalles
El límite de tokens es el que restringe primero: el tope de tokens por minuto permite menos solicitudes que el tope de solicitudes por minuto. Para elevar el rendimiento conviene reducir los tokens por solicitud (mensajes más cortos, respuestas más pequeñas, caché de mensajes) o solicitar una asignación de TPM más alta.
Recomendaciones
Calculadora de coste mensual de LLM
Proyecta el coste recurrente de una carga de trabajo con la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del uso de tokens por llamada, el volumen diario de solicitudes y los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.
Calculadora de coste de tokens
Calcula el coste de una sola llamada a la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del número de tokens de entrada y de salida y de los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.