Calculadora de latencia de inferencia
Datos de entrada
| Tiempo hasta el primer token | 200 ms |
|---|---|
| Tiempo por token de salida | 20 ms |
| Tokens de salida | 500 |
Calculadora de latencia de inferencia
Estima el tiempo de respuesta de extremo a extremo de una generación en streaming de un LLM a partir del tiempo hasta el primer token, el tiempo por token de salida y el número de tokens de salida.
Datos de entrada
Perfil de servicio
Resultados
Introduce un valor para ver los resultados.
Detalles
La latencia de inferencia
La latencia de inferencia es el tiempo que un usuario espera para que un modelo de lenguaje responda. En una generación en streaming consta de dos partes diferenciadas: la pausa inicial antes de que aparezca cualquier texto y el ritmo estable de tokens que sigue. Esta calculadora combina ambas con la longitud de la respuesta para estimar el tiempo de respuesta de extremo a extremo y el rendimiento que experimenta realmente una única solicitud.
Tiempo hasta el primer token y tiempo por token de salida
Dos mediciones describen un endpoint de streaming. El tiempo hasta el primer token (TTFT, ) es el retardo desde el envío de la solicitud hasta ver el primer token. Abarca la lectura del prompt, la construcción de la caché de atención para cada token del prompt —la fase de prellenado, limitada por el cómputo— y la decodificación de un token. Los prompts largos lo alargan. El tiempo por token de salida (TPOT, ), también llamado latencia entre tokens, es el intervalo entre cada token posterior durante la fase de decodificación. La decodificación está limitada por el ancho de banda de memoria: cada nuevo token lee una vez el conjunto completo de pesos del modelo, de modo que esta cifra se mantiene aproximadamente constante y su recíproco es la velocidad de generación estable en tokens por segundo.
La fórmula
El primer token ya está incluido en el tiempo hasta el primer token, así que cada uno de los tokens restantes añade un intervalo entre tokens:
Tv=tttft+(Nout−1)ttpot=TNoutdonde es el número de tokens de salida, es el tiempo de respuesta total y es el rendimiento global. El término menos uno mantiene exacto el recuento; en respuestas largas apenas cambia el resultado.
Ejemplo resuelto
Supóngase un endpoint que reporta un tiempo hasta el primer token de 200 ms y un tiempo por token de salida de 20 ms —una velocidad de generación estable de 50 tokens por segundo— y un modelo que produce una respuesta de 500 tokens:
Tv=0.2+(500−1)×0.02=0.2+9.98=10.18 s=10.18500≈49.1 tokens/sLa respuesta tarda alrededor de diez segundos, y el rendimiento global de 49,1 tokens por segundo queda justo por debajo de los 50 tokens por segundo brutos porque el retardo fijo del primer token se reparte a lo largo de toda la respuesta. La diferencia entre ambas cifras se reduce en respuestas largas y se amplía en las cortas, donde domina la pausa de arranque.
Reducción de la latencia
El tiempo hasta el primer token responde a prompts más cortos, al almacenamiento en caché del prompt y a un hardware de prellenado más rápido. El tiempo por token de salida responde a un mayor ancho de banda de memoria, a la cuantización y a técnicas como la decodificación especulativa, que emiten más de un token por paso del modelo. Dado que el tiempo total crece con cada token generado, limitar la longitud máxima de salida suele ser la palanca más directa en aplicaciones interactivas. Para explorar cómo la aceptación del modelo borrador modifica la cifra por token, véase la Calculadora de aceleración por decodificación especulativa, y para modelar la capacidad a nivel de flota véase la Calculadora de tokens efectivos por segundo.
Preguntas frecuentes (FAQ)
¿Qué diferencia hay entre el tiempo hasta el primer token y el tiempo por token de salida?
El tiempo hasta el primer token (TTFT) mide la espera inicial: el modelo lee todo el prompt, llena la caché de atención y emite el primer token. El tiempo por token de salida (TPOT), o latencia entre tokens, mide la cadencia estable posterior, cuando cada nuevo token solo necesita un paso de decodificación.
El TTFT crece con la longitud del prompt y está dominado por la fase de prellenado, intensiva en cómputo, mientras que el TPOT lo determina el ancho de banda de memoria durante la decodificación y se mantiene aproximadamente constante por token.
¿Por qué la fórmula multiplica por los tokens de salida menos uno?
El primer token ya está contabilizado dentro del tiempo hasta el primer token, de modo que solo los tokens restantes añaden un retardo entre tokens. Una respuesta de 500 tokens añade, por tanto, 499 intervalos entre tokens después del primero. En respuestas largas la diferencia entre multiplicar por el recuento y por el recuento menos uno es pequeña, pero la forma con el menos uno es exacta.
¿Cómo se puede reducir la latencia de servicio?
El tiempo hasta el primer token disminuye con prompts más cortos, el almacenamiento en caché del prompt y un hardware de prellenado más rápido; el tiempo por token de salida disminuye con un mayor ancho de banda de memoria, la cuantización o la decodificación especulativa. Limitar la longitud máxima de salida suele ser la palanca más sencilla, ya que el tiempo total crece con cada token generado.
Aviso legal
Los resultados suponen un único flujo ininterrumpido con latencia constante por token. Los sistemas de servicio reales varían con el agrupamiento (batching), las colas, el tránsito de red y la carga, por lo que conviene tratar la cifra como una estimación de planificación y no como una garantía de nivel de servicio.