Calculadora de Latência de Inferência
Entradas
| Tempo até o primeiro token | 200 ms |
|---|---|
| Tempo por token de saída | 20 ms |
| Tokens de saída | 500 |
Calculadora de Latência de Inferência
Estime o tempo de resposta de ponta a ponta de uma conclusão de LLM em streaming a partir do tempo até o primeiro token, do tempo por token de saída e do número de tokens de saída.
Entradas
Perfil de atendimento
Resultados
Insira um valor para ver os resultados.
Detalhes
Latência de inferência
A latência de inferência é o tempo que um usuário espera para um modelo de linguagem responder. Em uma conclusão por streaming ela tem duas partes distintas: a pausa inicial antes de qualquer texto aparecer e o ritmo constante de tokens que se segue. Esta calculadora combina ambas com o comprimento da resposta para estimar o tempo de resposta de ponta a ponta e a vazão que uma única requisição efetivamente experimenta.
Tempo até o primeiro token e tempo por token de saída
Duas medições descrevem um endpoint de streaming. O tempo até o primeiro token () é o atraso entre o envio da requisição e a visualização do primeiro token. Ele abrange a leitura do prompt, a construção do cache de atenção para cada token do prompt — a fase de prefill, limitada por computação — e a decodificação de um token. Prompts longos o aumentam. O tempo por token de saída (), também chamado de latência entre tokens, é o intervalo entre cada token subsequente durante a fase de decode. A decodificação é limitada pela largura de banda de memória: cada novo token lê o conjunto completo de pesos do modelo uma vez, de modo que esse valor permanece aproximadamente constante e seu inverso é a velocidade de geração em regime permanente, em tokens por segundo.
A fórmula
O primeiro token já está incluído no tempo até o primeiro token, portanto cada um dos tokens restantes acrescenta um intervalo entre tokens:
Tv=tttft+(Nout−1)ttpot=TNoutem que é o número de tokens de saída, é o tempo total de resposta e é a vazão geral. O termo menos um mantém a contagem exata; para respostas longas, ele mal altera o resultado.
Exemplo resolvido
Suponha que um endpoint informe um tempo até o primeiro token de 200 ms e um tempo por token de saída de 20 ms — uma velocidade de geração em regime permanente de 50 tokens por segundo — e que o modelo produza uma resposta de 500 tokens:
Tv=0.2+(500−1)×0.02=0.2+9.98=10.18 s=10.18500≈49.1 tokens/sA resposta leva cerca de dez segundos, e a vazão geral de 49,1 tokens por segundo fica logo abaixo dos 50 tokens por segundo brutos porque o atraso fixo do primeiro token se dilui por toda a resposta. A diferença entre os dois valores diminui para respostas mais longas e aumenta para respostas curtas, em que a pausa de inicialização domina.
Reduzindo a latência
O tempo até o primeiro token responde a prompts mais curtos, cache de prompts e hardware de prefill mais rápido. O tempo por token de saída responde a maior largura de banda de memória, quantização e técnicas como decodificação especulativa, que emitem mais de um token por passagem do modelo. Como o tempo total cresce a cada token gerado, limitar o comprimento máximo de saída costuma ser a alavanca mais direta para aplicações interativas. Para explorar como a aceitação do modelo de rascunho altera o valor por token, consulte a Calculadora de Aceleração da Decodificação Especulativa, e para modelar a capacidade no nível da frota, veja a Calculadora de Tokens por Segundo Efetivos.
Perguntas frequentes (FAQ)
Qual é a diferença entre tempo até o primeiro token e tempo por token de saída?
O tempo até o primeiro token (TTFT) mede a espera inicial: o modelo lê todo o prompt, preenche o cache de atenção e emite o primeiro token. O tempo por token de saída (TPOT), ou latência entre tokens, mede a cadência estável que vem depois, quando cada novo token precisa apenas de uma etapa de decodificação.
O TTFT cresce com o comprimento do prompt e é dominado pela fase de prefill, intensiva em computação, enquanto o TPOT é determinado pela largura de banda de memória durante a decodificação e permanece aproximadamente constante por token.
Por que a fórmula multiplica pelos tokens de saída menos um?
O primeiro token já está contabilizado dentro do número do tempo até o primeiro token, então apenas os tokens restantes acrescentam um atraso entre tokens. Uma resposta de 500 tokens, portanto, adiciona 499 intervalos entre tokens após o primeiro token. Para respostas longas, a diferença entre multiplicar pela contagem e pela contagem menos um é pequena, mas a forma com menos um é exata.
Como reduzir a latência de atendimento?
O tempo até o primeiro token cai com prompts mais curtos, cache de prompts e hardware de prefill mais rápido; o tempo por token de saída cai com maior largura de banda de memória, quantização ou decodificação especulativa. Limitar o comprimento máximo de saída costuma ser a alavanca mais simples, já que o tempo total cresce a cada token gerado.
Aviso legal
Os resultados pressupõem um único fluxo ininterrupto com latência constante por token. Sistemas reais de atendimento variam com batching, enfileiramento, trânsito de rede e carga, portanto trate o valor como uma estimativa de planejamento, não como uma garantia de nível de serviço.