Calculadora de Throughput de Inferência em Lote
Entradas
| Tamanho do lote | 32 |
|---|---|
| Tokens de saída por requisição | 256 |
| Tempo de conclusão do lote | 5 seg |
Calculadora de Throughput de Inferência em Lote
Converta um tempo medido de conclusão de lote em tokens por segundo agregados, velocidade por requisição e requisições por segundo — o compromisso entre throughput e latência do serviço de LLM em lote.
Entradas
Lote
Resultados
Insira um valor para ver os resultados.
Detalhes
Throughput de inferência em lote
A inferência em lote é como os servidores de modelos de linguagem em produção atingem alta utilização: em vez de decodificar uma requisição por vez, processam muitas em conjunto. Como os pesos do modelo são lidos uma vez e reutilizados por todo o grupo, a saída total do servidor cresce acentuadamente com o tamanho do lote — mas cada requisição individual espera o lote terminar. Esta calculadora separa essas duas visões, convertendo um tempo medido de conclusão de lote em throughput agregado, velocidade por requisição e uma taxa de requisições.
O compromisso do batching
A decodificação autorregressiva é limitada por memória: cada passo lê todos os pesos para produzir um token. Quando há uma única requisição em andamento, quase todo esse tráfego de memória serve apenas um usuário. Agrupe várias requisições em um lote e a mesma leitura de pesos produz um token para cada requisição de uma só vez, de modo que a taxa agregada de tokens cresce com o tamanho do lote enquanto o custo de banda mal se altera. O porém é a latência — uma requisição não pode sair até que o passo do lote que a contém termine, então a velocidade por requisição não melhora e pode cair levemente conforme os lotes crescem.
As fórmulas
A partir do tamanho do lote , dos tokens de saída por requisição e do tempo medido de conclusão do lote :
vaggvreqR=tbB×Nout=tbNout=tbBonde é o throughput agregado, é o throughput por requisição e são as requisições concluídas por segundo. O agregado é simplesmente a velocidade por requisição multiplicada pelo tamanho do lote.
Exemplo resolvido
Um servidor decodifica um lote de 32 requisições, cada uma produzindo 256 tokens, e o lote termina em 5 segundos:
vaggvreqR=532×256=1638.4 tokens/s=5256=51.2 tokens/s=532=6.4 requisic¸o˜es/sO operador vê mais de 1.600 tokens por segundo saindo do servidor, mas cada usuário lê a cerca de 51 tokens por segundo. Dobrar o lote para 64 — se a memória permitir e o tempo de conclusão permanecer próximo de 5 segundos — aproximadamente dobraria o agregado, deixando a cifra por requisição inalterada.
Escolhendo um tamanho de lote
O throughput agregado só continua crescendo com o tamanho do lote enquanto o trabalho permanece limitado por memória. Uma vez que o lote satura a computação ou o cache de chave-valor esgota a memória do dispositivo, o tempo de conclusão cresce mais rápido que o lote e a latência por requisição degrada. A meta prática é o maior lote que mantém a latência por requisição aceitável enquanto a memória ainda comporta, encontrado ao medir o tempo de conclusão em vários tamanhos de lote. Servidores reais também usam batching contínuo, em que requisições entram e saem a cada passo em vez de como um grupo fixo, o que eleva ainda mais o throughput sustentado. Para o teto de fluxo único que define , veja a Calculadora de Vazão de Inferência; para a capacidade em nível de frota entre muitas réplicas, veja a Calculadora de Tokens por Segundo Efetivos.
Perguntas frequentes (FAQ)
Por que o throughput agregado é tão maior que o throughput por requisição?
O throughput agregado conta cada token que o servidor emite em todas as requisições do lote, enquanto o throughput por requisição é o que um único usuário experimenta. O lote lê cada peso do modelo uma vez e o reutiliza para todo o grupo, de modo que o total de tokens servidos cresce aproximadamente em proporção ao tamanho do lote.
A requisição individual, porém, ainda precisa esperar o lote terminar, então sua velocidade percebida não melhora — e pode até cair levemente conforme o lote cresce. Esse é o compromisso central do serviço em lote: throughput para o operador versus latência para o usuário.
Um lote maior é sempre melhor?
Apenas até certo ponto. O throughput agregado cresce com o tamanho do lote enquanto o trabalho permanece limitado por memória, mas, uma vez que o lote satura a computação ou o cache de chave-valor esgota a memória, o tempo de conclusão cresce mais rápido que o lote e a latência por requisição piora.
O ponto ideal prático é o maior lote que mantém a latência por requisição dentro da meta enquanto a memória ainda comporta, encontrado ao medir o tempo de conclusão em vários tamanhos de lote.
Como o batching contínuo muda isso?
Esta calculadora modela um lote fixo que começa e termina junto. Servidores modernos usam batching contínuo (in-flight), em que novas requisições entram e as concluídas saem a cada passo, mantendo o acelerador cheio mesmo quando os comprimentos de sequência diferem.
Isso eleva o throughput agregado sustentado acima da estimativa de lote fixo, mas o mesmo compromisso se mantém: o total de tokens por segundo melhora enquanto qualquer requisição individual continua limitada pela velocidade de decodificação.
Aviso legal
As estimativas assumem que todas as requisições do lote geram o mesmo número de tokens e começam juntas. Cargas reais misturam comprimentos de sequência e usam batching contínuo, de modo que o throughput agregado medido será diferente. Faça benchmark em vários tamanhos de lote no hardware alvo antes de dimensionar a capacidade.
Próximas sugestões
Calculadora de Vazão de Inferência
Estime o limite imposto pela largura de banda de memória sobre a velocidade de decodificação de um LLM a partir do tamanho do modelo, da precisão dos pesos e da largura de banda de memória do acelerador — o teto de tokens por segundo para um único fluxo.