Calculadora de Planejamento de Limite de Taxa de LLM
Entradas
| Tokens por Minuto (TPM) | 2.000.000 |
|---|---|
| Requisições por Minuto (RPM) | 10.000 |
| Tokens por Requisição | 2.000 |
| Latência Média da Requisição (segundos) | 20 |
Calculadora de Planejamento de Limite de Taxa de LLM
Entradas
Limites do provedor
≥ 1
≥ 1
Carga de trabalho
≥ 1
≥ 0,1
Resultados
Insira um valor para ver os resultados.
Detalhes
O limite de tokens é vinculante primeiro: o teto de tokens por minuto permite menos requisições do que o teto de requisições por minuto. Para aumentar a vazão, reduza os tokens por requisição (prompts mais curtos, respostas menores, cache de prompt) ou solicite uma alocação maior de TPM.
Próximas sugestões
Calculadora de Custo Mensal de LLM
Projeta o custo recorrente de uma carga de trabalho de API de modelo de linguagem grande (LLM) a partir do uso de tokens por chamada, do volume diário de requisições e dos preços do modelo por milhão de tokens, com entrada e saída cobradas separadamente.