LLM Rate-Limit Planning Calculator
Inputs
| Tokens per Minute (TPM) | 2,000,000 |
|---|---|
| Requests per Minute (RPM) | 10,000 |
| Tokens per Request | 2,000 |
| Average Request Latency (seconds) | 20 |
LLM Rate-Limit Planning Calculator
Inputs
Provider limits
≥ 1
≥ 1
Workload
≥ 1
≥ 0.1
Results
Enter a value to see results.
Details
Your token limit binds first: the tokens-per-minute cap permits fewer requests than the requests-per-minute cap. To raise throughput, reduce tokens per request (shorter prompts, smaller completions, prompt caching) or request a higher TPM allocation.