Calcolatore per la pianificazione dei limiti di frequenza degli LLM
Dati di input
| Token al minuto (TPM) | 2.000.000 |
|---|---|
| Richieste al minuto (RPM) | 10.000 |
| Token per richiesta | 2.000 |
| Latenza media della richiesta (secondi) | 20 |
Calcolatore per la pianificazione dei limiti di frequenza degli LLM
Dati di input
Limiti del fornitore
≥ 1
≥ 1
Carico di lavoro
≥ 1
≥ 0,1
Risultati
Inserisci un valore per visualizzare i risultati.
Dettagli
Il limite determinante è quello dei token: il tetto di token al minuto consente meno richieste rispetto al tetto di richieste al minuto. Per aumentare la capacità di elaborazione, ridurre i token per richiesta (prompt più brevi, completamenti più piccoli, cache dei prompt) oppure richiedere un'allocazione TPM più elevata.
Da provare dopo
Calcolatore del costo mensile di un LLM
Proietta il costo ricorrente di un carico di lavoro API su un modello linguistico di grandi dimensioni (LLM) a partire dall'uso di token per chiamata, dal volume giornaliero di richieste e dai prezzi per milione di token del modello, con input e output fatturati separatamente.