Calculateur de latence d'inférence
Données
| Délai jusqu'au premier jeton | 200 ms |
|---|---|
| Temps par jeton de sortie | 20 ms |
| Jetons de sortie | 500 |
Calculateur de latence d'inférence
Estime le temps de réponse de bout en bout d'une complétion LLM en streaming à partir du délai jusqu'au premier jeton, du temps par jeton de sortie et du nombre de jetons générés.
Données
Profil de service
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
La latence d'inférence
La latence d'inférence est le temps qu'un utilisateur attend avant qu'un modèle de langage ne réponde. Pour une complétion en streaming, elle comporte deux parties distinctes : la pause initiale avant l'apparition du moindre texte, et le rythme régulier des jetons qui suit. Ce calculateur combine les deux avec la longueur de la réponse pour estimer le temps de réponse de bout en bout et le débit qu'une requête isolée connaît réellement.
Délai jusqu'au premier jeton et temps par jeton de sortie
Deux mesures décrivent un point de terminaison en streaming. Le délai jusqu'au premier jeton () est le temps écoulé entre l'envoi de la requête et l'apparition du premier jeton. Il couvre la lecture de l'invite, la construction du cache d'attention pour chaque jeton de l'invite — la phase de préremplissage, limitée par le calcul — et le décodage d'un jeton. Les invites longues l'allongent. Le temps par jeton de sortie (), aussi appelé latence inter-jetons, est l'écart entre chaque jeton suivant pendant la phase de décodage. Le décodage est limité par la bande passante mémoire : chaque nouveau jeton lit une fois l'ensemble des poids du modèle, de sorte que ce chiffre reste à peu près constant et que son inverse correspond à la vitesse de génération en régime établi, en jetons par seconde.
La formule
Le premier jeton étant déjà inclus dans le délai jusqu'au premier jeton, chacun des jetons restants ajoute un écart inter-jetons :
Tv=tttft+(Nout−1)ttpot=TNoutoù est le nombre de jetons de sortie, le temps de réponse total et le débit global. Le terme « moins un » garde le compte exact ; pour les réponses longues, il ne modifie quasiment pas le résultat.
Exemple chiffré
Supposons qu'un point de terminaison affiche un délai jusqu'au premier jeton de 200 ms et un temps par jeton de sortie de 20 ms — soit une vitesse de génération en régime établi de 50 jetons par seconde — et que le modèle produise une réponse de 500 jetons :
Tv=0.2+(500−1)×0.02=0.2+9.98=10.18 s=10.18500≈49.1 tokens/sLa réponse prend une dizaine de secondes, et le débit global de 49,1 jetons par seconde se situe juste en dessous des 50 jetons par seconde bruts, car le délai fixe du premier jeton se répartit sur toute la réponse. L'écart entre les deux chiffres se réduit pour les réponses longues et se creuse pour les réponses courtes, où la pause de démarrage domine.
Réduire la latence
Le délai jusqu'au premier jeton réagit à des invites plus courtes, à la mise en cache d'invites et à un matériel de préremplissage plus rapide. Le temps par jeton de sortie réagit à une bande passante mémoire supérieure, à la quantification et à des techniques comme le décodage spéculatif, qui émettent plusieurs jetons par passe du modèle. Comme le temps total croît avec chaque jeton généré, plafonner la longueur maximale de sortie est souvent le levier le plus direct pour les applications interactives. Pour explorer la manière dont le taux d'acceptation d'un modèle brouillon modifie le chiffre par jeton, voir le Calculateur d'accélération par décodage spéculatif, et pour modéliser la capacité à l'échelle d'une flotte, voir le Calculateur de jetons effectifs par seconde.
Questions fréquentes (FAQ)
Quelle est la différence entre le délai jusqu'au premier jeton et le temps par jeton de sortie ?
Le délai jusqu'au premier jeton (TTFT) mesure l'attente initiale : le modèle lit l'invite entière, remplit le cache d'attention et émet le premier jeton. Le temps par jeton de sortie (TPOT), ou latence inter-jetons, mesure la cadence régulière qui suit, lorsque chaque nouveau jeton ne demande plus qu'une étape de décodage.
Le TTFT augmente avec la longueur de l'invite et est dominé par la phase de préremplissage, gourmande en calcul, tandis que le TPOT est fixé par la bande passante mémoire pendant le décodage et reste à peu près constant par jeton.
Pourquoi la formule multiplie-t-elle par le nombre de jetons de sortie moins un ?
Le premier jeton est déjà comptabilisé dans le délai jusqu'au premier jeton ; seuls les jetons restants ajoutent donc un délai inter-jetons. Une réponse de 500 jetons ajoute ainsi 499 écarts inter-jetons après le premier jeton. Pour les réponses longues, l'écart entre une multiplication par le nombre total et par le nombre moins un est faible, mais la forme « moins un » est exacte.
Comment réduire la latence de service ?
Le délai jusqu'au premier jeton diminue avec des invites plus courtes, la mise en cache d'invites et un matériel de préremplissage plus rapide ; le temps par jeton de sortie diminue avec une bande passante mémoire supérieure, la quantification ou le décodage spéculatif. Plafonner la longueur maximale de sortie est souvent le levier le plus simple, puisque le temps total croît avec chaque jeton généré.
Mentions légales
Les résultats supposent un flux unique et continu avec une latence par jeton constante. Les systèmes de service réels varient selon le traitement par lots, la mise en file d'attente, le transit réseau et la charge ; il convient donc de considérer ce chiffre comme une estimation de planification, et non comme une garantie de niveau de service.