Calculateur de débit d'inférence
Données
| Paramètres | 70 |
|---|---|
| Précision des poids | 16 bits (2 octets) |
| Bande passante mémoire | 3 350 |
Calculateur de débit d'inférence
Estime la limite de vitesse de décodage d'un LLM imposée par la bande passante mémoire, à partir de la taille du modèle, de la précision des poids et de la bande passante mémoire de l'accélérateur — le plafond en jetons par seconde pour un flux unique.
Données
Modèle
Matériel
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Débit d'inférence
Le débit d'inférence correspond au nombre de jetons qu'un modèle de langage peut générer par seconde. Pour une requête isolée, le plafond n'est pas fixé par la puissance arithmétique brute de l'accélérateur, mais par la vitesse à laquelle il peut lire les poids du modèle depuis la mémoire. Ce calculateur convertit la taille du modèle, la précision des poids et la bande passante mémoire du matériel en ce plafond — la limite, en jetons par seconde, d'un flux de décodage unique.
Pourquoi le décodage est limité par la mémoire
Générer du texte de façon autorégressive consiste à produire un jeton, puis à le réinjecter pour produire le suivant. Chacune de ces étapes doit lire tous les poids du modèle pour calculer un seul nouveau jeton. Avec une taille de lot de un, l'accélérateur effectue très peu d'arithmétique pour chaque octet chargé : il passe donc presque tout son temps à déplacer des poids plutôt qu'à multiplier. Le débit de jetons est par conséquent régi par la bande passante mémoire. (Le préremplissage de l'invite est l'inverse : il traite tous les jetons de l'invite ensemble et est limité par le calcul.)
La formule
On détermine d'abord la mémoire occupée par les poids, puis on divise la bande passante disponible par celle-ci :
Mv=N×b=MBWIci est le nombre de paramètres en milliards, le nombre d'octets stockés par paramètre, la taille du modèle en gigaoctets, la bande passante mémoire en gigaoctets par seconde et la limite de débit en jetons par seconde. Comme un milliard d'octets équivaut à peu près à un gigaoctet, saisir les paramètres en milliards fait tomber la taille directement en gigaoctets. La précision des poids vaut 2 octets pour des poids en 16 bits, 1 octet en 8 bits et un demi-octet en 4 bits.
Exemple chiffré
Prenons un modèle de 70 milliards de paramètres en précision 16 bits, servi sur un accélérateur doté de 3 350 GB/s de bande passante mémoire :
Mv=70×2=140 GB=1403350≈23.9 tokens/sUn flux unique plafonne donc autour de 24 jetons par seconde. Quantifier le même modèle en 4 bits le réduit à 35 GB et relève le plafond à environ 96 jetons par seconde — un gain d'un facteur quatre qui reflète la réduction d'un facteur quatre des octets lus par jeton.
Lire le résultat
Ce chiffre est une borne supérieure, et non une promesse. Il ne comptabilise que le trafic lié au transfert des poids ; le cache clé-valeur, le calcul de l'attention et le coût des noyaux le rognent tous, de sorte qu'un flux unique réel atteint généralement entre la moitié et les trois quarts du plafond. Servir de nombreuses requêtes en lot ne lit les poids qu'une fois pour tout le groupe, ce qui propulse le débit agrégé bien au-dessus du chiffre du flux unique — voir le Calculateur de débit d'inférence par lots. Pour convertir un débit de jetons en attente perçue par l'utilisateur, associez-le au Calculateur de latence d'inférence, et pour mesurer le degré d'utilisation du calcul du matériel, voir le Calculateur d'utilisation des FLOP du modèle (MFU).
Questions fréquentes (FAQ)
Pourquoi le décodage est-il limité par la bande passante mémoire plutôt que par le calcul ?
Pendant le décodage autorégressif, le modèle génère un jeton à la fois, et chaque étape doit lire tous les poids depuis la mémoire pour calculer le jeton suivant. Avec une taille de lot de un, il y a très peu d'arithmétique par octet chargé : l'accélérateur passe donc l'essentiel de son temps à déplacer des poids plutôt qu'à multiplier.
Le débit de jetons est par conséquent fixé par la vitesse de lecture de la mémoire, et non par le débit de calcul en virgule flottante de pointe. Le préremplissage, qui traite toute l'invite d'un coup, est à l'inverse limité par le calcul.
Un serveur atteindra-t-il réellement ce chiffre ?
Non. Ce chiffre est une borne supérieure nette qui suppose que le seul trafic mémoire concerne les poids. En pratique, le cache clé-valeur, le calcul de l'attention, le coût de lancement des noyaux et une utilisation imparfaite de la mémoire le réduisent tous, de sorte qu'un flux unique atteint généralement entre la moitié et les trois quarts du plafond.
Regrouper de nombreuses requêtes en lot relève fortement le débit agrégé au-dessus de la limite du flux unique, car les poids ne sont lus qu'une fois pour tout le lot.
Dans quelle mesure la quantification augmente-t-elle le débit ?
Le débit varie en raison inverse de la taille du modèle : diviser par deux les octets par paramètre double à peu près la limite. Passer de poids en 16 bits à 8 bits réduit de moitié les octets lus par jeton, et le 4 bits les divise encore par deux. La quantification peut dégrader la qualité de sortie ; le gain de vitesse se met donc en balance avec toute baisse de précision pour la tâche concernée.
Mentions légales
Il s'agit d'un plafond de premier ordre qui ne comptabilise que le trafic mémoire des poids et suppose un décodage en flux unique. Le débit réel dépend de la pile de service, de la taille des lots, de la longueur des séquences et du cache clé-valeur, et n'en représente généralement qu'une fraction. Mesurez les performances sur le matériel cible avant d'arrêter un plan de capacité.
Recommandations
Calculateur de latence d'inférence
Estime le temps de réponse de bout en bout d'une complétion LLM en streaming à partir du délai jusqu'au premier jeton, du temps par jeton de sortie et du nombre de jetons générés.
Calculateur d'utilisation des FLOP du modèle (MFU)
Calcule l'utilisation des FLOP du modèle (MFU) : la part du débit en virgule flottante de pointe d'un accélérateur qu'une exécution atteint réellement, à partir du nombre de paramètres, du débit de jetons et du débit de pointe en TFLOP/s.