Calculateur de jetons effectifs par seconde
Données
| Pic de jetons par seconde par accélérateur | 2 500 |
|---|---|
| Accélérateurs | 8 |
| Taux d'utilisation | 70 % |
Calculateur de jetons effectifs par seconde
Estime le débit de jetons soutenu d'une flotte d'inférence à partir de la vitesse de pointe par accélérateur, du nombre d'accélérateurs et du taux d'utilisation — la capacité réaliste, et non le pic en flux unique.
Données
Flotte
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Jetons effectifs par seconde
Le débit de pointe d'un seul accélérateur est un chiffre de banc d'essai capturé à son meilleur moment. Le débit qu'un déploiement entier soutient réellement sur une journée est tout autre chose : le trafic monte et descend, des accélérateurs restent partiellement inactifs et de la capacité est gardée en réserve pour les pics. Ce calculateur estime ce débit soutenu, à l'échelle de la flotte, à partir du pic par accélérateur, du nombre d'accélérateurs et d'un facteur d'utilisation — le chiffre sur lequel vous devriez planifier la capacité.
Débit de pointe contre débit soutenu
Il est facile de surestimer la capacité en additionnant les chiffres de pointe. Le pic suppose que chaque accélérateur est saturé de lots pleins à chaque instant, ce qui ne tient jamais sur une flotte réelle dans la durée. La demande est inégale, l'équilibrage de charge est imparfait et les exploitants conservent délibérément du jeu pour absorber les surcharges. Le facteur d'utilisation intègre tout cela en un seul multiplicateur, transformant un plafond optimiste en un chiffre que l'on peut promettre à une charge de travail.
La formule
veffTd=vg⋅G⋅u=veff⋅86400où est le pic par accélérateur en jetons par seconde, le nombre d'accélérateurs, la fraction d'utilisation, le débit soutenu et le nombre de jetons servis par jour (il y a 86 400 secondes dans une journée). Le débit croît de façon quasi linéaire avec le nombre d'accélérateurs lorsque chacun porte une part indépendante du trafic.
Exemple chiffré
Prenons une flotte de 8 accélérateurs, chacun mesuré à 2 500 jetons par seconde sous traitement par lots complet, tournant à 70 % d'utilisation :
veffTd=2500×8×0.7=14000 tokens/s=14000×86400≈1.21×109 tokens/dayLa flotte soutient 14 000 jetons par seconde et peut servir environ 1,2 milliard de jetons par jour. Notez à quel point cela se situe en dessous du pic naïf de 20 000 jetons par seconde — les 30 % de capacité perdus par une utilisation imparfaite sont exactement la marge qu'un meilleur traitement par lots et ordonnancement pourrait récupérer.
L'utiliser pour la planification
Comparez le chiffre de jetons par jour à la demande attendue : divisez la demande par cette capacité pour trouver le nombre de flottes de cette taille nécessaires, puis ajoutez une marge pour les pics au-dessus de la moyenne. Comme la production croît à la fois avec le nombre d'accélérateurs et le taux d'utilisation, une cible peut être atteinte soit en achetant plus de matériel, soit en relevant l'utilisation — ce dernier levier est généralement le moins coûteux. Le pic par accélérateur provient lui-même d'un banc d'essai par lots, exploré dans le Calculateur de débit d'inférence par lots, et la conséquence en coût d'une exploitation en dessous de la pleine utilisation est traitée dans le Calculateur de coût d'utilisation de GPU.
Questions fréquentes (FAQ)
En quoi cela diffère-t-il du débit de pointe ?
Le débit de pointe est ce qu'un seul accélérateur atteint à un instant où il est pleinement traité par lots et saturé. Le débit effectif est ce qu'une flotte entière soutient dans le temps, une fois le monde réel intervenu : le trafic arrive de façon inégale, certains accélérateurs restent partiellement inactifs, les lots ne sont pas toujours pleins et de la capacité est gardée en réserve pour les pics.
Multiplier le pic par accélérateur par le nombre d'accélérateurs donne un plafond théorique ; multiplier par le taux d'utilisation le ramène à un chiffre que l'on peut réellement promettre. La planification de capacité doit utiliser le chiffre effectif, et non le pic.
D'où vient le pic par accélérateur ?
Il se mesure au mieux en évaluant le modèle précis sur le matériel précis, à la taille de lot que vous comptez exploiter, car il dépend de la taille du modèle, de la précision, de la longueur de séquence et de la pile de service.
À titre de vérification, un plafond de bande passante mémoire donne une borne supérieure pour le décodage en flux unique, et le service par lots la multiplie par le nombre de requêtes simultanées. Utilisez un chiffre mesuré lorsque vous en avez un, et le plafond uniquement comme plafond optimiste.
Comment l'utiliser pour la planification de capacité ?
Comparez le débit effectif, ou le chiffre de jetons par jour, à votre demande attendue. Si une charge de travail nécessite un certain nombre de jetons par jour, divisez-le par la capacité journalière pour trouver le nombre de flottes de cette taille requises, puis ajoutez une marge pour les pics au-dessus de la moyenne.
Comme la production croît à la fois avec le nombre d'accélérateurs et le taux d'utilisation, vous pouvez atteindre une cible soit en ajoutant du matériel, soit en relevant l'utilisation par un meilleur traitement par lots et ordonnancement — ce dernier levier est généralement moins coûteux.
Mentions légales
Ceci suppose que le débit croît linéairement avec le nombre d'accélérateurs et qu'un facteur d'utilisation unique capture toutes les pertes du monde réel. Le réseau, l'équilibrage de charge, des longueurs de séquence inégales et la latence de queue peuvent réduire davantage la production soutenue. Mesurez les performances sur le matériel cible et conservez une marge au-dessus de la demande moyenne.