Calculateur de FLOP par jeton
Données
| Type de passe | Passe avant (2N) |
|---|---|
| Paramètres | 70 |
Calculateur de FLOP par jeton
Estime les opérations en virgule flottante qu'un transformeur effectue par jeton à l'aide des règles 2N (passe avant) et 6N (entraînement), à partir du nombre de paramètres du modèle en milliards.
Données
Modèle
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
FLOP par jeton
Quelle quantité de calcul un modèle de langage consacre-t-il à un seul jeton ? La réponse sous-tend presque toutes les estimations rapides du domaine — budgets d'entraînement, coûts d'inférence et utilisation du matériel en découlent tous. Le raccourci standard est d'une simplicité remarquable : un transformeur dense effectue environ deux opérations en virgule flottante par paramètre pour traiter un jeton, et environ six pendant l'entraînement. Ce calculateur applique ces règles au nombre de paramètres d'un modèle.
La règle 2N
Le calcul d'un transformeur est dominé par de grandes multiplications matricielles, et dans chacune d'elles chaque poids est touché une fois par jeton. Une seule multiplication-accumulation compte pour deux opérations en virgule flottante — une multiplication et une addition — de sorte que pousser un jeton à travers un modèle de paramètres coûte environ deux opérations par paramètre, la règle 2N, à la passe avant. C'est l'estimation issue des travaux de Kaplan sur les lois d'échelle, devenue la monnaie universelle pour raisonner sur le calcul des modèles. Elle ignore délibérément tout ce qui n'est pas une multiplication matricielle pondérée par les paramètres, ce qui constitue une bonne approximation pour les grands modèles.
Coût en passe avant et en entraînement
Entraîner un modèle requiert aussi une passe arrière pour calculer les gradients. La passe arrière produit les gradients par rapport aux activations comme aux poids, chacun coûtant environ une passe avant, de sorte qu'elle double à peu près le travail de la passe avant. Le total équivaut à environ trois passes avant, soit six opérations par paramètre et par jeton (l'estimation 6N) :
GF=k⋅N(GFLOP, N en milliards)=k⋅N×109avec le facteur égal à deux pour une passe avant et six pour une étape d'entraînement. Comme est saisi en milliards, le chiffre de la passe avant tombe directement en GFLOP.
Exemple chiffré
Pour un modèle de 70 milliards de paramètres en passe avant :
GF=2×70=140 GFLOP=2×70×109=1.4×1011 FLOPChaque jeton généré coûte environ 140 GFLOP. Multiplier par le débit total d'un modèle donne le débit de calcul atteint, et diviser celui-ci par le pic d'un accélérateur donne son utilisation. Entraîner le même modèle coûterait GFLOP par jeton, et multiplier le coût d'entraînement par le nombre total de jetons d'un jeu de données est la façon habituelle de dimensionner le budget de calcul d'une exécution d'entraînement.
Ce qu'elle laisse de côté
La règle ne compte que les multiplications matricielles portant les paramètres. Le mécanisme d'attention ajoute un terme distinct qui croît avec la longueur de séquence et ne dépend pas du nombre de paramètres ; pour les modèles typiques à des longueurs de contexte modérées, il est faible, mais à très grand contexte il peut devenir significatif. Les couches d'embedding et de normalisation sont elles aussi omises. Pour ces raisons, ce chiffre est une estimation pour l'échelle et le budget, et non un décompte exact d'instructions. Pour voir le calcul atteint en fraction du pic du matériel, poursuivez avec le Calculateur d'utilisation des FLOP du modèle (MFU).
Questions fréquentes (FAQ)
D'où vient l'estimation 2N ?
Le calcul d'un transformeur est dominé par des multiplications matricielles où chaque poids est utilisé une fois par jeton. Une multiplication-accumulation compte pour deux opérations en virgule flottante — une multiplication et une addition — de sorte que faire passer un seul jeton à travers N paramètres coûte environ 2N opérations à la passe avant.
C'est la règle empirique introduite par les travaux de Kaplan sur les lois d'échelle et réutilisée dans tout le domaine. C'est une approximation : elle compte les grandes multiplications matricielles et traite le reste comme négligeable, ce qui tient bien pour les grands modèles.
Pourquoi l'entraînement est-il trois fois plus coûteux ?
L'entraînement exécute la passe avant, puis une passe arrière pour calculer les gradients. La passe arrière calcule les gradients par rapport aux activations comme aux poids, chacun coûtant environ une passe avant, de sorte qu'elle vaut environ deux fois la passe avant et que le total atteint environ trois fois — six opérations par paramètre et par jeton.
Multiplier 6N par le nombre total de jetons d'un jeu de données est la façon habituelle d'estimer le budget de calcul d'une exécution d'entraînement.
Cela inclut-il l'attention ?
Non. Les règles 2N et 6N ne comptent que les multiplications matricielles portant les paramètres. Le mécanisme d'attention ajoute un terme qui croît avec la longueur de séquence et est indépendant du nombre de paramètres.
Pour les grands modèles typiques à des longueurs de contexte modérées, ce terme est faible par rapport aux multiplications matricielles, et l'estimation reste donc proche. À très grande longueur de contexte, l'attention peut devenir une part significative, et un modèle plus détaillé devient nécessaire.
Mentions légales
Ce sont des estimations de premier ordre qui comptent les multiplications matricielles dominantes et omettent l'attention, la normalisation et les couches d'embedding. Les décomptes d'opérations réels dépendent de l'architecture et de la longueur de contexte. Utilisez ce chiffre pour des comparaisons d'échelle et des estimations de budget, et non pour une comptabilité matérielle exacte.
Recommandations
Calculateur d'utilisation des FLOP du modèle (MFU)
Calcule l'utilisation des FLOP du modèle (MFU) : la part du débit en virgule flottante de pointe d'un accélérateur qu'une exécution atteint réellement, à partir du nombre de paramètres, du débit de jetons et du débit de pointe en TFLOP/s.
Calculateur de débit d'inférence
Estime la limite de vitesse de décodage d'un LLM imposée par la bande passante mémoire, à partir de la taille du modèle, de la précision des poids et de la bande passante mémoire de l'accélérateur — le plafond en jetons par seconde pour un flux unique.