Calculateur d'utilisation des FLOP du modèle (MFU)
Données
| Charge de travail | Inférence (2N par jeton) |
|---|---|
| Paramètres | 70 |
| Débit de jetons | 2 000 |
| Débit de pointe | 989 |
Calculateur d'utilisation des FLOP du modèle (MFU)
Calcule l'utilisation des FLOP du modèle (MFU) : la part du débit en virgule flottante de pointe d'un accélérateur qu'une exécution atteint réellement, à partir du nombre de paramètres, du débit de jetons et du débit de pointe en TFLOP/s.
Données
Charge de travail
Matériel
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
L'utilisation des FLOP du modèle (MFU)
L'utilisation des FLOP du modèle, ou MFU (model FLOPs utilization), mesure la part du calcul théorique d'un accélérateur qu'une exécution exploite réellement. Deux grappes dotées du même matériel peuvent différer d'un facteur plusieurs sur leur production réelle, et la MFU est le chiffre unique qui capture cet écart : elle divise les opérations en virgule flottante qu'une charge de travail effectue véritablement par le pic que le matériel annonce. Ce calculateur l'estime à partir du nombre de paramètres, du débit de jetons et du débit de pointe en TFLOP/s de l'accélérateur.
Ce que la MFU vous indique
Les fabricants de matériel annoncent un débit de pointe — pour un accélérateur de centre de données actuel, de l'ordre du millier de TFLOP/s en 16 bits — qui suppose un flux parfait de multiplications-additions fusionnées, données déjà en registres. Aucune charge de travail réelle ne soutient ce débit. La MFU rapporte la fraction atteinte : une MFU de 40 % signifie que l'exécution extrait quarante centimes de calcul de chaque euro de pic théorique. C'est l'étalon standard pour juger si une configuration d'entraînement ou d'inférence est bien optimisée, et pour décider si un changement a réellement aidé.
La formule
Une passe avant coûte environ deux opérations en virgule flottante par paramètre et par jeton ; une étape d'entraînement ajoute une passe arrière pour environ six au total. Avec le facteur de charge de travail (deux pour l'inférence, six pour l'entraînement), le nombre de paramètres en milliards et le débit en jetons par seconde, le débit atteint et l'utilisation valent
AU=1000k⋅N⋅v=PAoù est le débit atteint en TFLOP/s, le débit de pointe en TFLOP/s sommé sur chaque accélérateur de l'exécution, et l'utilisation. La division par 1000 convertit un milliard de paramètres multiplié par les jetons par seconde en TFLOP/s.
Exemple chiffré
Prenons un modèle de 70 milliards de paramètres servant de l'inférence à 2 000 jetons par seconde sur un accélérateur unique évalué à 989 TFLOP/s de calcul dense en 16 bits :
AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3%L'exécution exploite un peu plus du quart du pic de la puce — typique d'un décodage limité par la mémoire, où une grande partie du temps est passée à lire les poids plutôt qu'à multiplier. Une tâche d'entraînement de grand modèle bien réglée, davantage limitée par le calcul, se situerait plus souvent entre 35 % et 55 %.
Pourquoi elle n'atteint jamais 100 %
Les exécutions réelles perdent du temps en transferts mémoire, en communication entre accélérateurs, en bulles de pipeline et dans des couches comme l'attention et la normalisation qui ne sont pas de pures multiplications matricielles. Une utilisation parfaite signifierait l'absence totale de ce surcoût. L'usage pratique de la MFU est comparatif : mesurez-la avant et après une optimisation, sur la même charge de travail et le même matériel ; un chiffre plus élevé signifie qu'une plus grande part du calcul que vous payez fait un travail utile. Le nombre d'opérations par jeton qui sous-tend cette estimation est exploré dans le Calculateur de FLOP par jeton, et le versant bande passante mémoire du même matériel dans le Calculateur de débit d'inférence.
Questions fréquentes (FAQ)
Qu'est-ce qu'une bonne MFU ?
Pour l'entraînement de grands modèles, les systèmes bien réglés rapportent généralement une utilisation des FLOP du modèle comprise entre environ 35 % et 55 % ; les travaux PaLM, qui ont popularisé la métrique, faisaient état d'environ 46 %.
L'utilisation en inférence est habituellement plus faible lors du décodage limité par la mémoire, car l'accélérateur passe une grande partie de son temps à lire les poids plutôt qu'à calculer. Il n'existe pas de cible universelle — la comparaison utile se fait avec la même charge de travail sur le même matériel après une optimisation, où un chiffre plus élevé signifie qu'une plus grande part du calcul payé fait un travail utile.
Pourquoi l'entraînement coûte-t-il six FLOP par paramètre et l'inférence deux ?
Une passe avant effectue environ deux opérations en virgule flottante par paramètre et par jeton — une multiplication et une addition dans les multiplications matricielles dominantes.
L'entraînement ajoute une passe arrière qui calcule les gradients par rapport aux activations comme aux poids, ce qui coûte environ deux fois la passe avant, soit au total environ six opérations par paramètre et par jeton. Ce sont les estimations standards de premier ordre ; elles négligent l'attention et d'autres termes faibles pour les grands modèles.
Pourquoi l'utilisation ne peut-elle atteindre 100 % ?
Le débit de pointe est un chiffre théorique correspondant à des multiplications-additions fusionnées enchaînées, avec les données déjà en registres.
Les exécutions réelles perdent du temps en transferts mémoire, en communication entre accélérateurs, en bulles de pipeline, dans les couches d'attention et de normalisation qui ne sont pas de pures multiplications matricielles, et dans des noyaux incapables de remplir parfaitement les unités de calcul. Une utilisation proche de un signifierait l'absence totale de ce surcoût, ce qui ne se produit jamais en pratique.
Mentions légales
La MFU repose sur des estimations de FLOP de premier ordre (2N pour l'inférence, 6N pour l'entraînement) qui omettent l'attention et d'autres termes mineurs, et suppose que le chiffre de pointe correspond à la précision et au nombre d'accélérateurs de l'exécution. Considérez-la comme un indicateur d'efficacité comparatif, et non comme un décompte exact de chaque opération.
Recommandations
Calculateur de FLOP par jeton
Estime les opérations en virgule flottante qu'un transformeur effectue par jeton à l'aide des règles 2N (passe avant) et 6N (entraînement), à partir du nombre de paramètres du modèle en milliards.
Calculateur de débit d'inférence
Estime la limite de vitesse de décodage d'un LLM imposée par la bande passante mémoire, à partir de la taille du modèle, de la précision des poids et de la bande passante mémoire de l'accélérateur — le plafond en jetons par seconde pour un flux unique.