Calculadora de aprovechamiento de FLOPs del modelo
Datos de entrada
| Carga de trabajo | Inferencia (2N por token) |
|---|---|
| Parámetros | 70 |
| Rendimiento en tokens | 2.000 |
| Rendimiento máximo | 989 |
Calculadora de aprovechamiento de FLOPs del modelo
Calcula el aprovechamiento de FLOPs del modelo (MFU): la fracción del rendimiento máximo en coma flotante de un acelerador que una ejecución alcanza realmente, a partir del número de parámetros, el rendimiento en tokens y los TFLOP/s máximos.
Datos de entrada
Carga de trabajo
Hardware
Resultados
Introduce un valor para ver los resultados.
Detalles
Aprovechamiento de FLOPs del modelo
El aprovechamiento de FLOPs del modelo, o MFU, mide cuánto del cómputo teórico de un acelerador utiliza realmente una ejecución. Dos clústeres con el mismo hardware pueden diferir varias veces en su salida real, y el MFU es la cifra única que capta esa brecha: divide las operaciones de coma flotante que una carga de trabajo realiza de verdad entre el máximo que anuncia el hardware. Esta calculadora lo estima a partir del número de parámetros, el rendimiento en tokens y los TFLOP/s máximos del acelerador.
Qué indica el MFU
Los fabricantes de hardware citan una tasa máxima —para un acelerador actual de centro de datos, del orden de mil TFLOP/s de 16 bits— que presupone un flujo perfecto de multiplicaciones-sumas fusionadas con los datos ya en los registros. Ninguna carga de trabajo real sostiene esa cifra. El MFU informa de la fracción alcanzada, de modo que un MFU del 40 % significa que la ejecución extrae cuarenta céntimos de cómputo de cada euro de máximo teórico. Es el patrón estándar para juzgar si una configuración de entrenamiento o de inferencia está bien optimizada, y para decidir si un cambio ha ayudado de verdad.
La fórmula
Una pasada directa cuesta unas dos operaciones de coma flotante por parámetro y por token; un paso de entrenamiento añade una pasada inversa para unas seis en total. Con el factor de carga de trabajo (dos para inferencia, seis para entrenamiento), el número de parámetros en miles de millones y el rendimiento en tokens por segundo, la tasa alcanzada y el aprovechamiento son
AU=1000k⋅N⋅v=PAdonde son los TFLOP/s alcanzados, son los TFLOP/s máximos sumados sobre cada acelerador de la ejecución, y es el aprovechamiento. La división por 1000 convierte miles de millones de parámetros por tokens por segundo en TFLOP/s.
Ejemplo resuelto
Tómese un modelo de 70 mil millones de parámetros que sirve inferencia a 2.000 tokens por segundo en un único acelerador valorado en 989 TFLOP/s de cómputo denso de 16 bits:
AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3%La ejecución usa algo más de una cuarta parte del máximo del chip, lo típico en la decodificación limitada por memoria, donde buena parte del tiempo se dedica a leer pesos en lugar de multiplicar. Un trabajo de entrenamiento de un modelo grande bien ajustado, que está más limitado por cómputo, se situaría con más frecuencia entre el 35 % y el 55 %.
Por qué nunca llega al 100 %
Las ejecuciones reales pierden tiempo en transferencias de memoria, comunicación entre aceleradores, burbujas de canalización y capas como la atención y la normalización, que no son multiplicaciones de matrices puras. Un aprovechamiento perfecto significaría que ninguna de esas sobrecargas existe. El uso práctico del MFU es comparativo: medirlo antes y después de una optimización sobre la misma carga de trabajo y el mismo hardware, donde una cifra mayor significa que una porción mayor del cómputo que se paga realiza trabajo útil. El recuento de operaciones por token que impulsa esta estimación se explora en la Calculadora de FLOPs por token, y la vertiente de ancho de banda de memoria del mismo hardware en la Calculadora de rendimiento de inferencia.
Preguntas frecuentes (FAQ)
¿Qué se considera un buen MFU?
En el entrenamiento de modelos grandes, los sistemas bien ajustados suelen reportar un aprovechamiento de FLOPs del modelo de entre el 35 % y el 55 % aproximadamente; el trabajo sobre PaLM que popularizó la métrica informó de cerca del 46 %.
El aprovechamiento en inferencia suele ser menor durante la decodificación limitada por memoria, porque el acelerador dedica buena parte del tiempo a leer pesos en lugar de calcular. No hay un objetivo universal: la comparación útil es frente a la misma carga de trabajo en el mismo hardware tras una optimización, donde una cifra mayor significa que una porción mayor del cómputo pagado realiza trabajo útil.
¿Por qué el entrenamiento son seis FLOPs por parámetro y la inferencia dos?
Una pasada directa realiza aproximadamente dos operaciones de coma flotante por parámetro y por token: una multiplicación y una suma en las multiplicaciones de matrices dominantes.
El entrenamiento añade una pasada inversa que calcula los gradientes respecto a las activaciones y a los pesos, lo que cuesta cerca del doble de la pasada directa, dando en total unas seis operaciones por parámetro y por token. Son las estimaciones estándar de primer orden; ignoran la atención y otros términos que son pequeños para los modelos grandes.
¿Por qué el aprovechamiento no puede llegar al 100 %?
El rendimiento máximo es una cifra teórica para multiplicaciones-sumas fusionadas encadenadas con los datos ya en los registros.
Las ejecuciones reales pierden tiempo en transferencias de memoria, comunicación entre aceleradores, burbujas de canalización, capas de atención y de normalización que no son multiplicaciones de matrices puras, y núcleos que no pueden llenar perfectamente las unidades de cómputo. Un aprovechamiento cercano a uno significaría que ninguna de esas sobrecargas existe, algo que nunca ocurre en la práctica.
Aviso legal
El MFU emplea estimaciones de FLOPs de primer orden (2N para inferencia, 6N para entrenamiento) que omiten la atención y otros términos menores, y supone que la cifra máxima corresponde a la precisión y al número de aceleradores de la ejecución. Trátelo como un indicador comparativo de eficiencia, no como una contabilidad exacta de cada operación.
Recomendaciones
Calculadora de FLOPs por token
Estima las operaciones de coma flotante que un transformer realiza por token usando las reglas de 2N para la pasada directa y 6N para el entrenamiento, a partir del número de parámetros del modelo en miles de millones.
Calculadora de rendimiento de inferencia
Estima el límite que impone el ancho de banda de memoria a la velocidad de decodificación de un LLM a partir del tamaño del modelo, la precisión de los pesos y el ancho de banda de memoria del acelerador: el techo (roofline) de tokens por segundo de un único flujo.