Calculadora de FLOPs de entrenamiento
Datos de entrada
| Tipo de pasada | Paso de entrenamiento (6ND) |
|---|---|
| Parámetros | 70 |
| Tokens de entrenamiento | 1.400 |
Calculadora de FLOPs de entrenamiento
Estima las operaciones en coma flotante necesarias para entrenar un transformador con la regla 6ND, a partir del número de parámetros y de tokens de entrenamiento, expresadas en FLOPs totales y en petaFLOP/s-días.
Datos de entrada
Modelo y datos
Resultados
Introduce un valor para ver los resultados.
Detalles
FLOPs de entrenamiento
El cómputo necesario para entrenar un modelo de lenguaje grande está dominado por una sola magnitud: el número de operaciones en coma flotante que se realizan a lo largo de toda la ejecución de entrenamiento. Para los transformadores densos, esa magnitud se aproxima bien con la regla 6ND, que establece que entrenar cuesta unas seis operaciones por cada parámetro y cada token procesado. Esta calculadora aplica esa regla: a partir de un número de parámetros y un número de tokens, devuelve tanto el recuento bruto de operaciones como su equivalente en petaFLOP/s-días.
La regla 6ND
Una pasada hacia delante de un transformador realiza aproximadamente dos operaciones en coma flotante por parámetro y por token: una multiplicación y una suma en las multiplicaciones de matrices que dominan el trabajo. El entrenamiento añade una pasada hacia atrás que propaga los gradientes tanto a las activaciones como a los pesos, con un coste cercano al doble de la pasada hacia delante. Las pasadas hacia delante y hacia atrás juntas suman unas seis operaciones por parámetro y por token. Con parámetros y tokens de entrenamiento, el total se aproxima entonces a . La estimación recoge las capas lineales dominantes y omite contribuciones menores de la atención, los embeddings y la normalización, insignificantes en modelos grandes.
La fórmula
Con el factor de pasada (seis para un paso de entrenamiento, dos para una pasada hacia delante únicamente), el número de parámetros en miles de millones y el número de tokens en miles de millones, el recuento total de operaciones y el cómputo en petaFLOP/s-días son
CP=k⋅N⋅D⋅1018=8.64×1019Cdonde son los FLOPs totales y es el cómputo en petaFLOP/s-días. El factor devuelve los miles de millones de y a recuentos absolutos. Un petaFLOP/s-día equivale a un petaFLOP/s sostenido durante un día, igual a operaciones, de modo que dividir entre esa cifra convierte un recuento bruto de FLOPs en la unidad en la que suelen reportarse las ejecuciones grandes.
Ejemplo resuelto
Considérese un modelo de 70 mil millones de parámetros entrenado con 1.400 mil millones de tokens, una proporción de veinte tokens por parámetro acorde con la práctica de cómputo óptimo:
CP=6×70×1400×1018=5.88×1023 FLOPs=8.64×10195.88×1023≈6805,6 PFLOP/s-dıˊasLa ejecución necesita unas operaciones, o aproximadamente 6.806 petaFLOP/s-días. Cambiar el factor de pasada a dos reporta solo el coste de la pasada hacia delante, un tercio del total de entrenamiento.
Límites
La regla 6ND es un recuento idealizado de aritmética, no una predicción del tiempo real ni del coste. El hardware real solo sostiene una fracción de su rendimiento máximo, de modo que el tiempo efectivo resulta de dividir este cómputo entre la tasa realmente alcanzada y no entre la anunciada, una brecha que recoge la calculadora de Calculadora de aprovechamiento de FLOPs del modelo. La estimación también omite el recálculo de activaciones, los pasos del optimizador, las pasadas de evaluación y cualquier ejecución que falle y se reinicie, todo lo cual se suma al cómputo gastado en la práctica. La cuestión complementaria de cuántos tokens debería ver un modelo de un tamaño dado la aborda la calculadora de Calculadora de tokens óptimos de Chinchilla, y convertir este cómputo en un presupuesto de alquiler lo trata la calculadora de Calculadora de coste de GPU en la nube.
Preguntas frecuentes (FAQ)
¿Qué es la regla 6ND?
La regla 6ND estima que entrenar un transformador denso cuesta unas seis operaciones en coma flotante por cada parámetro y cada token de entrenamiento, donde N es el número de parámetros y D el número de tokens. El factor seis proviene de unas dos operaciones por parámetro en la pasada hacia delante y unas cuatro en la pasada hacia atrás que calcula los gradientes.
Es una aproximación de primer orden introducida en los trabajos sobre leyes de escalado; recoge las multiplicaciones de matrices dominantes y omite términos menores como la atención y los embeddings.
¿Cómo se relacionan los FLOPs totales con los petaFLOP/s-días?
Un petaFLOP/s-día es la cantidad de cómputo que produce sostener un petaFLOP/s durante un día completo, equivalente a 8,64 × 10¹⁹ operaciones en coma flotante (10¹⁵ operaciones por segundo por 86.400 segundos). Dividir un recuento total de FLOPs entre esa cifra lo convierte en petaFLOP/s-días, la unidad en la que suelen reportarse las ejecuciones de entrenamiento grandes, porque los recuentos brutos de FLOPs alcanzan magnitudes poco manejables.
¿Qué incluye y qué excluye esta estimación?
La estimación cuenta las operaciones en coma flotante de las capas lineales dominantes en las pasadas hacia delante y hacia atrás para el número de tokens indicado. No tiene en cuenta el aprovechamiento del hardware, por lo que el tiempo real y el coste de una ejecución son mayores de lo que sugiere el cómputo ideal.
También omite el recálculo de activaciones, la sobrecarga del optimizador, la evaluación y las ejecuciones fallidas o reiniciadas, todo lo cual se suma al cómputo gastado en la práctica.
Aviso legal
Esta calculadora aplica la aproximación de primer orden 6ND para transformadores densos y solo contabiliza el cómputo ideal. El tiempo y el coste reales de entrenamiento dependen del aprovechamiento del hardware, muy por debajo del pico, y de la sobrecarga que la fórmula omite. Conviene tomar el resultado como una estimación de planificación, no como una contabilidad exacta.
Recomendaciones
Calculadora de tokens óptimos de Chinchilla
Calcula el número de tokens de entrenamiento de cómputo óptimo para un modelo según la regla de Chinchilla de unos veinte tokens por parámetro, junto con el cómputo de entrenamiento resultante en FLOPs.
Calculadora de tiempo y coste de entrenamiento
Estima cuánto dura una ejecución de entrenamiento de un modelo de lenguaje y cuánto cuesta, a partir de los FLOPs totales de entrenamiento, el número de GPUs, el rendimiento máximo por GPU en TFLOP/s, el aprovechamiento de FLOPs del modelo y el precio por hora de la GPU.