Calculadora de tamaño de modelo de cómputo óptimo
Datos de entrada
| Presupuesto de cómputo | 6.000 |
|---|---|
| Tokens por parámetro | 20 |
Calculadora de tamaño de modelo de cómputo óptimo
A partir de un presupuesto de cómputo de entrenamiento en petaFLOP/s-días, halla el número de parámetros y de tokens de cómputo óptimo según Chinchilla, invirtiendo la regla 6ND con una proporción fija de tokens por parámetro.
Datos de entrada
Presupuesto de cómputo
Resultados
Introduce un valor para ver los resultados.
Detalles
Tamaño de modelo de cómputo óptimo
Dado un presupuesto fijo de cómputo de entrenamiento, las leyes de escalado de Chinchilla indican qué tamaño de modelo conviene construir con ese cómputo y con cuántos tokens entrenarlo. La asignación de cómputo óptimo empareja parámetros y datos al unísono, en lugar de gastar todo el presupuesto en el tamaño. Esta calculadora parte de un presupuesto de cómputo en petaFLOP/s-días, mantiene fija la proporción de tokens por parámetro e invierte la regla 6ND para devolver el número de parámetros y de tokens óptimo.
Reparto de un presupuesto de cómputo
El cómputo de entrenamiento se aproxima bien con la regla 6ND: unas seis operaciones en coma flotante por parámetro y por token. El estudio de Chinchilla mostró que, para un presupuesto fijo, la pérdida se minimiza cuando el tamaño del modelo y el del conjunto de datos crecen juntos, con unos veinte tokens de entrenamiento por parámetro. Fijar esa proporción convierte la ecuación de cómputo en una relación que depende únicamente del número de parámetros, que puede resolverse para hallar el tamaño de modelo que admite un presupuesto dado.
La fórmula
Sea el presupuesto en petaFLOP/s-días y la proporción de tokens por parámetro. Convertir el presupuesto a FLOPs y sustituir en la regla da , de modo que el número de parámetros y el de tokens son
ND=10916rC⋅8.64×1019=r⋅Ndonde es el número óptimo de parámetros en miles de millones y el número óptimo de tokens en miles de millones. El factor convierte los petaFLOP/s-días en FLOPs, y dividir entre expresa en miles de millones. La raíz cuadrada aparece porque el cómputo crece con el cuadrado del número de parámetros una vez que los tokens quedan ligados a él.
Ejemplo resuelto
Tómese un presupuesto de 6.000 petaFLOP/s-días con la proporción central de veinte tokens por parámetro:
ND=10916×206000×8.64×1019≈65.7 mil millones=20×65.7≈1314.5 mil millones=1.31 billonesEl presupuesto se aprovecha mejor en un modelo de unos 65,7 mil millones de parámetros entrenado con aproximadamente 1,31 billones de tokens. Duplicar el presupuesto elevaría el número óptimo de parámetros en torno a la raíz cuadrada de dos, no en un factor de dos, debido a la dependencia con la raíz cuadrada.
Límites
Esto refleja la pérdida de entrenamiento de cómputo óptimo para un presupuesto de entrenamiento fijo y nada más. No pondera el coste de servir el modelo, que a menudo convierte en mejor opción práctica un modelo más pequeño entrenado con más tokens, por lo que los modelos desplegados se sitúan con frecuencia por debajo del número de parámetros que esto devuelve. La proporción fija es en sí misma una estimación que se desplaza con el conjunto de datos y la arquitectura, y las ejecuciones reales solo sostienen una fracción del rendimiento máximo del hardware. El lado de los datos del mismo compromiso lo cubre la calculadora de Calculadora de tokens óptimos de Chinchilla, y el cómputo bruto de cualquier configuración elegida lo trata la calculadora de Calculadora de FLOPs de entrenamiento.
Preguntas frecuentes (FAQ)
¿Cómo se reparte un presupuesto de cómputo fijo entre tamaño del modelo y datos?
Las leyes de escalado de Chinchilla muestran que, para un presupuesto de entrenamiento fijo, la pérdida se minimiza cuando los parámetros y los tokens de entrenamiento se escalan a la vez, en lugar de dedicar la mayor parte del presupuesto a los parámetros.
Mantener la proporción de tokens por parámetro cerca de veinte y resolver la ecuación de cómputo 6ND para ese presupuesto da el tamaño de modelo y el tamaño de conjunto de datos que mejor aprovechan el cómputo disponible. Los presupuestos mayores admiten modelos y conjuntos de datos proporcionalmente mayores.
¿Por qué el tamaño del modelo escala con la raíz cuadrada del cómputo?
El cómputo de entrenamiento según la regla 6ND es seis por parámetros por tokens. Mantener los tokens en una proporción fija r por parámetro hace que los tokens sean iguales a r por N, de modo que el cómputo pasa a ser seis por r por N al cuadrado.
Como el cómputo crece con el cuadrado del número de parámetros, recuperar el número de parámetros a partir de un presupuesto de cómputo exige tomar una raíz cuadrada: N es igual a la raíz cuadrada del cómputo dividido entre seis r. Los tokens se obtienen entonces como r por N.
¿Qué es un petaFLOP/s-día?
Un petaFLOP/s-día es la cantidad de cómputo que produce sostener un petaFLOP/s —10¹⁵ operaciones en coma flotante por segundo— durante un día completo. Multiplicar por los 86.400 segundos de un día da 8,64 × 10¹⁹ operaciones. Es la unidad estándar para reportar y comparar los presupuestos de cómputo de las ejecuciones de entrenamiento grandes, ya que los recuentos brutos de operaciones alcanzan magnitudes incómodas.
Aviso legal
Esta calculadora invierte la regla de primer orden 6ND con una proporción fija de tokens por parámetro y refleja únicamente la pérdida de entrenamiento de cómputo óptimo. No tiene en cuenta el coste de inferencia, que a menudo favorece modelos más pequeños entrenados durante más tiempo, ni el aprovechamiento del hardware por debajo del pico. Conviene tomar el resultado como una estimación de planificación.