Calculadora de tokens óptimos de Chinchilla
Datos de entrada
| Parámetros | 70 |
|---|---|
| Tokens por parámetro | 20 |
Calculadora de tokens óptimos de Chinchilla
Calcula el número de tokens de entrenamiento de cómputo óptimo para un modelo según la regla de Chinchilla de unos veinte tokens por parámetro, junto con el cómputo de entrenamiento resultante en FLOPs.
Datos de entrada
Modelo
Resultados
Introduce un valor para ver los resultados.
Detalles
Tokens óptimos de Chinchilla
El resultado de escalado de Chinchilla cambió la forma de dimensionar los modelos de lenguaje. Mostró que, para un presupuesto de cómputo fijo, la mejor precisión no surge de hacer el modelo lo más grande posible, sino de escalar a la vez los parámetros y los tokens de entrenamiento, emparejando cada parámetro con unos veinte tokens de datos. Esta calculadora aplica esa proporción: a partir de un número de parámetros devuelve el número de tokens de cómputo óptimo y el cómputo de entrenamiento que implica.
La proporción de cómputo óptimo
Antes de Chinchilla, la práctica habitual dedicaba la mayor parte del presupuesto de cómputo a los parámetros y comparativamente poco a los datos, lo que producía modelos infraentrenados en relación con su tamaño. El estudio de DeepMind de 2022 ajustó leyes de escalado sobre cientos de ejecuciones y halló que la pérdida se minimiza, para un presupuesto dado, cuando el tamaño del modelo y el del conjunto de datos crecen al unísono. El punto de equilibrio empírico sitúa el conjunto de datos óptimo en unos veinte tokens de entrenamiento por parámetro. Un modelo con parámetros debería, por tanto, entrenarse con unos tokens.
La fórmula
Con el número de parámetros en miles de millones y una proporción de tokens por parámetro, el número óptimo de tokens y el cómputo de entrenamiento asociado son
DC=N⋅r=6⋅N⋅D⋅1018donde es el número óptimo de tokens de entrenamiento en miles de millones y el cómputo de entrenamiento en operaciones en coma flotante. El cómputo sigue la regla , que imputa unas seis operaciones por parámetro y por token, y el factor devuelve los miles de millones de y a recuentos absolutos.
Ejemplo resuelto
Considérese un modelo de 70 mil millones de parámetros y la proporción central de veinte tokens por parámetro:
DC=70×20=1400 mil millones de tokens=1.4 billones=6×70×1400×1018=5.88×1023 FLOPsEl conjunto de datos de cómputo óptimo es de unos 1,4 billones de tokens, y entrenar con él cuesta aproximadamente operaciones. Elevar la proporción —por ejemplo, a cien tokens por parámetro— aumenta tanto el número de tokens como el cómputo en proporción directa.
Límites
La proporción de veinte a uno minimiza la pérdida de entrenamiento para un presupuesto de entrenamiento fijo, pero ignora deliberadamente el coste de servir el modelo terminado. Un modelo que responderá a muchas peticiones se entrena con frecuencia con muchos más tokens que el óptimo de Chinchilla, porque un modelo más pequeño entrenado durante más tiempo resulta más barato de ejecutar para la misma calidad. La proporción óptima exacta también se desplaza con el conjunto de datos, el tokenizador y la arquitectura, de modo que veinte es una estimación central y no una constante. El problema complementario de dimensionar un modelo a un presupuesto de cómputo fijo lo aborda la calculadora de Calculadora de tamaño de modelo de cómputo óptimo, y el cómputo bruto de una configuración elegida lo trata la calculadora de Calculadora de FLOPs de entrenamiento.
Preguntas frecuentes (FAQ)
¿Qué es el resultado de escalado de Chinchilla?
El resultado de Chinchilla, publicado por DeepMind en 2022, halló que los modelos grandes anteriores estaban infraentrenados: para un presupuesto de cómputo fijo, la precisión mejora más cuando el tamaño del modelo y los tokens de entrenamiento se escalan a la vez, en lugar de dedicar la mayor parte del presupuesto a los parámetros.
El estudio ajustó leyes de escalado a partir de cientos de ejecuciones de entrenamiento y concluyó que la asignación de cómputo óptimo empareja cada parámetro con unos veinte tokens de entrenamiento, una desviación marcada respecto a los modelos previos, entrenados con proporciones mucho menores.
¿Por qué unos veinte tokens por parámetro?
La proporción se desprende de las leyes de escalado ajustadas a los datos de entrenamiento. Con un presupuesto de cómputo fijo, la pérdida se minimiza cuando el beneficio marginal de añadir parámetros iguala al de añadir tokens, y los exponentes empíricos del estudio de Chinchilla sitúan ese equilibrio cerca de veinte tokens por parámetro.
La cifra exacta depende del conjunto de datos y de la arquitectura, por lo que veinte es una estimación central redondeada, no una constante precisa.
¿Sigue siendo veinte tokens por parámetro el objetivo adecuado?
Veinte es la proporción de cómputo óptimo para minimizar la pérdida de entrenamiento con un presupuesto fijo, pero ignora el coste de inferencia. Un modelo que atenderá muchas peticiones suele entrenarse con muchos más tokens que el óptimo de Chinchilla, porque un modelo más pequeño entrenado durante más tiempo resulta más barato de ejecutar aunque su entrenamiento no fuera de cómputo óptimo.
Varios modelos de uso extendido se entrenan con proporciones de cien o más por este motivo, de modo que veinte es un punto de partida y no un techo.
Aviso legal
La proporción de veinte tokens por parámetro es una estimación central de las leyes de escalado de Chinchilla y varía con el conjunto de datos y la arquitectura. Optimiza únicamente el cómputo de entrenamiento y no tiene en cuenta el coste de inferencia, que a menudo justifica entrenar modelos más pequeños con muchos más tokens. Conviene usar el resultado como punto de partida, no como una regla fija.