Calculadora de calentamiento de la tasa de aprendizaje
Datos de entrada
| Tasa de aprendizaje máxima | 0,0003 |
|---|---|
| Tasa de aprendizaje mínima | 3e-5 |
| Pasos de calentamiento | 2.000 |
| Pasos totales | 100.000 |
| Paso actual | 1.000 |
Calculadora de calentamiento de la tasa de aprendizaje
Calcula la tasa de aprendizaje en cualquier paso de entrenamiento para el calendario estándar de los transformadores: un calentamiento lineal hasta un máximo seguido de un decaimiento coseno hacia un mínimo, junto con la fracción de calentamiento.
Datos de entrada
Calendario
Resultados
Introduce un valor para ver los resultados.
Detalles
Calentamiento de la tasa de aprendizaje
La tasa de aprendizaje es el hiperparámetro de mayor consecuencia en el entrenamiento de redes neuronales, y los transformadores modernos rara vez la mantienen constante. La receta estándar la sube de cero a un máximo a lo largo de los primeros pasos, y luego la hace decaer según una curva coseno hacia un pequeño mínimo durante el resto de la ejecución. Esta calculadora devuelve la tasa de aprendizaje en cualquier paso elegido según ese calendario, junto con la fracción del entrenamiento dedicada al calentamiento.
Por qué la tasa cambia con el tiempo
Al principio del entrenamiento los pesos son aleatorios y las estimaciones del optimizador de las estadísticas del gradiente no son fiables, de modo que las actualizaciones grandes pueden hacer divergir la pérdida. Un breve calentamiento, durante el cual la tasa asciende linealmente desde cero, mantiene pequeñas las actualizaciones tempranas mientras el optimizador se estabiliza. Una vez terminado el calentamiento, una tasa alta acelera el progreso, pero mantenerla alta hasta el final deja al modelo oscilando alrededor de un mínimo en lugar de asentarse. Hacer decaer la tasa —aquí según una curva coseno— permite al modelo dar pasos grandes al inicio y pasos progresivamente más finos a medida que converge.
El calendario
Dos fases gobiernan la tasa. Durante el calentamiento, mientras el paso actual es como mucho la longitud del calentamiento , la tasa sube linealmente hasta el máximo . Tras el calentamiento, sigue un decaimiento coseno del máximo hacia el mínimo a lo largo de los pasos restantes hasta el total .
ηη=ηmaxws=ηmin+21(ηmax−ηmin)(1+cosS−wπ(s−w))(s≤w)(s>w)La fracción de calentamiento es simplemente . En el punto medio del decaimiento el término coseno es cero, de modo que la tasa se sitúa exactamente a mitad de camino entre el máximo y el mínimo.
Ejemplo resuelto
Tómese un máximo de 0,0003, un mínimo de 0,00003, 2.000 pasos de calentamiento y 100.000 pasos totales. En el paso 1.000 —aún dentro del calentamiento— y en el paso 51.000 —el punto medio del decaimiento— las tasas son
η1000η51000=0.0003×20001000=0.00015=0.00003+21(0.0003−0.00003)(1+cos2π)=0.000165A la mitad del calentamiento la tasa es la mitad del máximo. En el punto medio del decaimiento, donde el coseno es cero, queda exactamente entre el máximo y el mínimo. El calentamiento aquí abarca 2.000 de 100.000 pasos, o el 2 % de la ejecución.
Elección de los valores
La tasa máxima domina el calendario y suele hallarse de forma empírica, a menudo con una prueba de rango que eleva la tasa hasta que la pérdida deja de mejorar. Los máximos publicados para transformadores grandes suelen situarse entre aproximadamente 1e-4 y 6e-4, y el máximo tiende a escalar con el tamaño de lote, de modo que cambiar el tamaño de lote efectivo suele exigir reajustarlo. Un calentamiento de unos cientos a unos miles de pasos, a menudo un pequeño porcentaje de la ejecución, es lo habitual. El mínimo se fija con frecuencia en torno a una décima parte del máximo, o en cero cuando se busca un decaimiento completo.
Límites
Los marcos de trabajo difieren en detalles que este modelo no recoge: algunos miden el calendario en tokens en lugar de pasos, otros parametrizan el mínimo como una proporción del máximo y otros añaden una cola final constante o lineal. La forma coseno con calentamiento de aquí es el predeterminado habitual, pero los hiperparámetros correctos dependen del problema y conviene confirmarlos mediante experimentación. El cómputo que representa un número de pasos dado lo estima la calculadora de Calculadora de tiempo y coste de entrenamiento, y la factura del hardware que hay detrás la calculadora de Calculadora de coste de GPU en la nube.
Preguntas frecuentes (FAQ)
¿Por qué calentar la tasa de aprendizaje en lugar de empezar en el máximo?
Al principio del entrenamiento el optimizador dispone de poca información fiable: los métodos adaptativos tienen estimaciones ruidosas de las estadísticas del gradiente, y los pesos inicializados al azar producen actualizaciones grandes y erráticas. Empezar en el máximo completo en ese estado puede desestabilizar o divergir la ejecución.
Subir la tasa a lo largo de los primeros pasos permite que el optimizador se asiente mientras las actualizaciones son pequeñas, tras lo cual la tasa máxima puede aplicarse con seguridad. El calentamiento es especialmente importante con tamaños de lote grandes y transformadores profundos, donde la inestabilidad temprana es más acusada.
¿Qué calendario modela esta calculadora?
Modela el calendario que usa la mayoría del entrenamiento moderno de transformadores: un calentamiento lineal de cero al máximo a lo largo de los pasos de calentamiento, seguido de un decaimiento coseno del máximo hacia el mínimo a lo largo de los pasos restantes. La forma coseno dedica más tiempo a la tasa alta al inicio del decaimiento y se acerca suavemente al fondo al final, lo que empíricamente entrena bien.
Existen otros calendarios —constante, decaimiento lineal, raíz cuadrada inversa y decaimiento por escalones—, pero el calentamiento lineal con decaimiento coseno es el predeterminado habitual que esta herramienta reproduce.
¿Cómo se elige la tasa de aprendizaje máxima?
La tasa máxima es el hiperparámetro más importante del calendario y suele hallarse de forma empírica, a menudo con una breve prueba de rango que aumenta la tasa hasta que la pérdida deja de mejorar y luego retrocede.
Los valores publicados para transformadores grandes suelen situarse entre aproximadamente 1e-4 y 6e-4 para los modelos mayores, y los modelos más pequeños toleran tasas algo más altas. El máximo suele escalar con el tamaño de lote, de modo que un cambio en el tamaño de lote efectivo suele exigir reajustarlo.
Aviso legal
Esta calculadora reproduce el calendario habitual de calentamiento lineal seguido de decaimiento coseno; los marcos de trabajo reales varían en detalles como si el decaimiento se mide en pasos o en tokens y cómo se parametriza el mínimo. Los hiperparámetros óptimos dependen del problema y conviene confirmarlos de forma empírica.
Recomendaciones
Calculadora de tamaño de lote efectivo
Calcula el tamaño de lote efectivo (global) para el entrenamiento distribuido a partir del microlote por dispositivo, el número de dispositivos de paralelismo de datos y los pasos de acumulación de gradiente, junto con los tokens por paso del optimizador.
Calculadora de tiempo y coste de entrenamiento
Estima cuánto dura una ejecución de entrenamiento de un modelo de lenguaje y cuánto cuesta, a partir de los FLOPs totales de entrenamiento, el número de GPUs, el rendimiento máximo por GPU en TFLOP/s, el aprovechamiento de FLOPs del modelo y el precio por hora de la GPU.