Calculadora de tamaño de lote efectivo
Datos de entrada
| Lote por dispositivo | 8 |
|---|---|
| Dispositivos de paralelismo de datos | 64 |
| Pasos de acumulación | 4 |
| Longitud de secuencia | 4.096 |
Calculadora de tamaño de lote efectivo
Calcula el tamaño de lote efectivo (global) para el entrenamiento distribuido a partir del microlote por dispositivo, el número de dispositivos de paralelismo de datos y los pasos de acumulación de gradiente, junto con los tokens por paso del optimizador.
Datos de entrada
Paralelismo
Secuencia
Resultados
Introduce un valor para ver los resultados.
Tamaño de lote efectivo
El tamaño de lote efectivo es el número de ejemplos de entrenamiento que contribuyen a una sola actualización del optimizador. En un único dispositivo equivale al microlote, pero el entrenamiento distribuido reparte el trabajo entre muchos aceleradores y a menudo suma varias pasadas antes de cada cambio de pesos, de modo que el lote global que el optimizador ve realmente puede ser cientos de veces mayor que el que cabe en un solo chip. Esta calculadora reconstruye esa cifra global, y los tokens que representa, a partir de los tres factores que la producen.
Por qué importa el lote global
Casi todos los calendarios de tasa de aprendizaje, las longitudes de calentamiento y los resultados de convergencia de la literatura se expresan en términos del lote global, no del microlote por dispositivo. Un equipo que escala de 8 a 64 dispositivos sin recalcular el lote efectivo cambiará en silencio la dinámica de optimización —el mismo código da ahora un paso 8 veces mayor por actualización— y puede divergir o estancarse. Conocer el lote efectivo es, por tanto, un requisito previo para ajustar la tasa de aprendizaje, reproducir una receta publicada o comparar dos ejecuciones en clústeres de distinto tamaño.
La fórmula
Tres factores independientes se multiplican entre sí. Con un microlote por dispositivo , un número de réplicas de paralelismo de datos y unos pasos de acumulación de gradiente , el lote efectivo y los tokens por paso del optimizador con una longitud de secuencia son
BT=b⋅d⋅a=B⋅LCada réplica de paralelismo de datos procesa su propio microlote y los gradientes se promedian, de modo que las réplicas multiplican el lote. La acumulación suma pasadas sucesivas antes de una actualización, multiplicándolo de nuevo. El recuento de tokens es simplemente el número de secuencias por la longitud de cada secuencia.
Ejemplo resuelto
Tómese un microlote de 8 secuencias en cada uno de 64 dispositivos, con 4 pasos de acumulación y un contexto de 4.096 tokens:
BT=8×64×4=2048=2048×4096=8388608El optimizador ve 2.048 secuencias —unos 8,4 millones de tokens— por actualización, aunque ningún dispositivo individual mantenga nunca más de 8 secuencias a la vez. Duplicar los pasos de acumulación a 8 elevaría el lote efectivo a 4.096 sin ningún cambio en la memoria por dispositivo, a costa del doble de pasadas entre actualizaciones.
Límites
Este modelo cubre la replicación de paralelismo de datos y la acumulación de gradiente, los dos factores que cambian el lote global. Ignora deliberadamente el paralelismo de tensores, de canalización y de secuencia: estos reparten un único modelo o secuencia entre dispositivos para que quepa en memoria, pero no amplían el lote global, de modo que los dispositivos entre los que se reparte una réplica no deben contarse en . La cifra de tokens también supone una longitud de secuencia fija; los lotes de longitud variable o empaquetados necesitan una contabilidad de tokens aparte. El lado de la memoria al elegir el microlote lo cubre la calculadora de Calculadora de memoria de acumulación de gradientes, y cómo escala el rendimiento al añadir dispositivos la calculadora de Calculadora de escalado de paralelismo de datos.
Preguntas frecuentes (FAQ)
¿Qué es el tamaño de lote efectivo?
El tamaño de lote efectivo, o global, es el número de ejemplos de entrenamiento que contribuyen a una sola actualización del optimizador. En el entrenamiento distribuido es el microlote por dispositivo multiplicado por el número de réplicas de paralelismo de datos y por los pasos de acumulación de gradiente, porque todas esas pasadas se suman antes de que los pesos cambien una vez.
Es la cifra que importa para el escalado de la tasa de aprendizaje y la reproducibilidad, no el microlote menor que cabe en un solo dispositivo.
¿Por qué usar acumulación de gradiente?
La acumulación de gradiente ejecuta varias pasadas hacia delante y hacia atrás y suma sus gradientes antes de aplicar un paso del optimizador, lo que eleva el lote efectivo sin mantener más activaciones en memoria a la vez. Permite que una configuración limitada por la memoria iguale el comportamiento de lote grande de un clúster mayor, a costa de más tiempo real por actualización.
El compromiso es rendimiento por memoria: cada paso de acumulación es cómputo real, pero solo se produce una actualización del optimizador y un conjunto de comunicación por ciclo.
¿En qué se diferencian el tamaño de lote y los tokens por paso?
El tamaño de lote cuenta secuencias, mientras que los tokens por paso cuentan los tokens individuales que esas secuencias contienen: el lote multiplicado por la longitud de secuencia. La planificación de presupuestos de tokens y muchos calendarios publicados de tasa de aprendizaje se expresan por token, de modo que la cifra de tokens suele ser la más transferible.
Dos ejecuciones con el mismo número de secuencias pero longitudes de secuencia distintas ven recuentos de tokens diferentes por paso, razón por la cual aquí se reportan ambas cifras.
Aviso legal
Esta calculadora cubre únicamente la replicación de paralelismo de datos y la acumulación de gradiente. No modela el paralelismo de tensores, de canalización ni de secuencia, que cambian cómo se reparte un lote global entre dispositivos pero no el propio lote global. Conviene confirmar que el marco de trabajo cuenta los microlotes y la acumulación de la misma manera.
Recomendaciones
Calculadora de memoria de acumulación de gradientes
Calcula el tamaño de lote efectivo alcanzado mediante la acumulación de gradientes y la memoria de activaciones que requiere, a partir del tamaño de microlote, los pasos de acumulación, las réplicas de paralelismo de datos y el coste de activación por muestra.
Calculadora de escalado de paralelismo de datos
Estima el rendimiento real de entrenamiento entre dispositivos de paralelismo de datos a partir del rendimiento por dispositivo y la eficiencia de escalado, con el rendimiento lineal ideal y la aceleración alcanzada frente a un solo dispositivo.