Calculadora de tokens de un conjunto de datos
Datos de entrada
| Palabras | 100 |
|---|---|
| Tokens por palabra | 1,3 |
| Épocas | 1 |
Calculadora de tokens de un conjunto de datos
Estima cuántos tokens contiene un corpus de texto a partir de su número de palabras y una proporción de tokens por palabra, y escala por las épocas de entrenamiento para hallar el total de tokens que verá un modelo.
Datos de entrada
Corpus
Resultados
Introduce un valor para ver los resultados.
Detalles
Los tokens de un conjunto de datos
Entrenar y presupuestar un modelo de lenguaje parte de una sola magnitud: cuántos tokens contiene el conjunto de datos. Sin embargo, los corpus suelen describirse en palabras, documentos o gigabytes, no en tokens, y el modelo solo lee tokens. Esta calculadora salva esa distancia convirtiendo un número de palabras en un número estimado de tokens con una proporción de tokens por palabra, y escalando luego por el número de épocas de entrenamiento para dar el total que procesará el modelo.
Tokens, no palabras
Un token es la unidad atómica que un tokenizador produce al dividir el texto en fragmentos de subpalabra. Las palabras frecuentes se convierten a menudo en un solo token, mientras que las más raras o largas se dividen en varios, de modo que un pasaje casi siempre contiene más tokens que palabras. Como el tokenizador aprende la correspondencia, la proporción entre tokens y palabras es una propiedad del tokenizador y del texto, no una constante universal. Tratar palabras y tokens como intercambiables subestima el recuento real y, con él, el cómputo que necesitará una ejecución.
Cómo funciona la estimación
El tamaño del corpus se introduce en millones de palabras, . Multiplicar por la proporción de tokens por palabra da los tokens en una sola pasada sobre los datos. Repetir el corpus durante épocas multiplica el trabajo que realiza el modelo, de modo que los tokens efectivos de entrenamiento son el total de una pasada por el número de épocas. La cifra en miles de millones se deriva del total en millones, porque el tamaño de los conjuntos de entrenamiento se cita casi siempre en miles de millones de tokens.
La fórmula
Con en millones de palabras, una proporción y épocas, el total de una pasada (millones), su forma en miles de millones y el total de entrenamiento escalado por épocas (millones) son
TE=W⋅r=T⋅eLa cifra en miles de millones es simplemente .
Ejemplo resuelto
Tómese un corpus de 100 millones de palabras tokenizado a 1,3 tokens por palabra y entrenado durante tres épocas:
TE=100×1.3=130 millones de tokens=130×3=390 millones de tokensUna pasada sobre los datos es de unos 130 millones de tokens, o 0,13 mil millones. Entrenar durante tres épocas significa que el modelo realiza pasadas hacia delante y hacia atrás sobre el equivalente a 390 millones de tokens, aunque solo 130 millones sean únicos. El total único describe la información disponible; el total escalado por épocas describe el trabajo y, por tanto, el cómputo.
Elección de la proporción
Para prosa en inglés con un tokenizador moderno de pares de bytes, unos 1,3 tokens por palabra es un valor predeterminado razonable, y unos cuatro caracteres por token es una aproximación relacionada. El código, las matemáticas y las escrituras no latinas tienden a fragmentarse en más tokens, lo que eleva la proporción. El enfoque fiable es ejecutar el tokenizador previsto sobre una muestra representativa y dividir su salida de tokens entre el número de palabras de esa muestra, y usar después aquí la proporción medida. La conversión inversa, de un presupuesto de tokens a una longitud legible, la trata la calculadora de Calculadora de tokens a palabras.
Límites
El resultado es una estimación. El recuento exacto de tokens depende del tokenizador concreto, del formato y los espacios en blanco, y de cómo se unen los documentos, nada de lo cual recoge a la perfección una sola proporción. Contar las épocas como tokens adicionales es correcto para el cómputo y el escalado, pero los tokens repetidos no aportan información nueva y ofrecen rendimientos decrecientes a partir de unas pocas pasadas. Para comprobar si un conjunto de datos es lo bastante grande para un tamaño de modelo dado, conviene comparar el total de una pasada con el objetivo de cómputo óptimo de la calculadora de Calculadora de tokens óptimos de Chinchilla.
Preguntas frecuentes (FAQ)
¿En qué se diferencian los tokens de las palabras?
Un token es la unidad que el modelo lee realmente, producida por un tokenizador que divide el texto en fragmentos de subpalabra. Las palabras comunes suelen corresponder a un solo token, mientras que las más raras o largas se dividen en varios, de modo que el número de tokens de un texto suele ser mayor que su número de palabras.
La proporción entre ambos depende del tokenizador y del idioma, razón por la cual esta estimación escala un número de palabras por un factor explícito de tokens por palabra en lugar de suponer que son iguales.
¿Qué proporción de tokens por palabra es razonable?
Para prosa en inglés tokenizada con un tokenizador moderno de pares de bytes o de unigramas, unos 1,3 tokens por palabra es una regla general habitual, y unos cuatro caracteres por token es una estimación relacionada. El código, las matemáticas y los idiomas morfológicamente ricos o de escritura no latina suelen producir más tokens por palabra.
La cifra más fiable se obtiene ejecutando el tokenizador previsto sobre una muestra representativa del corpus real y dividiendo el número de tokens resultante entre el número de palabras.
¿Deben contarse las épocas repetidas como más tokens?
Para las estimaciones de cómputo y de escalado, sí: cada época realiza otro conjunto completo de pasadas hacia delante y hacia atrás sobre los datos, de modo que los tokens efectivos de entrenamiento son el recuento de una pasada por el número de épocas.
Para las cuestiones de unicidad de los datos la distinción importa, porque los tokens repetidos no son información nueva y ofrecen rendimientos decrecientes a partir de unas pocas pasadas. Esta calculadora reporta tanto el total único de una pasada como el total de entrenamiento escalado por épocas, de modo que ambas perspectivas están disponibles.
Aviso legal
Los recuentos de tokens son estimaciones basadas en una proporción media de tokens por palabra; el total exacto depende del tokenizador concreto y del propio texto. Conviene ejecutar el tokenizador previsto sobre una muestra para obtener una cifra precisa antes de comprometer presupuestos de cómputo.