Tokens optimaux selon Chinchilla
Données
| Paramètres | 70 |
|---|---|
| Tokens par paramètre | 20 |
Tokens optimaux selon Chinchilla
Calculez le nombre de tokens d'entraînement optimal en calcul selon la règle de Chinchilla, soit environ vingt tokens par paramètre, ainsi que le coût de calcul correspondant en FLOPs.
Données
Modèle
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Tokens optimaux selon Chinchilla
Le résultat de Chinchilla a transformé la façon de dimensionner les modèles de langage. Il a établi que, pour un budget de calcul fixé, la meilleure précision ne s'obtient pas en agrandissant le modèle autant que possible, mais en faisant croître ensemble le nombre de paramètres et le nombre de tokens d'entraînement, en associant à chaque paramètre environ vingt tokens de données. Ce calculateur applique ce ratio : à partir d'un nombre de paramètres, il renvoie le nombre de tokens optimal en calcul ainsi que le coût de calcul qui en découle.
Le ratio optimal en calcul
Avant Chinchilla, la pratique courante consacrait l'essentiel du budget de calcul aux paramètres et relativement peu aux données, ce qui produisait des modèles sous-entraînés par rapport à leur taille. L'étude menée par DeepMind en 2022 a ajusté des lois d'échelle sur des centaines d'entraînements et constaté que la perte est minimale, pour un budget donné, lorsque la taille du modèle et la taille du jeu de données augmentent de concert. Le point d'équilibre empirique situe le jeu de données optimal à environ vingt tokens d'entraînement par paramètre. Un modèle de paramètres devrait donc être entraîné sur environ tokens.
La formule
Avec un nombre de paramètres exprimé en milliards et un ratio de tokens par paramètre, le nombre de tokens optimal et le calcul d'entraînement associé valent
DC=N⋅r=6⋅N⋅D⋅1018où est le nombre de tokens d'entraînement optimal en milliards et le calcul d'entraînement en opérations en virgule flottante. Le calcul suit la règle , qui compte environ six opérations par paramètre et par token, et le facteur ramène les milliards de et de à des comptes absolus.
Exemple chiffré
Prenons un modèle de 70 milliards de paramètres et le ratio central de vingt tokens par paramètre :
DC=70×20=1400 billion tokens=1.4 trillion=6×70×1400×1018=5.88×1023 FLOPsLe jeu de données optimal en calcul compte environ 1 400 milliards de tokens, soit 1,4 billion, et son entraînement coûte à peu près opérations. Relever le ratio — par exemple à cent tokens par paramètre — augmente le nombre de tokens et le calcul dans la même proportion.
Limites
Le ratio de vingt pour un minimise la perte d'entraînement pour un budget d'entraînement fixé, mais il laisse délibérément de côté le coût d'exploitation du modèle terminé. Un modèle appelé à répondre à de nombreuses requêtes est fréquemment entraîné sur beaucoup plus de tokens que l'optimum de Chinchilla, car un modèle plus petit entraîné plus longtemps revient moins cher à servir à qualité égale. Le ratio optimal dépend aussi du jeu de données, du tokeniseur et de l'architecture : vingt est une estimation centrale, non une constante. Le problème complémentaire, qui consiste à dimensionner un modèle pour un budget de calcul fixé, est traité par le Taille de modèle optimale en calcul, et le calcul brut d'une configuration choisie par le Calcul des FLOP d'entraînement.
Questions fréquentes (FAQ)
Qu'est-ce que le résultat de Chinchilla sur les lois d'échelle ?
Le résultat de Chinchilla, publié par DeepMind en 2022, a montré que les grands modèles antérieurs étaient sous-entraînés : pour un budget de calcul fixé, la précision progresse le plus lorsque la taille du modèle et le nombre de tokens d'entraînement croissent ensemble, plutôt que de consacrer l'essentiel du budget aux paramètres.
L'étude a ajusté des lois d'échelle sur des centaines d'entraînements et conclu que la répartition optimale en calcul associe à chaque paramètre environ vingt tokens d'entraînement, en net écart avec les modèles précédents entraînés à des ratios bien plus faibles.
Pourquoi environ vingt tokens par paramètre ?
Ce ratio découle des lois d'échelle ajustées sur les données d'entraînement. Pour un budget de calcul fixé, la perte est minimale lorsque le bénéfice marginal de paramètres supplémentaires égale celui de tokens supplémentaires, et les exposants empiriques de l'étude Chinchilla situent cet équilibre autour de vingt tokens par paramètre.
La valeur exacte dépend du jeu de données et de l'architecture : vingt est donc une estimation centrale arrondie, et non une constante précise.
Vingt tokens par paramètre reste-t-il la bonne cible ?
Vingt est le ratio optimal en calcul pour minimiser la perte d'entraînement à budget d'entraînement fixé, mais il ignore le coût d'inférence. Un modèle appelé à traiter de nombreuses requêtes est souvent entraîné sur beaucoup plus de tokens que l'optimum de Chinchilla, car un modèle plus petit entraîné plus longtemps revient moins cher à exploiter, même si son entraînement n'était pas optimal en calcul.
Plusieurs modèles très utilisés sont entraînés à des ratios de cent ou plus pour cette raison : vingt constitue donc un point de départ plutôt qu'un plafond.
Mentions légales
Le ratio de vingt tokens par paramètre est une estimation centrale issue des lois d'échelle de Chinchilla et varie selon le jeu de données et l'architecture. Il optimise le seul calcul d'entraînement et ne tient pas compte du coût d'inférence, qui justifie souvent d'entraîner des modèles plus petits sur beaucoup plus de tokens. Ce résultat est à utiliser comme point de départ, non comme une règle figée.