Taille de modèle optimale en calcul
Données
| Budget de calcul | 6 000 |
|---|---|
| Tokens par paramètre | 20 |
Taille de modèle optimale en calcul
À partir d'un budget de calcul d'entraînement en petaFLOP/s-jours, détermine le nombre de paramètres et de tokens optimal au sens de Chinchilla en inversant la règle 6ND pour un ratio tokens par paramètre fixé.
Données
Budget de calcul
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Taille de modèle optimale en calcul
À partir d'une quantité fixe de calcul d'entraînement, les lois d'échelle de Chinchilla indiquent la taille de modèle que ce calcul devrait construire et le nombre de tokens sur lesquels l'entraîner. La répartition optimale en calcul fait croître de concert paramètres et données plutôt que de consacrer tout le budget à la taille. Ce calculateur prend un budget de calcul en petaFLOP/s-jours, maintient constant le ratio tokens par paramètre et inverse la règle 6ND pour renvoyer le nombre de paramètres et de tokens optimal.
Répartir un budget de calcul
Le calcul d'entraînement est bien approché par la règle 6ND : environ six opérations en virgule flottante par paramètre et par token. L'étude Chinchilla a montré que, pour un budget fixé, la perte est minimisée lorsque la taille du modèle et celle du jeu de données croissent ensemble, avec environ vingt tokens d'entraînement par paramètre. Fixer ce ratio transforme l'équation de calcul en une relation portant sur le seul nombre de paramètres, que l'on peut résoudre pour la taille de modèle qu'un budget donné permet.
La formule
Soit le budget en petaFLOP/s-jours et le ratio tokens par paramètre. En convertissant le budget en FLOP et en substituant dans la règle , on obtient , d'où le nombre de paramètres et le nombre de tokens
ND=10916rC⋅8.64×1019=r⋅Noù est le nombre de paramètres optimal en milliards et le nombre de tokens optimal en milliards. Le facteur convertit les petaFLOP/s-jours en FLOP, et la division par exprime en milliards. La racine carrée apparaît parce que le calcul croît avec le carré du nombre de paramètres une fois les tokens liés à celui-ci.
Exemple chiffré
Prenons un budget de 6 000 petaFLOP/s-jours au ratio central de vingt tokens par paramètre :
ND=10916×206000×8.64×1019≈65.7 milliards=20×65.7≈1314.5 milliards=1.31 billionLe budget est le mieux employé pour un modèle d'environ 65,7 milliards de paramètres entraîné sur à peu près 1,31 billion de tokens. Doubler le budget relèverait le nombre de paramètres optimal d'environ la racine carrée de deux, et non d'un facteur deux, du fait de la dépendance en racine carrée.
Limites
Ce résultat reflète la perte d'entraînement optimale en calcul pour un budget d'entraînement fixé, et rien de plus. Il ne pèse pas le coût d'exploitation du modèle, qui fait souvent d'un modèle plus petit entraîné sur davantage de tokens le meilleur choix pratique : les modèles déployés se situent donc fréquemment en deçà du nombre de paramètres renvoyé ici. Le ratio fixe est lui-même une estimation qui varie selon le jeu de données et l'architecture, et les entraînements réels ne soutiennent qu'une fraction du débit crête du matériel. Le versant données du même arbitrage est couvert par le Tokens optimaux selon Chinchilla, et le calcul brut de toute configuration choisie par le Calcul des FLOP d'entraînement.
Questions fréquentes (FAQ)
Comment répartir un budget de calcul fixe entre taille du modèle et données ?
Les lois d'échelle de Chinchilla montrent que, pour un budget d'entraînement fixé, la perte est minimisée lorsque les paramètres et les tokens d'entraînement croissent ensemble plutôt que d'allouer l'essentiel du budget aux paramètres.
En maintenant le ratio tokens par paramètre proche de vingt et en résolvant l'équation de calcul 6ND pour ce budget, on obtient la taille du modèle et la taille du jeu de données qui tirent le meilleur parti du calcul disponible. Des budgets plus importants permettent des modèles et des jeux de données proportionnellement plus grands.
Pourquoi la taille du modèle croît-elle comme la racine carrée du calcul ?
Selon la règle 6ND, le calcul d'entraînement vaut six fois le nombre de paramètres multiplié par le nombre de tokens. En fixant les tokens à un ratio r par paramètre, les tokens valent r fois N, de sorte que le calcul devient six fois r fois N au carré.
Comme le calcul croît avec le carré du nombre de paramètres, retrouver ce nombre à partir d'un budget de calcul exige une racine carrée : N égale la racine carrée du calcul divisé par six r. Les tokens suivent ensuite comme r fois N.
Qu'est-ce qu'un petaFLOP/s-jour ?
Un petaFLOP/s-jour est la quantité de calcul produite en soutenant un petaFLOP/s — soit 10¹⁵ opérations en virgule flottante par seconde — pendant une journée entière. La multiplication par les 86 400 secondes d'une journée donne 8,64 × 10¹⁹ opérations. C'est l'unité courante pour rapporter et comparer les budgets de calcul des grands entraînements, le décompte brut des opérations atteignant des ordres de grandeur peu maniables.
Mentions légales
Ce calcul inverse la règle 6ND au premier ordre pour un ratio tokens par paramètre fixé et reflète uniquement la perte d'entraînement optimale en calcul. Il ne tient compte ni du coût d'inférence, qui favorise souvent des modèles plus petits entraînés plus longtemps, ni d'un taux d'utilisation matérielle inférieur au pic. À considérer comme une estimation de planification.