Nombre de jetons d'un jeu de données
Données
| Mots | 100 |
|---|---|
| Jetons par mot | 1,3 |
| Époques | 1 |
Nombre de jetons d'un jeu de données
Estimez le nombre de jetons d'un corpus de texte à partir de son nombre de mots et d'un ratio de jetons par mot, puis appliquez le nombre d'époques pour obtenir le total de jetons que le modèle verra.
Données
Corpus
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Le nombre de jetons d'un jeu de données
Entraîner et budgéter un modèle de langage part d'une seule grandeur : le nombre de jetons que contient le jeu de données. Les corpus, pourtant, se décrivent d'ordinaire en mots, en documents ou en gigaoctets, jamais en jetons, alors que le modèle ne lit que des jetons. Ce calcul comble cet écart en convertissant un nombre de mots en une estimation de jetons grâce à un ratio de jetons par mot, puis en appliquant le nombre d'époques pour donner le total que le modèle traitera.
Des jetons, pas des mots
Un jeton est l'unité élémentaire que produit un tokeniseur lorsqu'il découpe le texte en fragments de sous-mots. Les mots fréquents deviennent souvent un seul jeton, tandis que les mots plus rares ou plus longs sont scindés en plusieurs : un passage contient donc presque toujours plus de jetons que de mots. Comme la correspondance est apprise par le tokeniseur, le ratio entre jetons et mots est une propriété du tokeniseur et du texte plutôt qu'une constante universelle. Traiter mots et jetons comme interchangeables sous-estime le total réel et, avec lui, le calcul qu'un entraînement exigera.
Comment fonctionne l'estimation
La taille du corpus entre en millions de mots, . La multiplier par le ratio de jetons par mot donne les jetons d'un passage unique sur les données. Répéter le corpus sur époques multiplie le travail effectué par le modèle : les jetons d'entraînement effectifs valent donc le total d'un passage multiplié par le nombre d'époques. Un chiffre en milliards est dérivé du total en millions, car les tailles de jeux d'entraînement se citent le plus souvent en milliards de jetons.
La formule
Avec en millions de mots, le ratio et époques, le total d'un passage (millions), sa forme en milliards et le total d'entraînement multiplié par les époques (millions) valent
TE=W⋅r=T⋅eLe chiffre en milliards est simplement .
Exemple chiffré
Soit un corpus de 100 millions de mots tokenisé à 1,3 jeton par mot et entraîné sur trois époques :
TE=100×1.3=130 millions de jetons=130×3=390 millions de jetonsUn passage sur les données représente environ 130 millions de jetons, soit 0,13 milliard. Entraîner sur trois époques signifie que le modèle effectue des passes avant et arrière sur l'équivalent de 390 millions de jetons, alors que 130 millions seulement sont uniques. Le total unique décrit l'information disponible ; le total multiplié par les époques décrit le travail et donc le calcul.
Choisir le ratio
Pour un texte courant et un tokeniseur moderne par paires d'octets, un ratio d'environ 1,3 jeton par mot constitue une valeur par défaut raisonnable, et environ quatre caractères par jeton en est une approximation voisine. Le code, les mathématiques et les écritures non latines tendent à se fragmenter en davantage de jetons, ce qui relève le ratio. La démarche fiable consiste à passer le tokeniseur prévu sur un échantillon représentatif et à diviser sa sortie en jetons par le nombre de mots de cet échantillon, puis à utiliser ici le ratio mesuré. La conversion inverse, d'un budget de jetons vers une longueur lisible, est traitée par le Calculateur de jetons en mots.
Limites
Le résultat est une estimation. Le nombre exact de jetons dépend du tokeniseur retenu, de la mise en forme et des espaces, ainsi que de la façon dont les documents sont assemblés, autant d'éléments qu'un ratio unique ne capte pas parfaitement. Compter les époques comme des jetons supplémentaires est correct pour le calcul et les lois d'échelle, mais les jetons répétés n'apportent aucune information nouvelle et offrent des rendements décroissants au-delà de quelques passages. Pour vérifier qu'un jeu de données est assez vaste pour une taille de modèle donnée, comparez le total d'un passage à la cible optimale en calcul du Tokens optimaux selon Chinchilla.
Questions fréquentes (FAQ)
En quoi les jetons diffèrent-ils des mots ?
Un jeton est l'unité que le modèle lit réellement, produite par un tokeniseur qui découpe le texte en fragments de sous-mots. Les mots courants correspondent souvent à un seul jeton, tandis que les mots plus rares ou plus longs sont scindés en plusieurs : le nombre de jetons d'un texte dépasse donc généralement son nombre de mots.
Le ratio entre les deux dépend du tokeniseur et de la langue, raison pour laquelle cette estimation multiplie le nombre de mots par un facteur explicite de jetons par mot plutôt que de les supposer équivalents.
Quel ratio de jetons par mot retenir ?
Pour un texte courant tokenisé avec un tokeniseur moderne par paires d'octets ou de type unigramme, un ratio d'environ 1,3 jeton par mot constitue un ordre de grandeur courant, et environ quatre caractères par jeton en est une estimation voisine. Le code, les mathématiques et les langues à morphologie riche ou à écriture non latine produisent en général davantage de jetons par mot.
La valeur la plus fiable s'obtient en passant le tokeniseur cible sur un échantillon représentatif du corpus réel, puis en divisant le nombre de jetons obtenu par le nombre de mots.
Faut-il compter les époques répétées comme des jetons supplémentaires ?
Pour les estimations de calcul et de lois d'échelle, oui : chaque époque effectue un nouvel ensemble complet de passes avant et arrière sur les données, de sorte que les jetons d'entraînement effectifs valent le total d'un passage multiplié par le nombre d'époques.
Pour les questions d'unicité des données, la distinction compte, car les jetons répétés n'apportent pas d'information nouvelle et offrent des rendements décroissants au-delà de quelques passages. Ce calcul indique à la fois le total unique d'un passage et le total d'entraînement multiplié par les époques, afin de disposer des deux points de vue.
Mentions légales
Le nombre de jetons est une estimation fondée sur un ratio moyen de jetons par mot ; le total exact dépend du tokeniseur retenu et du texte lui-même. Passez le tokeniseur prévu sur un échantillon pour obtenir une valeur précise avant d'engager un budget de calcul.