Calculateur de perplexité
Données
| Perte d'entropie croisée | 2 |
|---|
Calculateur de perplexité
Convertit la perte d'entropie croisée d'un modèle de langage en perplexité et en bits par jeton. La perplexité est l'exponentielle de la perte moyenne par jeton mesurée sur un texte de validation.
Données
Perte
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
La perplexité
La perplexité est la mesure intrinsèque la plus répandue de la qualité de prédiction d'un texte par un modèle de langage. Elle résume l'incertitude moyenne du modèle en un seul nombre à la lecture intuitive : grossièrement, combien de choix également probables le modèle pèse à chaque jeton. Ce calculateur convertit une perte d'entropie croisée — la grandeur que rapportent les cadres d'entraînement — en perplexité et en bits par jeton.
De la perte à la perplexité
Lorsqu'un modèle de langage lit un texte de validation, il attribue une probabilité à chaque jeton suivant réel. La perte d'entropie croisée est la moyenne du log négatif de ces probabilités ; un modèle confiant et correct obtient une perte faible, un modèle surpris une perte élevée. La perplexité est simplement l'exponentielle de cette moyenne :
PPLH2=eL=ln2Loù est la perte par jeton en nats et l'équivalent en bits par jeton. L'exponentiation défait le logarithme contenu dans la perte, transformant une grandeur additive en une « taille de vocabulaire effective » multiplicative. Un modèle parfait attribue une probabilité de un à chaque jeton correct, donnant une perte de zéro et une perplexité de un — aucune incertitude du tout.
Exemple chiffré
Supposons qu'un modèle rapporte une perte d'entropie croisée de 2,0 nats sur un texte de validation :
PPLH2=e2.0≈7.39=ln22.0≈2.885 bits/tokenUne perplexité d'environ 7,4 signifie que, en moyenne sur le texte, le modèle est aussi incertain que s'il choisissait uniformément parmi environ sept ou huit jetons également probables. Le chiffre en bits par jeton se relie à la compression : un codeur idéal utilisant ce modèle aurait besoin d'environ 2,9 bits pour encoder chaque jeton, de sorte qu'un modèle de perplexité plus faible pourrait compresser le même texte plus densément.
Lire et comparer la perplexité
Une perplexité plus faible signifie une meilleure prédiction, mais ce nombre n'a de sens que pour un tokeniseur et un jeu d'évaluation fixes. Comme elle se mesure par jeton, un modèle qui découpe le texte en jetons plus nombreux et plus petits affiche une perplexité différente sur le même passage qu'un modèle au vocabulaire plus grossier, même à qualité sous-jacente égale. Les comparaisons sont valables lorsque le tokeniseur et le texte de test sont identiques, et trompeuses autrement. La perplexité ne dit par ailleurs rien sur la capacité d'un modèle à suivre des instructions ou à raisonner — pour cela, on utilise des évaluations fondées sur des tâches. Pour planifier le nombre d'exemples qu'une telle évaluation nécessite, voir le Calculateur de taille d'échantillon pour l'évaluation de LLM, et pour le scoring de génération de code, voir le Calculateur pass@k.
Questions fréquentes (FAQ)
Que mesure la perplexité ?
La perplexité mesure la qualité de prédiction d'un modèle probabiliste sur un échantillon — plus c'est bas, mieux c'est. C'est l'exponentielle de la perte d'entropie croisée moyenne, et elle se lit comme un facteur de branchement effectif : une perplexité de 8 signifie que le modèle est, en moyenne, aussi incertain que s'il devait choisir uniformément parmi 8 jetons suivants également probables. Un modèle parfait, attribuant toujours une probabilité de un au jeton correct, aurait une perte de zéro et une perplexité de un.
Comme elle se calcule directement à partir des probabilités du modèle lui-même, la perplexité ne nécessite aucune étiquette et constitue la mesure intrinsèque standard de l'ajustement d'un modèle de langage.
Quelle est la différence entre les nats et les bits ?
Ce sont tous deux des unités d'information qui ne diffèrent que par la base du logarithme. Un nat utilise le logarithme naturel et correspond à ce que la plupart des codes d'entraînement rapportent ; un bit utilise la base deux. Un nat équivaut à environ 1,443 bit, de sorte que diviser la perte en nats par le logarithme naturel de deux la convertit en bits par jeton.
Les bits par jeton sont pratiques car ils se relient directement à la compression : un modèle dont le chiffre de bits par jeton est plus faible pourrait, en principe, compresser le même texte en moins de bits.
La perplexité peut-elle être comparée entre modèles ?
Uniquement lorsque le tokeniseur et le texte d'évaluation sont identiques. La perplexité se mesure par jeton : un modèle qui découpe le texte en jetons plus nombreux et plus petits affichera une perplexité différente sur le même passage qu'un modèle au vocabulaire plus grossier, même à qualité sous-jacente égale.
Les comparaisons ne sont donc valables que pour un tokeniseur et un jeu de données fixes, et trompeuses entre des configurations différentes. Pour comparer les capacités entre modèles, on utilise plutôt des métriques fondées sur des tâches.
Mentions légales
La perplexité est une mesure intrinsèque liée à un tokeniseur et à un jeu d'évaluation précis ; elle n'est pas directement comparable entre des modèles aux vocabulaires différents, ni un substitut à une évaluation fondée sur des tâches. Vérifiez que la perte est bien par jeton et exprimée en nats avant de la convertir.