Calculateur pass@k
Données
| Taux de réussite par échantillon | 40 % |
|---|---|
| Nombre d'échantillons | 10 |
Calculateur pass@k
Calcule le pass@k pour les évaluations de code et de raisonnement : la probabilité qu'au moins l'un des k échantillons indépendants du modèle résolve un problème, à partir du taux de réussite par échantillon.
Données
Échantillonnage
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
pass@k
Le pass@k est la façon standard d'évaluer les modèles de langage sur les tâches où une réponse candidate peut être vérifiée automatiquement — la plus célèbre étant la génération de code, où chaque tentative passe ou non une suite de tests. Plutôt que de demander si une seule réponse est juste, le pass@k demande si l'une quelconque des k tentatives est juste. Ce calculateur convertit le taux de réussite par échantillon d'un modèle en pass@k, de sorte qu'une précision mesurée unique peut être projetée vers n'importe quel nombre de tentatives.
Ce que mesure le pass@k
Pour chaque problème d'un banc d'essai, le modèle génère k solutions candidates indépendantes, et le problème compte comme résolu si au moins une candidate passe. Le pass@k est la fraction de problèmes résolus selon cette règle. Le pass@1 est la précision ordinaire en un seul coup ; le pass@10 et le pass@100 mesurent la fréquence à laquelle le modèle parvient à une réponse correcte en plusieurs essais. La métrique compte chaque fois qu'un vérificateur externe — une suite de tests, un compilateur, un vérificateur de preuves — peut reconnaître une réponse correcte parmi de nombreuses candidates, car les tentatives supplémentaires se traduisent alors directement par davantage de problèmes résolus.
La formule
Si chaque échantillon réussit indépendamment avec une probabilité , alors un seul échantillon échoue avec une probabilité un moins , et tous les échantillons échouent avec une probabilité . Le pass@k est le complément :
Pkqk=1−(1−p)k=(1−p)koù est le pass@k et la probabilité que toute tentative échoue. La probabilité d'échec total décroît géométriquement avec , ce qui explique pourquoi même un taux par échantillon modeste tend vers la certitude avec suffisamment de tentatives.
Exemple chiffré
Supposons qu'un modèle résolve un problème de code sur 40 % des tentatives uniques, et que l'évaluation autorise 10 échantillons :
q10P10=(1−0.4)10=0.610≈0.0060=1−0.0060≈0.994=99.4%Un taux par échantillon de 40 % devient un pass@10 d'environ 99 %. Ce bond illustre pourquoi les chiffres de pass@k montent si vite avec k, et pourquoi les tableaux de bancs d'essai rapportent plusieurs valeurs de k côte à côte — la forme de cette courbe en dit plus sur un modèle que n'importe quel point isolé.
Comment il est mesuré
Estimer le pass@k en tirant exactement k échantillons est bruité. Des bancs d'essai comme HumanEval tirent plutôt un ensemble plus grand de échantillons, comptent les qui réussissent et utilisent l'estimateur sans biais , qui moyenne sur toutes les façons de choisir des échantillons. La forme d'indépendance utilisée ici coïncide avec cet estimateur lorsque est pris égal à , et c'est le bon outil pour projeter un taux de réussite connu vers un budget de tentatives choisi. Cette forme suppose une réussite égale et indépendante entre les échantillons ; à très basse température, les échantillons deviennent quasi identiques et en ajouter aide peu. Pour planifier le nombre de problèmes qu'une évaluation nécessite pour une estimation stable, voir le Calculateur de taille d'échantillon pour l'évaluation de LLM.
Questions fréquentes (FAQ)
Qu'est-ce que le pass@k ?
Le pass@k est la métrique standard pour la génération de code et d'autres évaluations de type « échantillonner et vérifier ». Pour chaque problème, le modèle génère k solutions candidates, et le problème est compté comme résolu si au moins une candidate passe les tests. Le pass@k est la fraction de problèmes résolus selon cette règle.
Le pass@1 reflète la précision en un seul coup, tandis que le pass@10 ou le pass@100 mesure la fréquence à laquelle le modèle parvient à résoudre un problème en plusieurs essais — pertinent lorsqu'un vérificateur externe, comme une suite de tests ou un validateur, peut repérer une réponse correcte parmi plusieurs.
La formule suppose-t-elle que les échantillons sont indépendants ?
Oui. L'expression un moins (un moins p) puissance k suppose que chacun des k échantillons réussit indépendamment avec la même probabilité p. Cela tient bien lorsque les échantillons sont tirés à une température non nulle, de sorte qu'ils varient.
Cela cesse d'être valable à très basse température, où les échantillons sont quasi identiques et où en tirer davantage n'apporte presque rien, ainsi que lorsque la difficulté des problèmes varie, de sorte qu'un p moyen unique masque un mélange de cas faciles et difficiles. Pour projeter un taux mesuré vers un k différent, la forme d'indépendance est une bonne première approximation.
Comment le pass@k est-il mesuré en pratique ?
Estimer le pass@k en tirant littéralement k échantillons est bruité. Des bancs d'essai comme HumanEval tirent plutôt un nombre plus grand n d'échantillons, comptent les c qui réussissent et utilisent l'estimateur sans biais pass@k = 1 − C(n−c, k) / C(n, k), où C est le coefficient binomial. Cela moyenne sur toutes les façons de choisir k des n échantillons et donne un chiffre bien plus stable.
Ce calculateur utilise la forme d'indépendance plus simple, qui coïncide avec l'estimateur lorsque p est pris égal à c/n, et qui est idéale pour projeter un taux de réussite connu vers un budget de tentatives choisi.
Mentions légales
La forme d'indépendance suppose une probabilité de réussite par échantillon égale et indépendante. Les échantillons réels sont corrélés à basse température et la difficulté varie selon les problèmes, de sorte que le pass@k mesuré peut différer. Utilisez un grand ensemble d'échantillons et l'estimateur sans biais pour publier des résultats de bancs d'essai.
Recommandations
Calculateur de taille d'échantillon pour l'évaluation de LLM
Détermine le nombre d'exemples qu'une évaluation de modèle nécessite pour mesurer la précision dans une marge d'erreur cible, à l'aide de la formule standard de taille d'échantillon pour une proportion.
Calculateur de significativité de test A/B
Teste si une invite ou un modèle en bat réellement un autre. Saisissez les victoires et les essais de chaque variante pour obtenir les taux de victoire, un test z de deux proportions, la valeur p et le nombre d'essais nécessaires à la puissance.