Calculateur de significativité de test A/B
Données
| Victoires (A) | 540 |
|---|---|
| Essais (A) | 1 000 |
| Victoires (B) | 590 |
| Essais (B) | 1 000 |
Calculateur de significativité de test A/B
Teste si une invite ou un modèle en bat réellement un autre. Saisissez les victoires et les essais de chaque variante pour obtenir les taux de victoire, un test z de deux proportions, la valeur p et le nombre d'essais nécessaires à la puissance.
Données
Variante A
Variante B
Résultats
Saisissez une valeur pour afficher les résultats.
not_significant
Détails
Significativité d'un test A/B
Lorsque vous changez une invite, remplacez un modèle ou ajustez un paramètre de décodage, la nouvelle version gagne généralement sur certains exemples et perd sur d'autres. La question est de savoir si l'écart mesuré reflète une amélioration réelle ou seulement la chance des exemples que vous avez testés. Ce calculateur applique un test z de deux proportions à deux taux de victoire et rapporte les taux de victoire, la statistique du test, la valeur p et le nombre d'essais qu'une comparaison fiable nécessiterait.
Comparer deux taux de victoire
Chaque variante se résume à un taux de victoire : victoires divisées par essais, où une « victoire » est tout ce qui compte comme succès — un test réussi, une réponse préférée dans un jugement comparatif, une réponse correcte. Deux taux mesurés sur des échantillons finis ne seront presque jamais exactement égaux, même si les variantes sont identiques ; le test demande donc à quel point ils sont éloignés par rapport au bruit de chaque estimation.
La formule
Le test regroupe les deux échantillons pour estimer un taux commun, l'utilise pour calculer l'erreur type de la différence, puis divise :
pˉzP=na+nbwa+wb=pˉ(1−pˉ)(na1+nb1)pb−pa=2(1−Φ(∣z∣))Ici et sont les taux de victoire, le taux regroupé, le nombre d'erreurs types qui séparent les taux, la fonction de répartition de la loi normale centrée réduite, et la valeur p bilatérale. Une magnitude de au-delà d'environ 1,96 marque le seuil de significativité de 5 %.
Exemple chiffré
Supposons que l'invite A gagne 540 de 1 000 tâches jugées et l'invite B 590 de 1 000 :
pˉzP=2000540+590=0.565=0.565×0.435×(0.001+0.001)0.59−0.54=0.02220.05≈2.26≈0.024L'écart de cinq points dépasse le seuil de 1,96, avec une valeur p proche de 0,024 — inférieure à 0,05, de sorte que la différence est statistiquement significative : le hasard est une explication peu probable. Le chiffre de planification montre que détecter de manière fiable un écart de cette taille (95 % de confiance, 80 % de puissance) demanderait environ 1 538 essais par variante ; les 1 000 essais ici placent donc le résultat juste au-dessus de la limite plutôt que confortablement au-delà.
Lire le résultat avec prudence
La significativité n'est pas l'importance — un écart minuscule et sans intérêt peut être significatif avec assez d'essais, et un écart notable peut manquer la significativité avec trop peu. Le test suppose par ailleurs des essais indépendants et une comparaison unique : évaluer de nombreuses variantes à la fois, ou consulter à répétition les résultats à mesure que les données arrivent, gonfle les faux positifs et appelle des ajustements. Pour dimensionner une évaluation avant de la lancer, voir le Calculateur de taille d'échantillon pour l'évaluation de LLM ; pour les métriques de code de type « échantillonner et vérifier », voir le Calculateur pass@k.
Questions fréquentes (FAQ)
Que signifie la significativité statistique ici ?
Elle demande si l'écart observé entre les deux taux de victoire est plus grand que ce que le hasard produirait couramment si les variantes étaient en réalité équivalentes. Le test z de deux proportions regroupe les deux taux, estime l'erreur type de leur différence et indique de combien d'erreurs types ils sont séparés.
La valeur p est la probabilité d'un écart au moins aussi grand sous l'hypothèse d'absence de différence réelle. Une faible valeur p — conventionnellement inférieure à 0,05 — signifie que le hasard est une explication peu probable : l'écart est alors qualifié de significatif.
Elle ne mesure pas l'ampleur ni l'importance de la différence, seulement la confiance avec laquelle on peut la distinguer du bruit.
De combien d'essais ai-je besoin ?
Assez pour détecter l'écart qui vous importe sans être trompé par le bruit. Le calculateur indique le nombre d'essais par variante requis pour détecter l'écart observé à 95 % de confiance et 80 % de puissance — les cibles de planification standards.
Des écarts réels plus petits nécessitent bien plus d'essais, car l'écart doit dépasser une erreur type qui ne décroît qu'avec la racine carrée de la taille d'échantillon. Si vos nombres d'essais actuels sont bien inférieurs au chiffre affiché, un résultat non significatif peut simplement traduire un manque de données plutôt que des variantes réellement équivalentes.
Est-ce un test unilatéral ou bilatéral ?
Bilatéral. La valeur p reflète la probabilité d'un écart aussi grand dans l'un ou l'autre sens, ce qui est le choix par défaut approprié lorsque vous ne vous êtes pas engagé à l'avance sur la variante gagnante.
Un test unilatéral, utilisé uniquement lorsque le sens est fixé au préalable, diviserait la valeur p par deux mais risquerait de manquer un effet réel dans le sens inattendu. Pour comparer des invites ou des modèles sans engagement préalable, le test bilatéral est le choix prudent.
Mentions légales
Ce test suppose des essais indépendants et utilise l'approximation normale, fiable lorsque chaque variante compte au moins une poignée de victoires et de défaites. Il ne corrige ni le test simultané de nombreuses variantes ni la consultation répétée des résultats, qui gonflent tous deux les faux positifs. Considérez-le comme un indice, non une preuve, et préenregistrez votre comparaison lorsque c'est possible.