Calculadora de Significância de Teste A/B
Entradas
| Vitórias (A) | 540 |
|---|---|
| Tentativas (A) | 1.000 |
| Vitórias (B) | 590 |
| Tentativas (B) | 1.000 |
Calculadora de Significância de Teste A/B
Teste se um prompt ou modelo realmente supera outro. Insira vitórias e tentativas de cada variante para obter as taxas de vitória, um teste z de duas proporções, o valor-p e as tentativas necessárias para o poder.
Entradas
Variante A
Variante B
Resultados
Insira um valor para ver os resultados.
not_significant
Detalhes
Significância de teste A/B
Quando você muda um prompt, troca um modelo ou ajusta uma configuração de decodificação, a nova versão geralmente vence em alguns exemplos e perde em outros. A questão é se a diferença medida reflete uma melhoria genuína ou apenas a sorte de quais exemplos você acabou testando. Esta calculadora aplica um teste z de duas proporções a duas taxas de vitória e relata as taxas de vitória, a estatística do teste, o valor-p e o número de tentativas que uma comparação confiável exigiria.
Comparando duas taxas de vitória
Cada variante é resumida por uma taxa de vitória: vitórias divididas por tentativas, em que uma "vitória" é o que quer que conte como sucesso — um teste aprovado, uma resposta preferida em um julgamento direto, uma resposta correta. Duas taxas medidas em amostras finitas quase nunca serão exatamente iguais, mesmo que as variantes sejam idênticas, então o teste pergunta quão distantes elas estão em relação ao ruído em cada estimativa.
A fórmula
O teste combina as duas amostras para estimar uma taxa comum, usa-a para calcular o erro padrão da diferença e divide:
pˉzP=na+nbwa+wb=pˉ(1−pˉ)(na1+nb1)pb−pa=2(1−Φ(∣z∣))Aqui e são as taxas de vitória, é a taxa combinada, é quantos erros padrão separam as taxas, é a distribuição cumulativa normal padrão e é o valor-p bilateral. Uma magnitude de acima de aproximadamente 1,96 marca o limiar de significância de 5%.
Exemplo resolvido
Suponha que o prompt A vence 540 de 1.000 tarefas julgadas e o prompt B vence 590 de 1.000:
pˉzP=2000540+590=0.565=0.565×0.435×(0.001+0.001)0.59−0.54=0.02220.05≈2.26≈0.024A diferença de cinco pontos supera o limiar de 1,96, com um valor-p próximo de 0,024 — abaixo de 0,05, de modo que a diferença é estatisticamente significativa: o acaso é uma explicação improvável. O valor de planejamento mostra que detectar uma diferença desse tamanho de forma confiável (95% de confiança, 80% de poder) exigiria cerca de 1.538 tentativas por variante, então as 1.000 tentativas aqui colocam o resultado logo acima da linha, em vez de confortavelmente além dela.
Lendo o resultado com cuidado
Significância não é importância — uma diferença minúscula e irrelevante pode ser significativa com tentativas suficientes, e uma diferença relevante pode não atingir a significância com poucas. O teste também pressupõe tentativas independentes e uma única comparação: avaliar muitas variantes ao mesmo tempo, ou verificar os resultados repetidamente conforme os dados chegam, ambos inflam falsos positivos e exigem ajustes. Para dimensionar uma avaliação antes de executá-la, veja a Calculadora de Tamanho de Amostra para Avaliação de LLM; para métricas de código do tipo amostrar-e-verificar, veja a Calculadora de pass@k.
Perguntas frequentes (FAQ)
O que significa significância estatística aqui?
Ela pergunta se a diferença observada entre as duas taxas de vitória é maior do que surgiria rotineiramente do acaso caso as variantes fossem de fato iguais. O teste z de duas proporções combina as duas taxas, estima o erro padrão de sua diferença e relata quantos erros padrão as separam.
O valor-p é a probabilidade de uma diferença pelo menos tão grande quanto esta sob a hipótese de nenhuma diferença real. Um valor-p pequeno — convencionalmente abaixo de 0,05 — significa que o acaso é uma explicação improvável, então a diferença é chamada de significativa.
Isso não mede quão grande ou importante é a diferença, apenas com que confiança ela pode ser distinguida do ruído.
De quantas tentativas eu preciso?
O suficiente para detectar a diferença que importa para você sem ser enganado pelo ruído. A calculadora relata as tentativas por variante necessárias para detectar a diferença observada com 95% de confiança e 80% de poder — as metas de planejamento padrão.
Diferenças verdadeiras menores exigem muito mais tentativas, porque a distância precisa superar um erro padrão que só encolhe com a raiz quadrada do tamanho da amostra. Se suas contagens atuais de tentativas estão bem abaixo do valor mostrado, um resultado não significativo pode simplesmente refletir poucos dados, e não variantes genuinamente iguais.
Este é um teste unilateral ou bilateral?
Bilateral. O valor-p reflete a chance de uma diferença tão grande quanto esta em qualquer direção, o que é o padrão apropriado quando você não se comprometeu de antemão com qual variante venceria.
Um teste unilateral, usado apenas quando a direção é fixada com antecedência, reduziria o valor-p pela metade, mas corre o risco de não detectar um efeito real na direção inesperada. Ao comparar prompts ou modelos sem um compromisso prévio, o teste bilateral é a escolha segura.
Aviso legal
Este teste pressupõe tentativas independentes e usa a aproximação normal, que é confiável quando cada variante tem pelo menos um punhado de vitórias e derrotas. Ele não ajusta para o teste de muitas variantes ao mesmo tempo nem para a verificação repetida dos resultados, ambos os quais inflam falsos positivos. Trate-o como evidência, não como prova, e pré-registre sua comparação sempre que possível.