Calculadora de significación de pruebas A/B
Datos de entrada
| Aciertos (A) | 540 |
|---|---|
| Ensayos (A) | 1.000 |
| Aciertos (B) | 590 |
| Ensayos (B) | 1.000 |
Calculadora de significación de pruebas A/B
Comprueba si un prompt o un modelo supera realmente a otro. Introduzca los aciertos y los ensayos de cada variante para obtener las tasas de acierto, una prueba z de dos proporciones, el valor p y los ensayos necesarios para alcanzar la potencia.
Datos de entrada
Variante A
Variante B
Resultados
Introduce un valor para ver los resultados.
not_significant
Detalles
Significación de pruebas A/B
Al cambiar un prompt, sustituir un modelo o ajustar una opción de decodificación, la nueva versión suele ganar en algunos ejemplos y perder en otros. La cuestión es si la diferencia medida refleja una mejora genuina o solo la suerte de los ejemplos que se hayan probado. Esta calculadora aplica una prueba z de dos proporciones a dos tasas de acierto e informa de las tasas de acierto, el estadístico de prueba, el valor p y el número de ensayos que necesitaría una comparación fiable.
Comparación de dos tasas de acierto
Cada variante se resume mediante una tasa de acierto: los aciertos divididos por los ensayos, donde un «acierto» es lo que cuente como éxito —una prueba superada, una respuesta preferida en un juicio directo, una respuesta correcta—. Dos tasas medidas sobre muestras finitas casi nunca serán exactamente iguales aunque las variantes sean idénticas, de modo que la prueba pregunta cuán separadas están en relación con el ruido de cada estimación.
La fórmula
La prueba combina las dos muestras para estimar una tasa común, la usa para calcular el error estándar de la diferencia y divide:
pˉzP=na+nbwa+wb=pˉ(1−pˉ)(na1+nb1)pb−pa=2(1−Φ(∣z∣))Aquí y son las tasas de acierto, es la tasa combinada, es cuántos errores estándar separan las tasas, es la distribución normal acumulada estándar y es el valor p bilateral. Una magnitud de por encima de aproximadamente 1,96 marca el umbral de significación del 5 %.
Ejemplo resuelto
Supongamos que el prompt A acierta 540 de 1.000 tareas juzgadas y el prompt B acierta 590 de 1.000:
pˉzP=2000540+590=0.565=0.565×0.435×(0.001+0.001)0.59−0.54=0.02220.05≈2.26≈0.024La diferencia de cinco puntos supera el umbral de 1,96, con un valor p cercano a 0,024 —por debajo de 0,05—, de modo que la diferencia es estadísticamente significativa: el azar es una explicación poco probable. La cifra de planificación muestra que detectar de forma fiable una diferencia de este tamaño (95 % de confianza, 80 % de potencia) requeriría unos 1.538 ensayos por variante, así que los 1.000 ensayos de aquí dejan el resultado justo por encima de la línea y no holgadamente más allá de ella.
Lectura del resultado con cautela
La significación no es importancia: una diferencia minúscula e irrelevante puede ser significativa con suficientes ensayos, y una diferencia relevante puede quedarse sin significación con demasiado pocos. La prueba también supone ensayos independientes y una sola comparación: evaluar muchas variantes a la vez, o revisar los resultados repetidamente conforme llegan los datos, inflan los falsos positivos y exigen ajustes. Para dimensionar una evaluación antes de ejecutarla, consulte la Calculadora de tamaño de muestra para evaluación de LLM; para métricas de código del tipo muestrear y comprobar, consulte la Calculadora pass@k.
Preguntas frecuentes (FAQ)
¿Qué significa aquí la significación estadística?
Plantea si la distancia observada entre las dos tasas de acierto es mayor de la que surgiría habitualmente del azar en caso de que las variantes fueran iguales. La prueba z de dos proporciones combina las dos tasas, estima el error estándar de su diferencia e informa de cuántos errores estándar las separan.
El valor p es la probabilidad de una diferencia al menos así de grande bajo el supuesto de que no existe una diferencia real. Un valor p pequeño —por convención, inferior a 0,05— indica que el azar es una explicación poco probable, por lo que la diferencia se considera significativa.
No mide cuán grande o importante es la diferencia, solo con qué confianza se distingue del ruido.
¿Cuántos ensayos se necesitan?
Los suficientes para detectar la diferencia que interesa sin dejarse engañar por el ruido. La calculadora indica los ensayos por variante necesarios para detectar la diferencia observada con un 95 % de confianza y un 80 % de potencia, los objetivos habituales de planificación.
Las diferencias reales más pequeñas requieren muchos más ensayos, porque la distancia debe superar un error estándar que solo se reduce con la raíz cuadrada del tamaño de la muestra. Si los recuentos de ensayos actuales quedan muy por debajo de la cifra mostrada, un resultado no significativo puede reflejar sencillamente una cantidad de datos insuficiente y no variantes genuinamente iguales.
¿Es una prueba unilateral o bilateral?
Bilateral. El valor p refleja la probabilidad de una diferencia así de grande en cualquier dirección, que es la opción predeterminada apropiada cuando no se ha fijado de antemano qué variante ganaría.
Una prueba unilateral, empleada solo cuando la dirección está fijada con antelación, dividiría el valor p a la mitad, pero corre el riesgo de pasar por alto un efecto real en la dirección inesperada. Al comparar prompts o modelos sin un compromiso previo, la prueba bilateral es la opción segura.
Aviso legal
Esta prueba supone ensayos independientes y emplea la aproximación normal, fiable cuando cada variante tiene al menos un puñado de aciertos y de fallos. No corrige por la comparación de muchas variantes a la vez ni por la revisión repetida de los resultados, factores que ambos inflan los falsos positivos. Trátela como un indicio, no como una prueba definitiva, y preinscriba la comparación siempre que sea posible.