Calculadora de tamaño de muestra para evaluación de LLM
Datos de entrada
| Precisión esperada | 80 % |
|---|---|
| Margen de error | 5 % |
| Nivel de confianza | 95 % |
Calculadora de tamaño de muestra para evaluación de LLM
Determina cuántos ejemplos necesita la evaluación de un modelo para medir su precisión dentro de un margen de error objetivo, mediante la fórmula estándar de tamaño de muestra para una proporción.
Datos de entrada
Precisión objetivo
Resultados
Introduce un valor para ver los resultados.
Detalles
Tamaño de muestra para evaluación de LLM
Cuando se mide la precisión de un modelo en un benchmark, la cifra que se reporta es una estimación obtenida a partir de una muestra finita y arrastra incertidumbre. Ejecutar el mismo modelo sobre otros cincuenta ejemplos hará que la puntuación cambie. Esta calculadora responde a la pregunta de planificación previa a cualquier evaluación: cuántos ejemplos se necesitan para que la precisión medida quede dentro de un margen de error declarado a un nivel de confianza elegido.
La precisión es una proporción
La puntuación de un benchmark es la fracción de ejemplos que un modelo responde correctamente: una proporción. La incertidumbre de una proporción estimada se describe mediante su error estándar, y un intervalo de confianza se construye extendiendo cierto número de errores estándar a cada lado, fijado por el nivel de confianza. Exigir que ese intervalo no sea más ancho que un margen de error objetivo fija el número de ejemplos necesarios.
La fórmula
n=E2z2p(1−p)Aquí es el valor normal estándar correspondiente al nivel de confianza elegido, es la precisión esperada, es el margen de error y es el número de ejemplos, redondeado al alza. Dos rasgos son importantes. El margen entra al cuadrado, de modo que reducirlo a la mitad cuadruplica el requisito: la precisión es costosa. Y la precisión entra a través del producto de por su complemento, que alcanza su máximo en un reparto equilibrado, así que un modelo del que se espera algo cercano a un lanzamiento de moneda necesita el mayor número de ejemplos, mientras que uno próximo a los extremos necesita menos.
Ejemplo resuelto
Supongamos que se espera una precisión cercana al 80 % y se quiere conocerla dentro de ±5 % con un 95 % de confianza:
n=0.0521.962×0.8×0.2=0.00253.8416×0.16≈245.9→246Así que bastan unos 246 ejemplos. Si no se tuviera una estimación previa de la precisión y se usara el peor caso, con un reparto equilibrado, el requisito subiría a 385. Estrechar el margen a ±2,5 % empujaría la cifra del peor caso a más de 1.500, una ilustración concreta del coste cuadrático de la precisión.
Uso del resultado
La cifra es una referencia que supone ejemplos independientes y la aproximación normal, ambas razonables a escala de evaluación. Cuando no se dispone de una estimación fiable de la precisión, conviene planificar en torno a la cifra conservadora del 50 %, ya que es la mayor que puede alcanzar el requisito. Esta calculadora dimensiona una única estimación de precisión; decidir si un modelo o una indicación supera realmente a otro es una comparación de dos proporciones que necesita un tamaño de efecto y potencia estadística, y por lo general más datos. Para ello, véase la Calculadora de significación de pruebas A/B. Para razonar sobre métricas de código basadas en varias muestras, véase la Calculadora pass@k.
Preguntas frecuentes (FAQ)
¿Por qué el tamaño de muestra adopta esta forma?
La precisión en un benchmark es una proporción: la fracción de ejemplos que el modelo acierta. La incertidumbre de una proporción estimada sigue el error estándar binomial, que la fórmula invierte. Para reducir a la mitad el margen de error hay que cuadruplicar el número de ejemplos, porque el margen disminuye con la raíz cuadrada del tamaño de muestra. Elevar el nivel de confianza agranda el valor z y, por tanto, el número de ejemplos.
El resultado supone que los ejemplos se extraen de forma independiente y emplea la aproximación normal, que es precisa para los tamaños de muestra que suelen requerir las evaluaciones.
¿Cómo cambia la respuesta la precisión esperada?
El tamaño necesario depende de p por uno menos p, que es máximo en el 50 % y disminuye hacia los extremos. Un modelo del que se espera una puntuación del 95 % necesita menos ejemplos para acotar que uno del que se espera un 50 %, porque cerca de los extremos hay simplemente menos varianza que medir.
Si no se dispone de una estimación previa fiable, utilice la cifra conservadora calculada con una precisión del 50 %: es la mayor que puede alcanzar el requisito, de modo que siempre es segura.
¿Cubre la comparación de dos modelos?
No. Esto dimensiona una única estimación de precisión hasta una precisión objetivo. Decidir si un modelo o una indicación supera realmente a otro es una comparación de dos proporciones, que requiere tanto un tamaño de efecto deseado como potencia estadística, y por lo general más ejemplos que estimar un único modelo por separado. Para ello, utilice una prueba de dos proporciones diseñada para tasas de victoria.
Aviso legal
La fórmula supone ejemplos independientes y la aproximación normal a la binomial. Dimensiona una única estimación de precisión, no una comparación entre modelos, e ignora cualquier agrupamiento o uso repetido de los mismos elementos. Considere el resultado como una referencia de planificación.
Recomendaciones
Calculadora de significación de pruebas A/B
Comprueba si un prompt o un modelo supera realmente a otro. Introduzca los aciertos y los ensayos de cada variante para obtener las tasas de acierto, una prueba z de dos proporciones, el valor p y los ensayos necesarios para alcanzar la potencia.