Calculadora pass@k
Datos de entrada
| Tasa de éxito por muestra | 40 % |
|---|---|
| Número de muestras | 10 |
Calculadora pass@k
Calcula pass@k para evaluaciones de código y razonamiento: la probabilidad de que al menos una de k muestras independientes del modelo resuelva un problema, a partir de la tasa de éxito por muestra.
Datos de entrada
Muestreo
Resultados
Introduce un valor para ver los resultados.
Detalles
pass@k
pass@k es la forma estándar de puntuar modelos de lenguaje en tareas donde una respuesta candidata puede verificarse de forma automática, sobre todo la generación de código, donde cada intento supera o no un conjunto de pruebas. En lugar de preguntar si una única respuesta es correcta, pass@k pregunta si alguno de k intentos lo es. Esta calculadora transforma la tasa de éxito por muestra de un modelo en pass@k, de modo que una única precisión medida puede proyectarse a cualquier número de intentos.
Qué mide pass@k
Para cada problema de un benchmark, el modelo genera k soluciones candidatas independientes, y el problema cuenta como resuelto si al menos una candidata pasa. pass@k es la fracción de problemas resueltos bajo esa regla. pass@1 es la precisión ordinaria en un solo intento; pass@10 y pass@100 miden con qué frecuencia el modelo puede alcanzar una respuesta correcta dispuesto de varios intentos. La métrica cobra importancia siempre que un verificador externo —un conjunto de pruebas, un compilador, un comprobador de demostraciones— puede reconocer una respuesta correcta entre muchas candidatas, porque entonces los intentos adicionales se traducen directamente en más problemas resueltos.
La fórmula
Si cada muestra tiene éxito de forma independiente con probabilidad , entonces una única muestra falla con probabilidad uno menos , y las muestras fallan con probabilidad . pass@k es el complemento:
Pkqk=1−(1−p)k=(1−p)kdonde es pass@k y es la probabilidad de que todos los intentos fallen. La probabilidad de fallo total se reduce geométricamente con , razón por la cual incluso una tasa por muestra modesta tiende hacia la certeza con suficientes intentos.
Ejemplo resuelto
Supongamos que un modelo resuelve un problema de programación en el 40 % de los intentos individuales, y la evaluación permite 10 muestras:
q10P10=(1−0.4)10=0.610≈0.0060=1−0.0060≈0.994=99.4%Una tasa por muestra del 40 % se convierte en un pass@10 de alrededor del 99 %. El salto ilustra por qué las cifras de pass@k crecen tan deprisa con k, y por qué las tablas de benchmark reportan varios valores de k uno junto a otro: la forma de esa curva dice más sobre un modelo que cualquier punto aislado.
Cómo se mide
Estimar pass@k extrayendo exactamente k muestras es ruidoso. Benchmarks como HumanEval extraen en su lugar un conjunto mayor de muestras, cuentan las que tienen éxito y emplean el estimador insesgado , que promedia sobre cada forma de elegir de las muestras. La forma de independencia que se usa aquí coincide con ese estimador cuando se toma como , y es la herramienta adecuada para proyectar una tasa de éxito conocida a un presupuesto de intentos elegido. La forma supone un éxito igual e independiente entre muestras; a una temperatura muy baja las muestras se vuelven casi idénticas y añadir más ayuda poco. Para planificar cuántos problemas necesita una evaluación para una estimación estable, véase la Calculadora de tamaño de muestra para evaluación de LLM.
Preguntas frecuentes (FAQ)
¿Qué es pass@k?
pass@k es la métrica estándar para la generación de código y otras evaluaciones de muestreo y verificación. Para cada problema, el modelo genera k soluciones candidatas, y el problema se cuenta como resuelto si al menos una candidata supera las pruebas. pass@k es la fracción de problemas resueltos bajo esa regla.
pass@1 refleja la precisión en un solo intento, mientras que pass@10 o pass@100 mide con qué frecuencia el modelo puede resolver un problema dispuesto de varios intentos, algo relevante cuando un verificador externo, como un conjunto de pruebas o un comprobador, puede identificar una respuesta correcta entre muchas.
¿La fórmula supone que las muestras son independientes?
Sí. La expresión uno menos (uno menos p) elevado a k supone que cada una de las k muestras tiene éxito de forma independiente con la misma probabilidad p. Eso se cumple bien cuando las muestras se extraen con una temperatura distinta de cero, de modo que varían.
Falla a una temperatura muy baja, donde las muestras son casi idénticas y extraer más aporta poco, y cuando la dificultad del problema varía, de manera que una única p media oculta una mezcla de casos fáciles y difíciles. Para proyectar una tasa medida a un k distinto, la forma de independencia es una buena primera aproximación.
¿Cómo se mide pass@k en la práctica?
Estimar pass@k extrayendo literalmente k muestras es ruidoso. Benchmarks como HumanEval extraen en su lugar un número mayor n de muestras, cuentan las c que tienen éxito y emplean el estimador insesgado pass@k = 1 − C(n−c, k) / C(n, k), donde C es el coeficiente binomial. Esto promedia sobre todas las formas de elegir k de las n muestras y ofrece una cifra mucho más estable.
Esta calculadora utiliza la forma de independencia, más sencilla, que coincide con el estimador cuando p se toma como c/n y resulta idónea para proyectar una tasa de éxito conocida a un presupuesto de intentos elegido.
Aviso legal
La forma de independencia supone una probabilidad de éxito por muestra igual e independiente. Las muestras reales están correlacionadas a baja temperatura y la dificultad varía entre problemas, por lo que el pass@k medido puede diferir. Utilice un conjunto amplio de muestras y el estimador insesgado al reportar resultados de benchmark.
Recomendaciones
Calculadora de tamaño de muestra para evaluación de LLM
Determina cuántos ejemplos necesita la evaluación de un modelo para medir su precisión dentro de un margen de error objetivo, mediante la fórmula estándar de tamaño de muestra para una proporción.
Calculadora de significación de pruebas A/B
Comprueba si un prompt o un modelo supera realmente a otro. Introduzca los aciertos y los ensayos de cada variante para obtener las tasas de acierto, una prueba z de dos proporciones, el valor p y los ensayos necesarios para alcanzar la potencia.