Calculadora de perplejidad
Datos de entrada
| Pérdida de entropía cruzada | 2 |
|---|
Calculadora de perplejidad
Convierte la pérdida de entropía cruzada de un modelo de lenguaje en perplejidad y bits por token. La perplejidad es la exponencial de la pérdida media por token medida sobre texto reservado.
Datos de entrada
Pérdida
Resultados
Introduce un valor para ver los resultados.
Detalles
La perplejidad
La perplejidad es la medida intrínseca más utilizada para evaluar qué tan bien un modelo de lenguaje predice texto. Resume la incertidumbre media del modelo en un único número con una lectura intuitiva: aproximadamente cuántas opciones igualmente probables sopesa el modelo en cada token. Esta calculadora convierte una pérdida de entropía cruzada —la magnitud que reportan los marcos de entrenamiento— en perplejidad y en bits por token.
De la pérdida a la perplejidad
Cuando un modelo de lenguaje lee texto reservado, asigna una probabilidad a cada token siguiente real. La pérdida de entropía cruzada es el promedio del logaritmo negativo de esas probabilidades; un modelo seguro y acertado obtiene una pérdida baja, y uno sorprendido una pérdida alta. La perplejidad es simplemente la exponencial de ese promedio:
PPLH2=eL=ln2Ldonde es la pérdida por token en nats y es el equivalente en bits por token. Exponenciar deshace el logaritmo del interior de la pérdida y transforma una magnitud aditiva en un «tamaño de vocabulario efectivo» multiplicativo. Un modelo perfecto asigna probabilidad uno a cada token correcto, lo que da una pérdida de cero y una perplejidad de uno: ninguna incertidumbre en absoluto.
Ejemplo resuelto
Supongamos que un modelo reporta una pérdida de entropía cruzada sobre texto reservado de 2,0 nats:
PPLH2=e2.0≈7.39=ln22.0≈2.885 bits/tokenUna perplejidad de alrededor de 7,4 significa que, promediada sobre el texto, el modelo presenta tanta incertidumbre como si eligiera de forma uniforme entre unos siete u ocho tokens igualmente probables. La cifra de bits por token se relaciona con la compresión: un codificador ideal que usara este modelo necesitaría unos 2,9 bits para codificar cada token, de modo que un modelo de menor perplejidad podría comprimir el mismo texto de forma más ajustada.
Lectura y comparación de la perplejidad
Una perplejidad menor indica una mejor predicción, pero el número solo tiene sentido dentro de un tokenizador y un conjunto de evaluación fijos. Como se mide por token, un modelo que descompone el texto en tokens más numerosos y pequeños reporta una perplejidad distinta sobre el mismo pasaje que otro con un vocabulario más grueso, incluso con la misma calidad subyacente. Las comparaciones son válidas cuando el tokenizador y el texto de prueba son idénticos, y engañosas en caso contrario. La perplejidad tampoco dice nada sobre si un modelo es capaz de seguir instrucciones o razonar; para ello se emplean evaluaciones basadas en tareas. Para planificar cuántos ejemplos necesita una evaluación de ese tipo, véase la Calculadora de tamaño de muestra para evaluación de LLM, y para la puntuación de generación de código, véase la Calculadora pass@k.
Preguntas frecuentes (FAQ)
¿Qué mide la perplejidad?
La perplejidad mide qué tan bien un modelo de probabilidad predice una muestra; cuanto menor, mejor. Es la exponencial de la pérdida media de entropía cruzada y puede leerse como un factor de ramificación efectivo: una perplejidad de 8 significa que el modelo presenta, en promedio, tanta incertidumbre como si tuviera que elegir de forma uniforme entre 8 tokens igualmente probables. Un modelo perfecto que asignara siempre probabilidad uno al token correcto tendría una pérdida de cero y una perplejidad de uno.
Como se calcula directamente a partir de las propias probabilidades del modelo, la perplejidad no necesita etiquetas y constituye la medida intrínseca estándar del ajuste de un modelo de lenguaje.
¿Cuál es la diferencia entre nats y bits?
Ambos son unidades de información que solo se diferencian por la base del logaritmo. El nat utiliza el logaritmo natural y es lo que reporta la mayoría del código de entrenamiento; el bit utiliza base dos. Un nat equivale aproximadamente a 1,443 bits, de modo que dividir la pérdida en nats por el logaritmo natural de dos la convierte en bits por token.
Los bits por token resultan cómodos porque se relacionan directamente con la compresión: un modelo con una cifra menor de bits por token podría, en principio, comprimir el mismo texto en menos bits.
¿Se puede comparar la perplejidad entre modelos?
Solo cuando el tokenizador y el texto de evaluación son idénticos. La perplejidad se mide por token, así que un modelo que divide el texto en tokens más numerosos y pequeños reportará una perplejidad distinta sobre el mismo pasaje que otro con un vocabulario más grueso, incluso con la misma calidad subyacente.
Por tanto, las comparaciones son válidas dentro de un tokenizador y un conjunto de datos fijos, y engañosas entre tokenizadores distintos. Para comparar capacidades entre modelos se utilizan en su lugar métricas basadas en tareas.
Aviso legal
La perplejidad es una medida intrínseca ligada a un tokenizador y un conjunto de evaluación concretos; no es directamente comparable entre modelos con vocabularios distintos, ni sustituye a una evaluación basada en tareas. Confirme que la pérdida es por token y está en nats antes de convertirla.