퍼플렉서티 계산기
입력
| 교차 엔트로피 손실 | 2 |
|---|
퍼플렉서티 계산기
언어 모델의 교차 엔트로피 손실을 퍼플렉서티와 토큰당 비트로 변환합니다. 퍼플렉서티는 검증용 텍스트에서 측정한 토큰당 평균 손실의 지수입니다.
입력
손실
결과
값을 입력하면 계산 결과가 표시됩니다.
세부 정보
퍼플렉서티
퍼플렉서티는 언어 모델이 텍스트를 얼마나 잘 예측하는지를 나타내는 가장 널리 쓰이는 내재적 척도입니다. 모델의 평균 불확실성을 직관적으로 읽히는 하나의 숫자로 요약하는데, 대략 각 토큰에서 모델이 저울질하는 동일 확률 선택지의 개수에 해당합니다. 이 계산기는 학습 프레임워크가 보고하는 양인 교차 엔트로피 손실을 퍼플렉서티와 토큰당 비트로 변환합니다.
손실에서 퍼플렉서티로
언어 모델이 검증용 텍스트를 읽을 때, 실제 다음 토큰 각각에 확률을 부여합니다. 교차 엔트로피 손실은 그 확률들의 음의 로그를 평균한 값으로, 확신이 있고 정확한 모델은 낮은 손실을, 놀란 모델은 높은 손실을 얻습니다. 퍼플렉서티는 그 평균의 지수입니다.
PPLH2=eL=ln2L여기서 은 nats 단위의 토큰당 손실이고 는 토큰당 비트로 환산한 값입니다. 지수를 취하면 손실 안의 로그가 상쇄되어, 가법적인 양이 곱셈적인 "실효 어휘 크기"로 바뀝니다. 완벽한 모델은 모든 정답 토큰에 확률 1을 부여하여 손실이 0, 퍼플렉서티가 1이 되며, 불확실성이 전혀 없습니다.
계산 예시
어떤 모델이 검증용 교차 엔트로피 손실 2.0 nats를 보고한다고 가정합니다.
PPLH2=e2.0≈7.39=ln22.0≈2.885 bits/token퍼플렉서티가 약 7.4라는 것은, 텍스트 전체에 걸쳐 평균적으로 모델이 동일한 확률을 가진 약 일곱에서 여덟 개의 토큰 가운데 하나를 균등하게 고르는 정도의 불확실성을 가진다는 의미입니다. 토큰당 비트 값은 압축과 연결됩니다. 이 모델을 사용하는 이상적인 부호화기는 각 토큰을 부호화하는 데 약 2.9 비트가 필요하므로, 퍼플렉서티가 더 낮은 모델은 같은 텍스트를 더 촘촘하게 압축할 수 있습니다.
퍼플렉서티 읽기와 비교
퍼플렉서티가 낮을수록 예측이 좋다는 뜻이지만, 이 숫자는 고정된 토크나이저와 평가 세트 안에서만 의미가 있습니다. 토큰당으로 측정되므로, 텍스트를 더 작고 많은 토큰으로 쪼개는 모델은 동일한 본질적 품질이라도 더 거친 어휘를 쓰는 모델과는 같은 구절에 대해 다른 퍼플렉서티를 보고합니다. 토크나이저와 시험 텍스트가 동일할 때 비교가 유효하며, 그렇지 않으면 오해를 부릅니다. 퍼플렉서티는 모델이 지시를 따르거나 추론할 수 있는지에 대해서는 아무것도 말해 주지 않습니다. 그러한 능력에는 과제 기반 평가를 사용합니다. 그런 평가에 필요한 예제 수를 계획하려면 LLM 평가 표본 크기 계산기를 참고하고, 코드 생성 채점에 대해서는 pass@k 계산기를 참고하십시오.
자주 묻는 질문 (FAQ)
퍼플렉서티는 무엇을 측정합니까?
퍼플렉서티는 확률 모델이 표본을 얼마나 잘 예측하는지를 측정하며, 값이 낮을수록 좋습니다. 평균 교차 엔트로피 손실의 지수이며 실효 분기 계수로 해석할 수 있습니다. 퍼플렉서티가 8이라는 것은 평균적으로 동일한 확률을 가진 8개의 다음 토큰 가운데 하나를 균등하게 골라야 하는 정도의 불확실성을 의미합니다. 항상 정답 토큰에 확률 1을 부여하는 완벽한 모델은 손실이 0이고 퍼플렉서티가 1입니다. 모델 자체의 확률에서 직접 계산되므로 레이블이 필요 없으며, 언어 모델의 적합도를 나타내는 표준적인 내재적 척도입니다.
nats와 비트의 차이는 무엇입니까?
둘 다 정보의 단위이며 로그의 밑만 다릅니다. nat은 자연로그를 사용하며 대부분의 학습 코드가 보고하는 단위이고, 비트는 밑이 2입니다. 1 nat은 약 1.443 비트에 해당하므로, nats 단위 손실을 2의 자연로그로 나누면 토큰당 비트로 변환됩니다. 토큰당 비트는 압축과 직접 연결되므로 편리합니다. 토큰당 비트 값이 더 낮은 모델은 원리상 같은 텍스트를 더 적은 비트로 압축할 수 있습니다.
퍼플렉서티를 모델 간에 비교할 수 있습니까?
토크나이저와 평가 텍스트가 동일할 때만 가능합니다. 퍼플렉서티는 토큰당으로 측정되므로, 텍스트를 더 작고 많은 토큰으로 나누는 모델은 동일한 본질적 품질이라도 같은 구절에 대해 더 거친 어휘를 쓰는 모델과는 다른 퍼플렉서티를 보고합니다. 따라서 고정된 토크나이저와 데이터셋 안에서의 비교는 유효하지만, 서로 다른 경우에는 오해를 부릅니다. 모델 간 역량 비교에는 과제 기반 지표를 대신 사용합니다.
면책조항
퍼플렉서티는 특정 토크나이저와 평가 세트에 묶인 내재적 척도이며, 어휘가 다른 모델 사이에서 직접 비교할 수 없고 과제 기반 평가를 대체하지도 않습니다. 변환하기 전에 손실이 토큰당이며 nats 단위인지 확인하십시오.