비율에 대한 표준 표본 크기 공식을 사용하여, 모델 평가가 목표 오차 한계 안에서 정확도를 측정하는 데 필요한 예제 수를 구합니다.
입력
목표 정밀도
%
1 – 99 %
과제에 대한 모델 정확도의 사전 추측입니다. 요구되는 표본은 50%에서 최대가 되고 양극단으로 갈수록 줄어듭니다. 확신이 없으면 아래의 최악 경우 값을 사용하십시오.
%
0.1 – 50 %
허용할 수 있는 신뢰구간의 절반 너비로, 측정한 정확도 주위의 ± 값입니다. 이를 좁히면 표본 수가 제곱으로 늘어납니다.
참 정확도가 오차 한계 안에 들어 있다고 얼마나 확신하고 싶은지를 나타냅니다. 신뢰수준이 높을수록 구간이 넓어지고 더 많은 예제가 필요합니다.
결과
값을 입력하면 계산 결과가 표시됩니다.
80 %의 정확도를 선택한 신뢰수준에서 5 % 이내로 추정하는 데 필요한 예제 수이며, 정수 예제로 올림하여 약 ...개입니다.
세부 정보
정확도가 50%일 때 필요한 예제 수로, 요구가 가장 큰 경우입니다(...). 정확도에 대한 신뢰할 만한 사전 정보가 없을 때 사용하십시오.
LLM 평가 표본 크기
모델의 벤치마크 정확도를 측정할 때 보고하는 숫자는 유한한 표본에서 얻은 추정치이며 불확실성을 담고 있습니다. 같은 모델을 다른 쉰 개의 예제로 돌리면 점수는 움직입니다. 이 계산기는 어떤 평가에 앞서 떠오르는 계획 질문에 답합니다. 측정한 정확도가 선택한 신뢰수준에서 명시된 오차 한계 안에 들도록 하려면 몇 개의 예제가 필요한가 하는 물음입니다.
정확도는 비율이다
벤치마크 점수는 모델이 올바르게 답하는 예제의 비율, 즉 하나의 비율입니다. 추정된 비율의 불확실성은 그 표준오차로 기술되며, 신뢰구간은 신뢰수준이 정하는 표준오차의 배수만큼 양쪽으로 늘려서 만듭니다. 그 구간이 목표 오차 한계보다 넓지 않도록 요구하면 필요한 예제 수가 정해집니다.
공식
n=E2z2p(1−p)
여기서 는 선택한 신뢰수준에 대한 표준정규 값, 는 예상 정확도, 는 오차 한계, 은 올림한 예제 수입니다. 두 가지 특징이 중요합니다. 오차 한계는 제곱으로 들어가므로 이를 절반으로 줄이면 요구가 네 배가 됩니다. 정밀도는 비싸기 때문입니다. 그리고 정확도는 와 그 여확률의 곱을 통해 들어가는데, 이 곱은 정확히 반반에서 최대가 됩니다. 따라서 동전 던지기에 가까울 것으로 예상되는 모델은 가장 많은 예제가 필요하고, 양극단에 가까운 모델은 더 적게 필요합니다.
따라서 약 246개의 예제면 충분합니다. 정확도에 대한 사전 정보가 없어 반반의 최악 경우를 사용했다면 요구는 385로 올라갑니다. 오차 한계를 ±2.5%로 좁히면 최악 경우 값이 1,500을 넘게 되는데, 이는 정밀도의 제곱 법칙 비용을 구체적으로 보여 줍니다.
결과 활용
이 값은 예제가 독립적이라고 가정하고 정규근사를 사용하는 기준선이며, 둘 다 평가 규모에서 합리적입니다. 정확도에 대해 신뢰할 만한 추정이 없을 때는 보수적인 50% 값을 중심으로 계획하십시오. 그것이 요구될 수 있는 최대치이기 때문입니다. 이 계산기는 하나의 정확도 추정에 대한 크기를 정합니다. 한 모델이나 프롬프트가 다른 것을 진정으로 능가하는지 판단하는 일은 효과 크기와 통계적 검정력이 필요하고 대개 더 많은 데이터가 드는 두 비율의 비교이며, 그런 경우에는 A/B 검정 유의성 계산기를 참고하십시오. 대신 다중 표본 코드 지표를 다루려면 pass@k 계산기를 참고하십시오.
자주 묻는 질문 (FAQ)
표본 크기는 왜 이런 형태를 가집니까?
벤치마크의 정확도는 비율입니다. 모델이 맞히는 예제의 비중입니다. 추정된 비율의 불확실성은 이항 표준오차를 따르며, 공식은 이를 역으로 풉니다. 오차 한계를 절반으로 줄이려면 예제 수를 네 배로 늘려야 합니다. 오차 한계가 표본 크기의 제곱근에 따라 줄어들기 때문입니다. 신뢰수준을 높이면 z 점수가 커지고 따라서 필요 수도 커집니다. 결과는 예제가 독립적으로 추출된다고 가정하며 정규근사를 사용하는데, 이는 평가가 일반적으로 필요로 하는 표본 크기에서 정확합니다.
예상 정확도는 답을 어떻게 바꿉니까?
필요한 크기는 p에 (1에서 p를 뺀 값)을 곱한 값에 따라 달라지며, 이는 50%에서 최대가 되고 양극단으로 갈수록 줄어듭니다. 95%로 예상되는 모델은 50%로 예상되는 모델보다 확정하는 데 더 적은 예제가 필요합니다. 극단 근처에서는 측정할 분산이 단순히 더 적기 때문입니다. 신뢰할 만한 사전 정보가 없다면 50% 정확도에서 계산한 보수적 값을 사용하십시오. 그것이 요구될 수 있는 최대치이므로 항상 안전합니다.
이것이 두 모델 비교를 다룹니까?
아닙니다. 이 계산기는 하나의 정확도 추정을 목표 정밀도에 맞춰 크기를 정합니다. 한 모델이나 프롬프트가 다른 것을 진정으로 능가하는지 판단하는 일은 두 비율의 비교이며, 원하는 효과 크기와 통계적 검정력이 모두 필요하고, 일반적으로 한 모델만 추정할 때보다 더 많은 예제를 요구합니다. 그런 경우에는 승률을 위해 설계된 이비율 검정을 사용하십시오.
면책조항
이 공식은 예제가 독립적이라고 가정하며 이항분포에 대한 정규근사를 사용합니다. 하나의 정확도 추정에 대한 크기를 정할 뿐 모델 간 비교를 다루지 않으며, 같은 항목의 군집이나 반복 사용을 무시합니다. 결과는 계획의 기준선으로 삼으십시오.