ホーム AI・LLM LLM評価のサンプルサイズの計算 作成日: 2026年7月20日 21:33 LLM評価のサンプルサイズの計算 入力 想定精度80 %誤差の範囲5 %信頼水準95% AI・LLM LLM評価のサンプルサイズの計算 比率に対する標準的なサンプルサイズの式を用い、モデル評価で目標とする誤差の範囲内に精度を収めるのに何件の例が必要かを求める。 入力 目標精度 想定精度 % 1 – 99 % タスクにおけるモデルの精度の事前の推測。必要数は50%で最大になり、両端へ向かうほど和らぎます。確信がなければ下の最悪ケースの値を使ってください。 誤差の範囲 % 0.1 – 50 % 許容できる信頼区間の半幅、すなわち測定された精度の前後のプラスマイナスです。これを狭めるとサンプル数は2乗で増えます。 信頼水準 95% 真の精度が誤差の範囲内に収まることをどれだけ確信したいか。信頼水準を高くすると区間が広がり、より多くの例が必要になります。 結果 値を入力すると計算結果が表示されます。 必要な例数 精度80 %を選択した信頼水準で5 %以内に推定するのに必要な例数で、整数に切り上げておよそ...件です。 詳細 保守的(精度50%) 精度が50%、すなわち必要数が最大になる場合に必要な例数(...)です。精度の信頼できる事前情報がないときに使ってください。 共有 レポートを印刷 リセット 埋め込み この計算機を埋め込む プレビュー このコードをページに貼り付けると計算機を表示できます。 コードをコピー この計算を共有 このリンクを開くと、入力した値がそのまま表示されます。 リンクをコピー 共有する XFacebookLINE メール 最終更新: 2026-06-22 LLM評価のサンプルサイズ ベンチマークでモデルの精度を測定するとき、報告される数値は有限の標本からの推定であり、不確実性を伴う。同じモデルを別の50件の例で実行すれば、スコアは動く。この計算は、あらゆる評価の前に来る計画の問いに答える。測定された精度が、選択した信頼水準のもとで定めた誤差の範囲内に収まるには、何件の例が必要か、である。 精度は比率である ベンチマークのスコアはモデルが正しく答える例の割合、すなわち比率である。推定された比率の不確実性はその標準誤差で記述され、信頼区間は信頼水準に応じた標準誤差の何倍かを両側に広げて構成される。その区間を目標の誤差の範囲より広くならないよう要求することで、必要な例の数が定まる。 計算式 n=z2 p (1−p)E2n = \frac{z^2\, p\,(1 - p)}{E^2}n=E2z2p(1−p) ここで zz は選択した信頼水準に対する標準正規の値、pp は想定精度、EE は誤差の範囲、nn は切り上げた例の数である。重要な特徴が二つある。誤差は二乗で入るため、半分にすると必要数は四倍になる。精度を高めることは高くつく。そして精度は pp とその余事象の積を通して入り、これは半々で最大になるため、コイン投げに近いと想定されるモデルが最も多くの例を要し、両端に近いものはより少なくて済む。 計算例 精度をおよそ80%と想定し、95%の信頼水準で±5%以内まで知りたいとする。 n=1.962×0.8×0.20.052=3.8416×0.160.0025≈245.9→246\begin{aligned} n &= \frac{1.96^2 \times 0.8 \times 0.2}{0.05^2} \\ &= \frac{3.8416 \times 0.16}{0.0025} \approx 245.9 \to 246 \end{aligned}n=0.0521.962×0.8×0.2=0.00253.8416×0.16≈245.9→246 つまりおよそ246件の例で足りる。精度の事前情報がなく半々の最悪ケースを用いた場合、必要数は385件に上がる。誤差を±2.5%に狭めると最悪ケースの値は1,500件を超え、精度に対する2乗則のコストを具体的に示している。 結果の使い方 この値は、例が独立であることと正規近似を仮定した基準値であり、いずれも評価の規模では妥当である。精度の信頼できる推定がない場合は、保守的な50%の値を中心に計画する。これは必要数が取りうる最大だからである。この計算は1つの精度推定の規模を決める。あるモデルやプロンプトが別のものに本当に勝るかを判断するのは2つの比率の比較であり、効果量と検出力、そして通常はより多くのデータを要する。それにはA/Bテスト有意性の計算を参照されたい。複数サンプルのコード指標について考えるには、pass@k の計算を参照されたい。 よくある質問 (FAQ)サンプルサイズがこの形になるのはなぜですかベンチマークの精度は比率、すなわちモデルが正解する例の割合です。推定された比率の不確実性は二項分布の標準誤差に従い、この式はそれを逆に解きます。誤差の範囲を半分にするには例の数を4倍にしなければなりません。誤差はサンプルサイズの平方根に反比例して縮むためです。信頼水準を上げるとz値が大きくなり必要数も増えます。この結果は例が独立に引かれることを仮定し、正規近似を用います。これは評価が通常必要とするサンプルサイズで正確です。 想定精度は答えをどう変えますか必要数はpと(1引くp)の積に依存し、50%で最大、両端へ向かって小さくなります。95%と想定されるモデルは50%と想定されるモデルよりも絞り込むのに必要な例が少なくて済みます。両端付近では測るべき分散が単純に少ないためです。信頼できる事前情報がなければ、50%の精度で計算された保守的な値を使ってください。これは必要数が取りうる最大であり、常に安全です。 これは2つのモデルの比較を含みますか含みません。これは1つの精度推定を目標の精度まで絞り込むためのものです。あるモデルやプロンプトが別のものに本当に勝るかを判断するのは2つの比率の比較であり、望ましい効果量と検出力の両方が必要で、一般に1つのモデルだけを推定するよりも多くの例を要します。それには勝率向けに設計された2標本比率の検定を用いてください。 免責事項 この式は例が独立であることと二項分布への正規近似を仮定します。1つの精度推定の規模を決めるものであり、モデル間の比較を扱うものではなく、同じ項目のクラスタ化や繰り返し使用を無視します。結果は計画の基準値として扱ってください。 次のおすすめ A/Bテスト有意性の計算 あるプロンプトやモデルが別のものに本当に勝るかを検定する。各バリアントの勝ち数と試行数を入力すると、勝率、2標本比率のz検定、p値、検出力に必要な試行数が得られる。 詳しく解説pass@k の計算 コードや推論の評価における pass@k を計算する。1サンプルあたりの成功率から、独立したk個のモデルサンプルのうち少なくとも1つが問題を解く確率を求める。 詳しく解説 200+ ツール · 10 言語対応 · 完全無料 評価の他の計算 A/Bテスト有意性の計算LLM評価のサンプルサイズの計算pass@k の計算パープレキシティの計算 AI・LLMの他のカテゴリ コスト・料金 1ドルあたりトークン数の計算GPU クラウド費用を計算GPU利用率コストの計算LLMファインチューニング費用の計算LLMレート制限の計画LLM学習のカーボンフットプリントの計算LLM学習時間とコストの計算LLM月額コストの計算エージェントコストの計算コンテキストコストの増加の計算コンテキスト長の判定システムプロンプトの償却コストトークンから単語数への変換トークンコスト計算バッチAPIの節約額の計算プロンプトキャッシュの節約額の計算ベクトルDBコストの計算ベクトルDBサイズの計算音声合成コストの計算音声文字起こしコストの計算画像生成コストの計算関数呼び出しのトークンオーバーヘッド構造化出力のトークンオーバーヘッド自己ホストとAPIの損益分岐の計算推論エネルギーコストの計算埋め込みコストの計算推論・サービング トークンあたりFLOPsの計算バッチ推論スループットの計算モデルFLOPs利用率の計算画像入力トークン数の計算実効トークン毎秒の計算推論スループットの計算推論レイテンシの計算投機的デコーディングの高速化の計算学習・スケーリング Chinchilla最適トークン数LLMトレーニングVRAMの計算LoRA の学習パラメータ数を計算データセットのトークン数の計算データ並列スケーリングの計算パイプライン並列のバブルの計算学習FLOPsの計算学習率ウォームアップの計算計算最適なモデルサイズ計算予算から求めるエポック数勾配累積のメモリ計算実効バッチサイズの計算ハードウェア・メモリ KVキャッシュサイズの計算LLM推論のVRAM計算MoE のアクティブパラメータ数を計算Transformerのパラメータ数の計算アテンションメモリの計算モデルに必要なGPU台数の計算モデルのダウンロード時間の計算量子化によるモデルサイズの計算RAG・埋め込み RAGチャンク分割の設計すべてのツール コサイン類似度の計算 この計算機は役に立ちましたか? 役に立った 改善が必要 改善が必要 どのような点が改善されると良いですか? フィードバックを送信 Powered by OneCalc ↗
最終更新: 2026-06-22 LLM評価のサンプルサイズ ベンチマークでモデルの精度を測定するとき、報告される数値は有限の標本からの推定であり、不確実性を伴う。同じモデルを別の50件の例で実行すれば、スコアは動く。この計算は、あらゆる評価の前に来る計画の問いに答える。測定された精度が、選択した信頼水準のもとで定めた誤差の範囲内に収まるには、何件の例が必要か、である。 精度は比率である ベンチマークのスコアはモデルが正しく答える例の割合、すなわち比率である。推定された比率の不確実性はその標準誤差で記述され、信頼区間は信頼水準に応じた標準誤差の何倍かを両側に広げて構成される。その区間を目標の誤差の範囲より広くならないよう要求することで、必要な例の数が定まる。 計算式 n=z2 p (1−p)E2n = \frac{z^2\, p\,(1 - p)}{E^2}n=E2z2p(1−p) ここで zz は選択した信頼水準に対する標準正規の値、pp は想定精度、EE は誤差の範囲、nn は切り上げた例の数である。重要な特徴が二つある。誤差は二乗で入るため、半分にすると必要数は四倍になる。精度を高めることは高くつく。そして精度は pp とその余事象の積を通して入り、これは半々で最大になるため、コイン投げに近いと想定されるモデルが最も多くの例を要し、両端に近いものはより少なくて済む。 計算例 精度をおよそ80%と想定し、95%の信頼水準で±5%以内まで知りたいとする。 n=1.962×0.8×0.20.052=3.8416×0.160.0025≈245.9→246\begin{aligned} n &= \frac{1.96^2 \times 0.8 \times 0.2}{0.05^2} \\ &= \frac{3.8416 \times 0.16}{0.0025} \approx 245.9 \to 246 \end{aligned}n=0.0521.962×0.8×0.2=0.00253.8416×0.16≈245.9→246 つまりおよそ246件の例で足りる。精度の事前情報がなく半々の最悪ケースを用いた場合、必要数は385件に上がる。誤差を±2.5%に狭めると最悪ケースの値は1,500件を超え、精度に対する2乗則のコストを具体的に示している。 結果の使い方 この値は、例が独立であることと正規近似を仮定した基準値であり、いずれも評価の規模では妥当である。精度の信頼できる推定がない場合は、保守的な50%の値を中心に計画する。これは必要数が取りうる最大だからである。この計算は1つの精度推定の規模を決める。あるモデルやプロンプトが別のものに本当に勝るかを判断するのは2つの比率の比較であり、効果量と検出力、そして通常はより多くのデータを要する。それにはA/Bテスト有意性の計算を参照されたい。複数サンプルのコード指標について考えるには、pass@k の計算を参照されたい。 よくある質問 (FAQ)サンプルサイズがこの形になるのはなぜですかベンチマークの精度は比率、すなわちモデルが正解する例の割合です。推定された比率の不確実性は二項分布の標準誤差に従い、この式はそれを逆に解きます。誤差の範囲を半分にするには例の数を4倍にしなければなりません。誤差はサンプルサイズの平方根に反比例して縮むためです。信頼水準を上げるとz値が大きくなり必要数も増えます。この結果は例が独立に引かれることを仮定し、正規近似を用います。これは評価が通常必要とするサンプルサイズで正確です。 想定精度は答えをどう変えますか必要数はpと(1引くp)の積に依存し、50%で最大、両端へ向かって小さくなります。95%と想定されるモデルは50%と想定されるモデルよりも絞り込むのに必要な例が少なくて済みます。両端付近では測るべき分散が単純に少ないためです。信頼できる事前情報がなければ、50%の精度で計算された保守的な値を使ってください。これは必要数が取りうる最大であり、常に安全です。 これは2つのモデルの比較を含みますか含みません。これは1つの精度推定を目標の精度まで絞り込むためのものです。あるモデルやプロンプトが別のものに本当に勝るかを判断するのは2つの比率の比較であり、望ましい効果量と検出力の両方が必要で、一般に1つのモデルだけを推定するよりも多くの例を要します。それには勝率向けに設計された2標本比率の検定を用いてください。 免責事項 この式は例が独立であることと二項分布への正規近似を仮定します。1つの精度推定の規模を決めるものであり、モデル間の比較を扱うものではなく、同じ項目のクラスタ化や繰り返し使用を無視します。結果は計画の基準値として扱ってください。