首頁 ai LLM 評估樣本數計算器 產生日期: 2026年7月20日 下午09:34 LLM 評估樣本數計算器 輸入 預期準確率80 %誤差範圍5 %信賴水準95% AI & LLM LLM 評估樣本數計算器 運用比例的標準樣本數公式,找出一項模型評估需要多少範例,才能將準確率測量在目標誤差範圍之內。 輸入 目標精度 預期準確率 % 1 – 99 % 對模型在該任務上準確率的事前猜測。需求在 50% 時最大,朝兩端逐漸減少;若無把握,可採用下方的最壞情況數字。 誤差範圍 % 0.1 – 50 % 所能容忍的信賴區間半寬——也就是測得準確率上下的加減值。將它收緊,所需範例數會以平方倍增。 信賴水準 95% 希望有多大的把握,確信真實準確率落在誤差範圍之內。信賴水準越高,區間越寬,所需範例也越多。 結果 輸入數值即可顯示計算結果。 所需範例數 在所選信賴水準下,將 80 % 的準確率估計在 5 % 範圍內所需的範例數——約為 ...,並進位至整數個範例。 詳細資料 保守估計(50% 準確率) 若準確率為 50%,亦即需求最大時所需的範例數(...)。當沒有可靠的準確率事前估計時,採用此值。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 LLM 評估樣本數 當測量模型在某項基準上的準確率時,所回報的數字是來自有限樣本的估計,因而帶有不確定性。讓同一個模型在另外五十個範例上跑一次,分數就會變動。本計算器回答任何評估之前都該先想清楚的規劃問題:需要多少範例,才能讓測得的準確率在所選信賴水準下落在指定的誤差範圍之內。 準確率是一種比例 基準分數是模型答對的範例所占的比例——一個比例。估計比例的不確定性由其標準誤描述,而信賴區間則是在中心兩側各延伸若干個標準誤而構成,延伸的幅度由信賴水準決定。要求這個區間不寬於目標誤差範圍,便決定了所需的範例數。 公式 n=z2 p (1−p)E2n = \frac{z^2\, p\,(1 - p)}{E^2}n=E2z2p(1−p) 這裡 zz 是所選信賴水準對應的標準常態值,pp 是預期準確率,EE 是誤差範圍,nn 則是範例數,並進位取整。有兩點值得注意。誤差範圍以平方進入公式,因此將它減半會使需求增為四倍——精度的代價高昂。而準確率則透過 pp 與其補數的乘積進入公式,這個乘積在均分時達到最大,因此預期接近擲硬幣機率的模型所需範例最多,靠近兩端的模型則較少。 範例計算 假設預期準確率約為 80%,並希望在 95% 信賴水準下將其測準至 ±5% 之內: n=1.962×0.8×0.20.052=3.8416×0.160.0025≈245.9→246\begin{aligned} n &= \frac{1.96^2 \times 0.8 \times 0.2}{0.05^2} \\ &= \frac{3.8416 \times 0.16}{0.0025} \approx 245.9 \to 246 \end{aligned}n=0.0521.962×0.8×0.2=0.00253.8416×0.16≈245.9→246 因此約需 246 個範例。若沒有準確率的事前估計而採用均分時的最壞情況,需求會升至 385。將誤差範圍收緊至 ±2.5%,會把最壞情況的數字推升到超過 1,500——這具體展現了精度所需付出的平方律代價。 運用結果 這個數字是個基準,假設範例獨立並採用常態近似,兩者在評估規模下都合理。當沒有可信的準確率估計時,請以保守的 50% 數字進行規劃,因為它是需求可能達到的最大值。本計算器設定的是單一準確率估計的規模;判斷某個模型或提示是否確實勝過另一個,是兩個比例之間的比較,需要效應量與統計檢定力,所需資料通常更多——那種情況請參考 A/B 測試顯著性計算器。若要改為推理多樣本的程式碼指標,請參考 pass@k 計算器。 常見問題(FAQ)為什麼樣本數會是這個形式?基準上的準確率是一個比例:模型答對的範例所占的份額。估計比例的不確定性遵循二項分布的標準誤,而這個公式正是其反向求解。要將誤差範圍減半,必須將範例數增為四倍,因為誤差範圍是隨樣本數的平方根縮小的。提高信賴水準會增大 z 分數,進而增加所需範例數。此結果假設範例為獨立抽取,並採用常態近似,對評估通常所需的樣本數而言相當準確。 預期準確率如何改變答案?所需數量取決於 p 乘以一減 p,這個乘積在 50% 時最大,朝兩端逐漸下降。預期得分 95% 的模型,所需範例比預期得分 50% 的模型少,因為靠近兩端時可供測量的變異本來就較小。若沒有可靠的事前估計,請採用以 50% 準確率計算的保守數字——它是需求可能達到的最大值,因此永遠安全。 這也涵蓋兩個模型的比較嗎?不涵蓋。本計算器是為單一準確率估計設定目標精度。判斷某個模型或提示是否確實勝過另一個,是兩個比例之間的比較,需要同時指定期望的效應量與統計檢定力,所需範例通常比單獨估計一個模型更多。那種情況請改用為勝率設計的雙比例檢定。 免責聲明 本公式假設範例獨立,並採用二項分布的常態近似。它設定的是單一準確率估計的規模,而非模型間的比較,也未考慮任何聚集或同一題目的重複使用。請將結果視為規劃的基準。 推薦的下一個 A/B 測試顯著性計算器 檢驗某個提示詞或模型是否真的勝過另一個。輸入每個版本的勝出次數與試驗次數,即可得到勝率、雙比例 z 檢定、p 值,以及達到統計檢定力所需的試驗次數。 深入了解pass@k 計算器 為程式碼與推理評估計算 pass@k:根據單一樣本成功率,求出 k 個獨立模型樣本中至少有一個解出問題的機率。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 LLM 評估樣本數 當測量模型在某項基準上的準確率時,所回報的數字是來自有限樣本的估計,因而帶有不確定性。讓同一個模型在另外五十個範例上跑一次,分數就會變動。本計算器回答任何評估之前都該先想清楚的規劃問題:需要多少範例,才能讓測得的準確率在所選信賴水準下落在指定的誤差範圍之內。 準確率是一種比例 基準分數是模型答對的範例所占的比例——一個比例。估計比例的不確定性由其標準誤描述,而信賴區間則是在中心兩側各延伸若干個標準誤而構成,延伸的幅度由信賴水準決定。要求這個區間不寬於目標誤差範圍,便決定了所需的範例數。 公式 n=z2 p (1−p)E2n = \frac{z^2\, p\,(1 - p)}{E^2}n=E2z2p(1−p) 這裡 zz 是所選信賴水準對應的標準常態值,pp 是預期準確率,EE 是誤差範圍,nn 則是範例數,並進位取整。有兩點值得注意。誤差範圍以平方進入公式,因此將它減半會使需求增為四倍——精度的代價高昂。而準確率則透過 pp 與其補數的乘積進入公式,這個乘積在均分時達到最大,因此預期接近擲硬幣機率的模型所需範例最多,靠近兩端的模型則較少。 範例計算 假設預期準確率約為 80%,並希望在 95% 信賴水準下將其測準至 ±5% 之內: n=1.962×0.8×0.20.052=3.8416×0.160.0025≈245.9→246\begin{aligned} n &= \frac{1.96^2 \times 0.8 \times 0.2}{0.05^2} \\ &= \frac{3.8416 \times 0.16}{0.0025} \approx 245.9 \to 246 \end{aligned}n=0.0521.962×0.8×0.2=0.00253.8416×0.16≈245.9→246 因此約需 246 個範例。若沒有準確率的事前估計而採用均分時的最壞情況,需求會升至 385。將誤差範圍收緊至 ±2.5%,會把最壞情況的數字推升到超過 1,500——這具體展現了精度所需付出的平方律代價。 運用結果 這個數字是個基準,假設範例獨立並採用常態近似,兩者在評估規模下都合理。當沒有可信的準確率估計時,請以保守的 50% 數字進行規劃,因為它是需求可能達到的最大值。本計算器設定的是單一準確率估計的規模;判斷某個模型或提示是否確實勝過另一個,是兩個比例之間的比較,需要效應量與統計檢定力,所需資料通常更多——那種情況請參考 A/B 測試顯著性計算器。若要改為推理多樣本的程式碼指標,請參考 pass@k 計算器。 常見問題(FAQ)為什麼樣本數會是這個形式?基準上的準確率是一個比例:模型答對的範例所占的份額。估計比例的不確定性遵循二項分布的標準誤,而這個公式正是其反向求解。要將誤差範圍減半,必須將範例數增為四倍,因為誤差範圍是隨樣本數的平方根縮小的。提高信賴水準會增大 z 分數,進而增加所需範例數。此結果假設範例為獨立抽取,並採用常態近似,對評估通常所需的樣本數而言相當準確。 預期準確率如何改變答案?所需數量取決於 p 乘以一減 p,這個乘積在 50% 時最大,朝兩端逐漸下降。預期得分 95% 的模型,所需範例比預期得分 50% 的模型少,因為靠近兩端時可供測量的變異本來就較小。若沒有可靠的事前估計,請採用以 50% 準確率計算的保守數字——它是需求可能達到的最大值,因此永遠安全。 這也涵蓋兩個模型的比較嗎?不涵蓋。本計算器是為單一準確率估計設定目標精度。判斷某個模型或提示是否確實勝過另一個,是兩個比例之間的比較,需要同時指定期望的效應量與統計檢定力,所需範例通常比單獨估計一個模型更多。那種情況請改用為勝率設計的雙比例檢定。 免責聲明 本公式假設範例獨立,並採用二項分布的常態近似。它設定的是單一準確率估計的規模,而非模型間的比較,也未考慮任何聚集或同一題目的重複使用。請將結果視為規劃的基準。