首頁 ai A/B 測試顯著性計算器 產生日期: 2026年7月20日 下午09:34 A/B 測試顯著性計算器 輸入 勝出次數(A)540試驗次數(A)1,000勝出次數(B)590試驗次數(B)1,000 AI & LLM A/B 測試顯著性計算器 檢驗某個提示詞或模型是否真的勝過另一個。輸入每個版本的勝出次數與試驗次數,即可得到勝率、雙比例 z 檢定、p 值,以及達到統計檢定力所需的試驗次數。 輸入 版本 A 勝出次數(A) 版本 A 勝出的試驗次數,例如通過的案例、被偏好的回應或答對的題目。不得超過 A 的試驗次數。 試驗次數(A) ≥ 1 版本 A 執行的試驗總次數。每次試驗都是一次獨立的測試,例如評估一個提示詞或判定一項任務。 版本 B 勝出次數(B) 版本 B 在與 A 相同類型任務上勝出的試驗次數。不得超過 B 的試驗次數。 試驗次數(B) ≥ 1 版本 B 執行的試驗總次數。兩個版本不必有相同的試驗次數,檢定會將不相等的樣本大小納入考量。 結果 輸入數值即可顯示計算結果。 p 值 若兩個版本實際相等,仍觀察到如此大差異的機率(...)。低於 0.05 是宣告存在真實差異的慣用門檻。 not_significant 詳細資料 勝率 A % 版本 A 的勝率,1,000 次試驗中勝出 540 次(...)。這是比較所依據的基準。 勝率 B % 版本 B 的勝率,1,000 次試驗中勝出 590 次(...)。這是用來與 A 對照的挑戰者。 z 統計量 兩個勝率相差多少個合併標準誤(...)。在雙尾檢定下,超過約 ±1.96 即代表差異在 5% 顯著水準下具有統計顯著性。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 A/B 測試顯著性 更動提示詞、替換模型或調整解碼設定後,新版本通常會在某些範例上勝出、在另一些上落敗。問題在於:量到的差異究竟反映了真正的改進,還是恰巧測到哪些範例的運氣。本計算器對兩個勝率套用雙比例 z 檢定,並回報勝率、檢定統計量、p 值,以及可靠比較所需的試驗次數。 比較兩個勝率 每個版本都以勝率概括:勝出次數除以試驗次數,其中「勝出」是指任何視為成功的事件,例如通過的測試、在對決判定中被偏好的回應,或答對的題目。即使兩個版本完全相同,在有限樣本上量得的兩個勝率也幾乎不會剛好相等,因此檢定要問的是:相對於各自估計中的雜訊,兩者相差有多遠。 公式 檢定會將兩個樣本合併以估計共同勝率,用它計算差異的標準誤,再相除: pˉ=wa+wbna+nbz=pb−papˉ(1−pˉ)(1na+1nb)P=2(1−Φ(∣z∣))\begin{aligned} \bar{p} &= \frac{w_a + w_b}{n_a + n_b} \\ z &= \frac{p_b - p_a}{\sqrt{\bar{p}(1 - \bar{p})\left(\frac{1}{n_a} + \frac{1}{n_b}\right)}} \\ P &= 2\bigl(1 - \Phi(|z|)\bigr) \end{aligned}pˉzP=na+nbwa+wb=pˉ(1−pˉ)(na1+nb1)pb−pa=2(1−Φ(∣z∣)) 其中 pap_a 與 pbp_b 是兩個勝率,pˉ\bar{p} 是合併勝率,zz 是兩個勝率相差多少個標準誤,Φ\Phi 是標準常態累積分布函數,PP 是雙尾 p 值。zz 的絕對值超過約 1.96 即標示 5% 顯著門檻。 範例 假設提示詞 A 在 1,000 項判定任務中勝出 540 次,提示詞 B 在 1,000 項中勝出 590 次: pˉ=540+5902000=0.565z=0.59−0.540.565×0.435×(0.001+0.001)=0.050.0222≈2.26P≈0.024\begin{aligned} \bar{p} &= \frac{540 + 590}{2000} = 0.565 \\ z &= \frac{0.59 - 0.54}{\sqrt{0.565 \times 0.435 \times (0.001 + 0.001)}} = \frac{0.05}{0.0222} \approx 2.26 \\ P &\approx 0.024 \end{aligned}pˉzP=2000540+590=0.565=0.565×0.435×(0.001+0.001)0.59−0.54=0.02220.05≈2.26≈0.024 這五個百分點的差距跨過了 1.96 門檻,p 值接近 0.024,低於 0.05,因此差異具有統計顯著性:隨機因素難以解釋。規劃數字顯示,要可靠偵測這個大小的差距(95% 信賴水準、80% 檢定力)約需每版本 1,538 次試驗,因此這裡的 1,000 次試驗只讓結果剛剛越過門檻,而非穩穩超越。 謹慎解讀結果 顯著不等於重要,只要試驗夠多,微小而無關緊要的差距也可能達到顯著;而有意義的差距在試驗太少時也可能未達顯著。本檢定還假設試驗彼此獨立且只做單一比較:同時評估多個版本,或在資料逐漸累積時反覆查看結果,都會提高偽陽性,需要相應的調整。若要在執行前先估算評估規模,請參考 LLM 評估樣本數計算器;關於抽樣再檢查的程式碼指標,請參考 pass@k 計算器。 常見問題(FAQ)這裡的統計顯著性代表什麼?它探討的是:若兩個版本實際上相等,觀察到的兩個勝率之間的差距,是否大過隨機因素通常會造成的程度。雙比例 z 檢定會將兩個勝率合併,估計兩者差異的標準誤,並回報它們相差多少個標準誤。p 值則是在假設沒有真實差異的前提下,出現至少這麼大差距的機率。較小的 p 值(慣例上低於 0.05)表示隨機因素難以解釋這個結果,因此差異被稱為顯著。它並不衡量差異有多大或多重要,只衡量差異能多有把握地與雜訊區分開來。 我需要多少次試驗?足以偵測所關注的差異,又不至於被雜訊誤導即可。本計算器會回報在 95% 信賴水準與 80% 檢定力(標準的規劃目標)下,偵測觀察到的差距所需的每版本試驗次數。真實差異越小,所需的試驗次數就越多,因為差距必須跨過一個標準誤,而標準誤只隨樣本數的平方根縮小。若目前的試驗次數遠低於所顯示的數字,不顯著的結果可能只是反映資料太少,而非版本真的相等。 這是單尾還是雙尾檢定?雙尾。p 值反映的是在任一方向出現如此大差異的機率,這在事先未承諾哪個版本會勝出時是恰當的預設選擇。單尾檢定只在方向事先固定時才使用,它會將 p 值減半,但可能漏掉在非預期方向上的真實效果。在沒有事先承諾的情況下比較提示詞或模型時,雙尾檢定是穩妥的選擇。 免責聲明 本檢定假設試驗彼此獨立,並採用常態近似,當每個版本都有相當數量的勝出與落敗時較為可靠。它並未針對同時測試多個版本或反覆查看結果做調整,而這兩者都會提高偽陽性。請將結果視為證據而非定論,並盡可能事先登錄比較設計。 推薦的下一個 LLM 評估樣本數計算器 運用比例的標準樣本數公式,找出一項模型評估需要多少範例,才能將準確率測量在目標誤差範圍之內。 深入了解pass@k 計算器 為程式碼與推理評估計算 pass@k:根據單一樣本成功率,求出 k 個獨立模型樣本中至少有一個解出問題的機率。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 A/B 測試顯著性 更動提示詞、替換模型或調整解碼設定後,新版本通常會在某些範例上勝出、在另一些上落敗。問題在於:量到的差異究竟反映了真正的改進,還是恰巧測到哪些範例的運氣。本計算器對兩個勝率套用雙比例 z 檢定,並回報勝率、檢定統計量、p 值,以及可靠比較所需的試驗次數。 比較兩個勝率 每個版本都以勝率概括:勝出次數除以試驗次數,其中「勝出」是指任何視為成功的事件,例如通過的測試、在對決判定中被偏好的回應,或答對的題目。即使兩個版本完全相同,在有限樣本上量得的兩個勝率也幾乎不會剛好相等,因此檢定要問的是:相對於各自估計中的雜訊,兩者相差有多遠。 公式 檢定會將兩個樣本合併以估計共同勝率,用它計算差異的標準誤,再相除: pˉ=wa+wbna+nbz=pb−papˉ(1−pˉ)(1na+1nb)P=2(1−Φ(∣z∣))\begin{aligned} \bar{p} &= \frac{w_a + w_b}{n_a + n_b} \\ z &= \frac{p_b - p_a}{\sqrt{\bar{p}(1 - \bar{p})\left(\frac{1}{n_a} + \frac{1}{n_b}\right)}} \\ P &= 2\bigl(1 - \Phi(|z|)\bigr) \end{aligned}pˉzP=na+nbwa+wb=pˉ(1−pˉ)(na1+nb1)pb−pa=2(1−Φ(∣z∣)) 其中 pap_a 與 pbp_b 是兩個勝率,pˉ\bar{p} 是合併勝率,zz 是兩個勝率相差多少個標準誤,Φ\Phi 是標準常態累積分布函數,PP 是雙尾 p 值。zz 的絕對值超過約 1.96 即標示 5% 顯著門檻。 範例 假設提示詞 A 在 1,000 項判定任務中勝出 540 次,提示詞 B 在 1,000 項中勝出 590 次: pˉ=540+5902000=0.565z=0.59−0.540.565×0.435×(0.001+0.001)=0.050.0222≈2.26P≈0.024\begin{aligned} \bar{p} &= \frac{540 + 590}{2000} = 0.565 \\ z &= \frac{0.59 - 0.54}{\sqrt{0.565 \times 0.435 \times (0.001 + 0.001)}} = \frac{0.05}{0.0222} \approx 2.26 \\ P &\approx 0.024 \end{aligned}pˉzP=2000540+590=0.565=0.565×0.435×(0.001+0.001)0.59−0.54=0.02220.05≈2.26≈0.024 這五個百分點的差距跨過了 1.96 門檻,p 值接近 0.024,低於 0.05,因此差異具有統計顯著性:隨機因素難以解釋。規劃數字顯示,要可靠偵測這個大小的差距(95% 信賴水準、80% 檢定力)約需每版本 1,538 次試驗,因此這裡的 1,000 次試驗只讓結果剛剛越過門檻,而非穩穩超越。 謹慎解讀結果 顯著不等於重要,只要試驗夠多,微小而無關緊要的差距也可能達到顯著;而有意義的差距在試驗太少時也可能未達顯著。本檢定還假設試驗彼此獨立且只做單一比較:同時評估多個版本,或在資料逐漸累積時反覆查看結果,都會提高偽陽性,需要相應的調整。若要在執行前先估算評估規模,請參考 LLM 評估樣本數計算器;關於抽樣再檢查的程式碼指標,請參考 pass@k 計算器。 常見問題(FAQ)這裡的統計顯著性代表什麼?它探討的是:若兩個版本實際上相等,觀察到的兩個勝率之間的差距,是否大過隨機因素通常會造成的程度。雙比例 z 檢定會將兩個勝率合併,估計兩者差異的標準誤,並回報它們相差多少個標準誤。p 值則是在假設沒有真實差異的前提下,出現至少這麼大差距的機率。較小的 p 值(慣例上低於 0.05)表示隨機因素難以解釋這個結果,因此差異被稱為顯著。它並不衡量差異有多大或多重要,只衡量差異能多有把握地與雜訊區分開來。 我需要多少次試驗?足以偵測所關注的差異,又不至於被雜訊誤導即可。本計算器會回報在 95% 信賴水準與 80% 檢定力(標準的規劃目標)下,偵測觀察到的差距所需的每版本試驗次數。真實差異越小,所需的試驗次數就越多,因為差距必須跨過一個標準誤,而標準誤只隨樣本數的平方根縮小。若目前的試驗次數遠低於所顯示的數字,不顯著的結果可能只是反映資料太少,而非版本真的相等。 這是單尾還是雙尾檢定?雙尾。p 值反映的是在任一方向出現如此大差異的機率,這在事先未承諾哪個版本會勝出時是恰當的預設選擇。單尾檢定只在方向事先固定時才使用,它會將 p 值減半,但可能漏掉在非預期方向上的真實效果。在沒有事先承諾的情況下比較提示詞或模型時,雙尾檢定是穩妥的選擇。 免責聲明 本檢定假設試驗彼此獨立,並採用常態近似,當每個版本都有相當數量的勝出與落敗時較為可靠。它並未針對同時測試多個版本或反覆查看結果做調整,而這兩者都會提高偽陽性。請將結果視為證據而非定論,並盡可能事先登錄比較設計。