首頁 ai 資料平行擴展計算 產生日期: 2026年7月20日 下午09:34 資料平行擴展計算 輸入 裝置數64每裝置吞吐量2,000擴展效率90 % AI & LLM 資料平行擴展計算 由每裝置吞吐量與擴展效率,估算資料平行裝置上的實際訓練吞吐量,並給出理想的線性吞吐量,以及相對單一裝置的實際加速比。 輸入 叢集 裝置數 ≥ 1 分擔工作量的資料平行加速器數量。每個持有一份模型副本,並平行處理各自的微批次。 每裝置吞吐量 單一裝置獨立運作時所維持的吞吐量,以每秒樣本數或詞元數計。此單位會沿用至理想值與實際值。 擴展效率 % 0 – 100 % 實際達成的理想線性擴展比例,介於零與一之間。通訊、同步與負載不均會把它拉低於一。 結果 輸入數值即可顯示計算結果。 實際吞吐量 計入損耗後的實際吞吐量,等於理想值 ... 乘以 90 % 效率,即 ...。 加速比 叢集較單一裝置快幾倍:64 個裝置乘以 90 % 效率,即 ...×。 詳細資料 理想吞吐量 若擴展完全線性時的吞吐量,等於 64 個裝置乘以每個 2,000,即 ...。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 資料平行擴展 資料平行是加速訓練模型最常見的方式:把模型複製到許多加速器上,給每個副本一份批次的切片,並在每一步平均它們的梯度。在理想情境下,吞吐量會與裝置數成正比上升。實務上並非如此,因為維持各副本同步的梯度平均,所耗的時間會隨叢集增長。本計算把理想的線性吞吐量與計入此損耗後的實際數字分開,並回報由此產生的加速比。 理想與實際 理想吞吐量是完美擴展所能達到的:每個裝置都貢獻其完整獨立速率,毫無額外開銷。實際吞吐量則是這個理想值,被擴展效率折扣後的結果,擴展效率是介於零與一之間、吸收所有平行運作不完美之處的單一比例。效率 0.9 表示叢集發揮理論最大值的九成,因此一個 64 裝置的工作,表現等同 57.6 個完美擴展的裝置。 計算公式 設裝置數 dd、每裝置吞吐量 vv、擴展效率 EE,則理想吞吐量 II、實際吞吐量 AA,以及相對單一裝置的加速比 SS 為 I=d⋅vA=I⋅ES=d⋅E\begin{aligned} I &= d \cdot v \\ A &= I \cdot E \\ S &= d \cdot E \end{aligned}IAS=d⋅v=I⋅E=d⋅E 加速比就是裝置數被效率縮放後的值,因為單一裝置以 vv 運行,而叢集以 A=d⋅v⋅EA = d \cdot v \cdot E 運行。 計算範例 取 64 個裝置,每個獨立維持每秒 2,000 個樣本,實測擴展效率為 0.9: I=64×2000=128,000A=128,000×0.9=115,200S=64×0.9=57.6\begin{aligned} I &= 64 \times 2000 = 128{,}000 \\ A &= 128{,}000 \times 0.9 = 115{,}200 \\ S &= 64 \times 0.9 = 57.6 \end{aligned}IAS=64×2000=128,000=128,000×0.9=115,200=64×0.9=57.6 此叢集每秒處理 115,200 個樣本,相對單一裝置為 57.6× 的加速比,而非完美擴展所暗示的 64×。其間相差的約 13,000 個樣本每秒,就是維持各副本同步的代價。 適用限制 本模型把每一種擴展損耗的來源,濃縮成由使用者提供的單一效率數字;它不從互連頻寬、模型大小或批次預測該數字。效率也鮮少固定,通常隨裝置增加而下降,因為梯度 all-reduce 增長而每裝置算力維持不變,因此在某一叢集規模量得的數值,不應假設適用於另一規模。此處假設為純資料平行;該複製方式對批次的影響由 有效批次大小計算處理,而把模型切分到各管線階段所特有的額外開銷則由 管線平行氣泡計算處理。 常見問題(FAQ)擴展效率是什麼擴展效率是叢集實際達成的吞吐量,對每個新增裝置都貢獻其完整獨立速率時所能達成吞吐量的比值。效率 0.9 表示 64 個裝置的表現等同 57.6 個理想裝置。 它把每一種不完美擴展的來源,包括梯度通訊、同步等待與工作不均,全都折進零與一之間的單一比例,是報告訓練工作平行化程度的標準方式。 擴展為何並非線性資料平行訓練的每個最佳化步驟,都需要一次跨所有裝置交換並平均梯度的 all-reduce,而這項通訊隨叢集增長,每裝置的有效算力卻維持不變。 再加上同步屏障、拖累全體的落後者,以及裝置倍增時逐漸縮小的算力對通訊比,新增的裝置貢獻便不如第一個。其結果是次線性擴展,此處由低於一的效率所掌握。 如何提升擴展效率常用的手段,一是提高通訊之間所完成的算力,例如加大每裝置批次或採用梯度累積,使固定的 all-reduce 成本攤提到更多工作上;二是採用更快的互連或拓撲感知的集合運算演算法,以削減通訊本身。 讓梯度通訊與反向傳遞重疊,並透過均衡的資料分片減少落後者,也有助益。效率在裝置增加時仍保持穩定,正是平行設定調校良好的跡象。 免責聲明 這是一階模型,將擴展損耗以使用者提供的單一效率比例表示。它不從互連頻寬、模型大小或批次推導該比例,並假設為純資料平行。請在自己的叢集上量測效率,而非假設固定值。 推薦的下一個 有效批次大小計算 由每裝置微批次、資料平行裝置數與梯度累積步數,計算分散式訓練的有效(全域)批次大小,並給出每次最佳化步驟的詞元數。 深入了解管線平行氣泡計算 由管線階段數與每批次的微批次數,計算管線平行訓練的氣泡佔比與由此產生的算力效率。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算 +6 more Show less 算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 資料平行擴展 資料平行是加速訓練模型最常見的方式:把模型複製到許多加速器上,給每個副本一份批次的切片,並在每一步平均它們的梯度。在理想情境下,吞吐量會與裝置數成正比上升。實務上並非如此,因為維持各副本同步的梯度平均,所耗的時間會隨叢集增長。本計算把理想的線性吞吐量與計入此損耗後的實際數字分開,並回報由此產生的加速比。 理想與實際 理想吞吐量是完美擴展所能達到的:每個裝置都貢獻其完整獨立速率,毫無額外開銷。實際吞吐量則是這個理想值,被擴展效率折扣後的結果,擴展效率是介於零與一之間、吸收所有平行運作不完美之處的單一比例。效率 0.9 表示叢集發揮理論最大值的九成,因此一個 64 裝置的工作,表現等同 57.6 個完美擴展的裝置。 計算公式 設裝置數 dd、每裝置吞吐量 vv、擴展效率 EE,則理想吞吐量 II、實際吞吐量 AA,以及相對單一裝置的加速比 SS 為 I=d⋅vA=I⋅ES=d⋅E\begin{aligned} I &= d \cdot v \\ A &= I \cdot E \\ S &= d \cdot E \end{aligned}IAS=d⋅v=I⋅E=d⋅E 加速比就是裝置數被效率縮放後的值,因為單一裝置以 vv 運行,而叢集以 A=d⋅v⋅EA = d \cdot v \cdot E 運行。 計算範例 取 64 個裝置,每個獨立維持每秒 2,000 個樣本,實測擴展效率為 0.9: I=64×2000=128,000A=128,000×0.9=115,200S=64×0.9=57.6\begin{aligned} I &= 64 \times 2000 = 128{,}000 \\ A &= 128{,}000 \times 0.9 = 115{,}200 \\ S &= 64 \times 0.9 = 57.6 \end{aligned}IAS=64×2000=128,000=128,000×0.9=115,200=64×0.9=57.6 此叢集每秒處理 115,200 個樣本,相對單一裝置為 57.6× 的加速比,而非完美擴展所暗示的 64×。其間相差的約 13,000 個樣本每秒,就是維持各副本同步的代價。 適用限制 本模型把每一種擴展損耗的來源,濃縮成由使用者提供的單一效率數字;它不從互連頻寬、模型大小或批次預測該數字。效率也鮮少固定,通常隨裝置增加而下降,因為梯度 all-reduce 增長而每裝置算力維持不變,因此在某一叢集規模量得的數值,不應假設適用於另一規模。此處假設為純資料平行;該複製方式對批次的影響由 有效批次大小計算處理,而把模型切分到各管線階段所特有的額外開銷則由 管線平行氣泡計算處理。 常見問題(FAQ)擴展效率是什麼擴展效率是叢集實際達成的吞吐量,對每個新增裝置都貢獻其完整獨立速率時所能達成吞吐量的比值。效率 0.9 表示 64 個裝置的表現等同 57.6 個理想裝置。 它把每一種不完美擴展的來源,包括梯度通訊、同步等待與工作不均,全都折進零與一之間的單一比例,是報告訓練工作平行化程度的標準方式。 擴展為何並非線性資料平行訓練的每個最佳化步驟,都需要一次跨所有裝置交換並平均梯度的 all-reduce,而這項通訊隨叢集增長,每裝置的有效算力卻維持不變。 再加上同步屏障、拖累全體的落後者,以及裝置倍增時逐漸縮小的算力對通訊比,新增的裝置貢獻便不如第一個。其結果是次線性擴展,此處由低於一的效率所掌握。 如何提升擴展效率常用的手段,一是提高通訊之間所完成的算力,例如加大每裝置批次或採用梯度累積,使固定的 all-reduce 成本攤提到更多工作上;二是採用更快的互連或拓撲感知的集合運算演算法,以削減通訊本身。 讓梯度通訊與反向傳遞重疊,並透過均衡的資料分片減少落後者,也有助益。效率在裝置增加時仍保持穩定,正是平行設定調校良好的跡象。 免責聲明 這是一階模型,將擴展損耗以使用者提供的單一效率比例表示。它不從互連頻寬、模型大小或批次推導該比例,並假設為純資料平行。請在自己的叢集上量測效率,而非假設固定值。