首頁 ai 訓練 FLOPs 計算 產生日期: 2026年7月20日 下午09:34 訓練 FLOPs 計算 輸入 計算類型訓練步驟(6ND)參數量70訓練詞元數1,400 AI & LLM 訓練 FLOPs 計算 依 6ND 法則,由參數量與訓練詞元數估算訓練一個 Transformer 所需的浮點運算量,以總 FLOPs 與 petaFLOP/s-days 兩種單位呈現。 輸入 模型與資料 計算類型 訓練步驟 6ND 要計入完整的訓練步驟,或僅計算前向傳遞。一次訓練步驟每個參數、每個詞元約耗費六次浮點運算(前向加反向);單純的前向傳遞約為兩次。 參數量 以十億為單位的模型參數量。乘上詞元數與計算係數,即可估算總算力。 訓練詞元數 模型訓練所用的詞元數,以十億為單位。在 6ND 法則下,資料集越大,算力呈正比增加。 結果 輸入數值即可顯示計算結果。 總 FLOPs 本次訓練估計的浮點運算量,等於計算係數乘以 70 十億參數再乘以 1,400 十億詞元,約 ...。 詳細資料 算力 同一總量以 petaFLOP/s-days 表示,這是訓練預算常用的單位:一個單位等於一台 petaFLOP/s 機器持續運轉一天,即 8.64 × 10¹⁹ 次運算。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 訓練 FLOPs 訓練大型語言模型所需的算力,由一項數量主導:整個訓練過程所執行的浮點運算次數。對於稠密 Transformer,這個量可以用 6ND 法則良好近似,該法則指出訓練每個參數、每見到一個詞元約需六次運算。本計算依此法則,輸入參數量與詞元數,回傳原始運算量以及換算後的 petaFLOP/s-days。 6ND 法則 一次 Transformer 前向傳遞,每個參數、每個詞元約執行兩次浮點運算,對應主導運算量的矩陣乘法中的一次乘法與一次加法。訓練還會加上反向傳遞,將梯度傳播至激活值與權重,其成本約為前向傳遞的兩倍。前向與反向合計,每個參數、每個詞元約為六次運算。在 NN 個參數與 DD 個訓練詞元下,總量因此接近 6 N D6\,N\,D。此估算掌握了佔主導的線性層,省略了注意力、嵌入與正規化等較小的貢獻,這些對大型模型而言可忽略。 計算公式 設計算係數 kk(訓練步驟為六,僅前向傳遞為二)、以十億計的參數量 NN、以十億計的詞元數 DD,則總運算量與以 petaFLOP/s-days 計的算力為 C=k⋅N⋅D⋅1018P=C8.64×1019\begin{aligned} C &= k \cdot N \cdot D \cdot 10^{18} \\ P &= \frac{C}{8.64 \times 10^{19}} \end{aligned}CP=k⋅N⋅D⋅1018=8.64×1019C 其中 CC 為總 FLOPs,PP 為以 petaFLOP/s-days 計的算力。101810^{18} 係數將 NN 與 DD 的十億單位還原為絕對數量。一個 petaFLOP/s-day 是一台 petaFLOP/s 機器持續運轉一天,等於 1015×86,400=8.64×101910^{15} \times 86{,}400 = 8.64 \times 10^{19} 次運算,因此除以此數即可將原始 FLOPs 換算成大型訓練常用的單位。 計算範例 考慮一個 700 億參數的模型,以 14,000 億詞元訓練,詞元對參數的比約為二十,符合算力最佳化的慣例: C=6×70×1400×1018=5.88×1023 FLOPsP=5.88×10238.64×1019≈6,805.6 PFLOP/s-days\begin{aligned} C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \\ P &= \frac{5.88 \times 10^{23}}{8.64 \times 10^{19}} \approx 6{,}805.6\ \text{PFLOP/s-days} \end{aligned}CP=6×70×1400×1018=5.88×1023 FLOPs=8.64×10195.88×1023≈6,805.6 PFLOP/s-days 此次訓練約需 5.88×10235.88 \times 10^{23} 次運算,相當於約 6,806 petaFLOP/s-days。若將計算係數改為二,則回傳的僅是前向傳遞的成本,為訓練總量的三分之一。 適用限制 6ND 法則是對算術運算的理想化計數,並非對實際耗時或成本的預測。真實硬體只能維持峰值吞吐量的一部分,因此實際時間應以達成的速率而非標稱速率去除這個算力得出,此落差由 模型 FLOP 使用率計算機處理。此估算也省略了激活值重算、最佳化器步驟、評估傳遞,以及任何失敗後重啟的訓練,這些在實務上都會增加算力消耗。給定大小的模型應見到多少詞元的相關問題,由 Chinchilla 最佳詞元數計算探討;將算力換算為租用預算則由 GPU 雲端成本計算機處理。 常見問題(FAQ)6ND 法則是什麼6ND 法則估計,訓練一個稠密 Transformer 每個參數、每個訓練詞元約需六次浮點運算,其中 N 為參數量、D 為詞元數。係數六來自前向傳遞每個參數約兩次運算,加上計算梯度的反向傳遞約四次運算。 這是擴展律研究提出的一階近似,掌握了佔主導地位的矩陣乘法,而省略了注意力與嵌入層等較小的項。 總 FLOPs 與 petaFLOP/s-days 如何換算一個 petaFLOP/s-day 是以一台 petaFLOP/s 機器持續運轉一整天所產生的算力,等於 8.64 × 10¹⁹ 次浮點運算(每秒 10¹⁵ 次乘以 86,400 秒)。將總 FLOPs 除以此數,即可換算成 petaFLOP/s-days;大型訓練多以此單位報告,因為原始的 FLOPs 數值往往大到難以閱讀。 此估算涵蓋與不涵蓋哪些部分此估算計入指定訓練詞元數下,前向與反向傳遞中佔主導地位的線性層的浮點運算量。它不考慮硬體使用率,因此實際訓練的耗時與成本會高於理想算力所暗示的數字。它也省略了激活值重算、最佳化器額外開銷、評估,以及失敗或重啟的訓練,而這些都會增加實務上的算力消耗。 免責聲明 本工具採用稠密 Transformer 的一階 6ND 近似,僅計算理想算力。實際訓練時間與成本取決於遠低於峰值的硬體使用率,以及公式未涵蓋的額外開銷。請將結果視為規劃用的估計值,而非精確的計帳。 推薦的下一個 Chinchilla 最佳詞元數計算 依 Chinchilla 法則,以每個參數約二十個詞元的比例,計算模型在算力最佳化下應使用的訓練詞元數,並換算出相應的訓練算力(FLOPs)。 深入了解訓練時間與成本計算 由總訓練 FLOPs、GPU 數量、每 GPU 峰值 TFLOP/s、模型 FLOPs 使用率與每小時 GPU 租金,估算一次 LLM 訓練的耗時與成本。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算 +6 more Show less 算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 訓練 FLOPs 訓練大型語言模型所需的算力,由一項數量主導:整個訓練過程所執行的浮點運算次數。對於稠密 Transformer,這個量可以用 6ND 法則良好近似,該法則指出訓練每個參數、每見到一個詞元約需六次運算。本計算依此法則,輸入參數量與詞元數,回傳原始運算量以及換算後的 petaFLOP/s-days。 6ND 法則 一次 Transformer 前向傳遞,每個參數、每個詞元約執行兩次浮點運算,對應主導運算量的矩陣乘法中的一次乘法與一次加法。訓練還會加上反向傳遞,將梯度傳播至激活值與權重,其成本約為前向傳遞的兩倍。前向與反向合計,每個參數、每個詞元約為六次運算。在 NN 個參數與 DD 個訓練詞元下,總量因此接近 6 N D6\,N\,D。此估算掌握了佔主導的線性層,省略了注意力、嵌入與正規化等較小的貢獻,這些對大型模型而言可忽略。 計算公式 設計算係數 kk(訓練步驟為六,僅前向傳遞為二)、以十億計的參數量 NN、以十億計的詞元數 DD,則總運算量與以 petaFLOP/s-days 計的算力為 C=k⋅N⋅D⋅1018P=C8.64×1019\begin{aligned} C &= k \cdot N \cdot D \cdot 10^{18} \\ P &= \frac{C}{8.64 \times 10^{19}} \end{aligned}CP=k⋅N⋅D⋅1018=8.64×1019C 其中 CC 為總 FLOPs,PP 為以 petaFLOP/s-days 計的算力。101810^{18} 係數將 NN 與 DD 的十億單位還原為絕對數量。一個 petaFLOP/s-day 是一台 petaFLOP/s 機器持續運轉一天,等於 1015×86,400=8.64×101910^{15} \times 86{,}400 = 8.64 \times 10^{19} 次運算,因此除以此數即可將原始 FLOPs 換算成大型訓練常用的單位。 計算範例 考慮一個 700 億參數的模型,以 14,000 億詞元訓練,詞元對參數的比約為二十,符合算力最佳化的慣例: C=6×70×1400×1018=5.88×1023 FLOPsP=5.88×10238.64×1019≈6,805.6 PFLOP/s-days\begin{aligned} C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \\ P &= \frac{5.88 \times 10^{23}}{8.64 \times 10^{19}} \approx 6{,}805.6\ \text{PFLOP/s-days} \end{aligned}CP=6×70×1400×1018=5.88×1023 FLOPs=8.64×10195.88×1023≈6,805.6 PFLOP/s-days 此次訓練約需 5.88×10235.88 \times 10^{23} 次運算,相當於約 6,806 petaFLOP/s-days。若將計算係數改為二,則回傳的僅是前向傳遞的成本,為訓練總量的三分之一。 適用限制 6ND 法則是對算術運算的理想化計數,並非對實際耗時或成本的預測。真實硬體只能維持峰值吞吐量的一部分,因此實際時間應以達成的速率而非標稱速率去除這個算力得出,此落差由 模型 FLOP 使用率計算機處理。此估算也省略了激活值重算、最佳化器步驟、評估傳遞,以及任何失敗後重啟的訓練,這些在實務上都會增加算力消耗。給定大小的模型應見到多少詞元的相關問題,由 Chinchilla 最佳詞元數計算探討;將算力換算為租用預算則由 GPU 雲端成本計算機處理。 常見問題(FAQ)6ND 法則是什麼6ND 法則估計,訓練一個稠密 Transformer 每個參數、每個訓練詞元約需六次浮點運算,其中 N 為參數量、D 為詞元數。係數六來自前向傳遞每個參數約兩次運算,加上計算梯度的反向傳遞約四次運算。 這是擴展律研究提出的一階近似,掌握了佔主導地位的矩陣乘法,而省略了注意力與嵌入層等較小的項。 總 FLOPs 與 petaFLOP/s-days 如何換算一個 petaFLOP/s-day 是以一台 petaFLOP/s 機器持續運轉一整天所產生的算力,等於 8.64 × 10¹⁹ 次浮點運算(每秒 10¹⁵ 次乘以 86,400 秒)。將總 FLOPs 除以此數,即可換算成 petaFLOP/s-days;大型訓練多以此單位報告,因為原始的 FLOPs 數值往往大到難以閱讀。 此估算涵蓋與不涵蓋哪些部分此估算計入指定訓練詞元數下,前向與反向傳遞中佔主導地位的線性層的浮點運算量。它不考慮硬體使用率,因此實際訓練的耗時與成本會高於理想算力所暗示的數字。它也省略了激活值重算、最佳化器額外開銷、評估,以及失敗或重啟的訓練,而這些都會增加實務上的算力消耗。 免責聲明 本工具採用稠密 Transformer 的一階 6ND 近似,僅計算理想算力。實際訓練時間與成本取決於遠低於峰值的硬體使用率,以及公式未涵蓋的額外開銷。請將結果視為規劃用的估計值,而非精確的計帳。