首頁 ai 訓練時間與成本計算 產生日期: 2026年7月20日 下午09:34 訓練時間與成本計算 輸入 總訓練 FLOPs5.88e23模型 FLOPs 使用率40 %GPU 數量1,024每 GPU 峰值吞吐量989每小時 GPU 租金2.5 $ AI & LLM 訓練時間與成本計算 由總訓練 FLOPs、GPU 數量、每 GPU 峰值 TFLOP/s、模型 FLOPs 使用率與每小時 GPU 租金,估算一次 LLM 訓練的耗時與成本。 輸入 工作量 總訓練 FLOPs 整個訓練所執行的浮點運算總量,常以六倍的參數量乘以訓練詞元數估算。舉例而言,一個 70 億參數的模型以 1.4 兆詞元訓練,約為 5.88e22 FLOPs。 模型 FLOPs 使用率 % 0 – 100 % 訓練實際維持的峰值吞吐量比例。調校良好的大型模型訓練通常落在 35% 到 55% 之間;數值越低,排程依比例拉長。 叢集 GPU 數量 平行運作的加速器數量。其吞吐量會相加,因此數量加倍大致可將實際耗時減半,而 GPU 時數成本不變。 每 GPU 峰值吞吐量 在該訓練精度下,單張加速器的標稱峰值浮點吞吐量,以 TFLOP/s 計,例如每張 H100 約 989 TFLOP/s 的稠密 16 位元算力。 每小時 GPU 租金 $ 單張加速器每小時的租用價格。總帳單與此費率及訓練消耗的 GPU 時數呈線性關係。 結果 輸入數值即可顯示計算結果。 訓練時間 日 訓練的實際耗時:總 FLOPs 除以有效的叢集吞吐量,即各 GPU 峰值之和乘以使用率。此處約為 ...。 總成本 $ 訓練的 GPU 時數帳單:以小時計的耗時乘以 GPU 數量再乘以每小時租金,約 ...。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 訓練時間與成本 訓練大型語言模型是一份分散到加速器叢集上的固定算術工作量,因此只要工作量與硬體確定,耗時與帳單都可預估。本計算由總訓練 FLOPs、GPU 數量、每張 GPU 的峰值吞吐量、模型 FLOPs 使用率與每小時租金,估算一次訓練的實際耗時與 GPU 時數成本。 此估算涵蓋的範圍 訓練的浮點運算總量可用單一數量良好近似,常寫作六倍的參數量乘以訓練詞元數。此總量一旦確定,唯一能改變排程的,就是叢集消化它的速度。叢集的維持速率,是各加速器峰值速率之和乘以實際使用比例,即模型 FLOPs 使用率。以此速率去除工作量得出時間,再以時間乘以 GPU 數量與每小時租金得出成本。 計算公式 設工作量 CC 以 FLOPs 計,nn 張加速器各標稱 PP TFLOP/s,使用率為 UU,每張 GPU 每小時租金為 cc,則訓練時間 tt 與總成本 TT 為 t=Cn⋅P⋅1012⋅UT=t3600⋅n⋅c\begin{aligned} t &= \frac{C}{n \cdot P \cdot 10^{12} \cdot U} \\ T &= \frac{t}{3600} \cdot n \cdot c \end{aligned}tT=n⋅P⋅1012⋅UC=3600t⋅n⋅c 101210^{12} 係數將 TFLOP/s 換算為 FLOP/s,因此 tt 以秒為單位;除以 3600 再化為 GPU 時數以供計價。GPU 數量加倍會使時間減半,但 GPU 時數成本不變,因為同樣的工作量只是更早完成。 計算範例 取一次 5.88×10235.88 \times 10^{23} FLOPs 的訓練,使用 1,024 張各標稱 989 TFLOP/s 的加速器,維持 40% 使用率,每張 GPU 每小時租金 2.50: t=5.88×10231024×989×1012×0.4≈1.45×106 秒≈16.8 天T=1.45×1063600×1024×2.50≈1,032,000\begin{aligned} t &= \frac{5.88 \times 10^{23}}{1024 \times 989 \times 10^{12} \times 0.4} \approx 1.45 \times 10^{6}\ \text{秒} \approx 16.8\ \text{天} \\ T &= \frac{1.45 \times 10^{6}}{3600} \times 1024 \times 2.50 \approx 1{,}032{,}000 \end{aligned}tT=1024×989×1012×0.45.88×1023≈1.45×106 秒≈16.8 天=36001.45×106×1024×2.50≈1,032,000 此次訓練約需十七天,GPU 租金略高於一百萬。將使用率從 40% 提高到 50%,時間與成本都會減少五分之一,這也是為何把同一硬體榨出更多效能,是成本最低的最佳化手段。 適用限制 此估算假設訓練受算力限制,且使用率數值已對整份工作取平均。它不計入檢查點寫入、資料載入停頓、硬體故障後的重啟、評估傳遞,以及保留資源卻未運算的閒置時間。網路、儲存,以及競價與保留價格的差異,也都會改變實際總額。請將結果視為規劃用的基準,並為額外開銷預留餘裕。餵入本計算的工作量總量由 訓練 FLOPs 計算推導,而帳單中純粹的租用部分則由 GPU 雲端成本計算機計算。 常見問題(FAQ)訓練時間如何估算將訓練的浮點運算總量除以叢集可維持的速率。該速率為 GPU 數量乘以每張 GPU 的峰值 TFLOP/s 再乘以模型 FLOPs 使用率,換算成每秒運算次數。以此維持速率去除總運算量,即得實際耗時的秒數,計算會以天、小時或分鐘呈現。 此估算假設訓練受算力限制,且使用率數值已涵蓋整份工作的平均效率。 應採用何種使用率數值模型 FLOPs 使用率是訓練實際達成的理論峰值吞吐量比例。在調校良好的系統上進行大型模型訓練,通常落在 35% 到 55% 之間,以 40% 為合理的預設值。較小的模型、較短的序列、繁重的通訊或未最佳化的核心,都會把它拉得更低。 由於時間與使用率成反比,使用率減半會使預估排程加倍,因此一次簡短分析所量得的數值,遠比憑空猜測更準確。 實際帳單為何可能與此估算不同此估算僅計入選定使用率下的穩態算力。真實訓練還會加上檢查點寫入、資料載入的停頓、失敗後的重啟、評估傳遞,以及保留資源卻未運算的閒置時間。 競價或保留價格、網路與儲存費用,以及在訓練過程中漂移的使用率,也都會改變總額。請將此數字視為規劃用的基準,並為額外開銷預留餘裕,而非當成精確的帳單。 免責聲明 此估算假設訓練受算力限制且模型 FLOPs 使用率固定,未計入檢查點、資料載入停頓、重啟、網路與儲存。實際時間與成本會隨硬體、軟體環境與計價方式而異;請將結果視為規劃用的基準。 推薦的下一個 訓練 FLOPs 計算 依 6ND 法則,由參數量與訓練詞元數估算訓練一個 Transformer 所需的浮點運算量,以總 FLOPs 與 petaFLOP/s-days 兩種單位呈現。 深入了解GPU 雲端成本計算機 依每小時價格、GPU 數量與執行時長,估算租用雲端 GPU 進行固定時長執行的總帳單,以及每張 GPU 所貢獻的成本。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機訓練時間與成本計算 +20 more Show less 批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機 其他ai計算機 inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 訓練時間與成本 訓練大型語言模型是一份分散到加速器叢集上的固定算術工作量,因此只要工作量與硬體確定,耗時與帳單都可預估。本計算由總訓練 FLOPs、GPU 數量、每張 GPU 的峰值吞吐量、模型 FLOPs 使用率與每小時租金,估算一次訓練的實際耗時與 GPU 時數成本。 此估算涵蓋的範圍 訓練的浮點運算總量可用單一數量良好近似,常寫作六倍的參數量乘以訓練詞元數。此總量一旦確定,唯一能改變排程的,就是叢集消化它的速度。叢集的維持速率,是各加速器峰值速率之和乘以實際使用比例,即模型 FLOPs 使用率。以此速率去除工作量得出時間,再以時間乘以 GPU 數量與每小時租金得出成本。 計算公式 設工作量 CC 以 FLOPs 計,nn 張加速器各標稱 PP TFLOP/s,使用率為 UU,每張 GPU 每小時租金為 cc,則訓練時間 tt 與總成本 TT 為 t=Cn⋅P⋅1012⋅UT=t3600⋅n⋅c\begin{aligned} t &= \frac{C}{n \cdot P \cdot 10^{12} \cdot U} \\ T &= \frac{t}{3600} \cdot n \cdot c \end{aligned}tT=n⋅P⋅1012⋅UC=3600t⋅n⋅c 101210^{12} 係數將 TFLOP/s 換算為 FLOP/s,因此 tt 以秒為單位;除以 3600 再化為 GPU 時數以供計價。GPU 數量加倍會使時間減半,但 GPU 時數成本不變,因為同樣的工作量只是更早完成。 計算範例 取一次 5.88×10235.88 \times 10^{23} FLOPs 的訓練,使用 1,024 張各標稱 989 TFLOP/s 的加速器,維持 40% 使用率,每張 GPU 每小時租金 2.50: t=5.88×10231024×989×1012×0.4≈1.45×106 秒≈16.8 天T=1.45×1063600×1024×2.50≈1,032,000\begin{aligned} t &= \frac{5.88 \times 10^{23}}{1024 \times 989 \times 10^{12} \times 0.4} \approx 1.45 \times 10^{6}\ \text{秒} \approx 16.8\ \text{天} \\ T &= \frac{1.45 \times 10^{6}}{3600} \times 1024 \times 2.50 \approx 1{,}032{,}000 \end{aligned}tT=1024×989×1012×0.45.88×1023≈1.45×106 秒≈16.8 天=36001.45×106×1024×2.50≈1,032,000 此次訓練約需十七天,GPU 租金略高於一百萬。將使用率從 40% 提高到 50%,時間與成本都會減少五分之一,這也是為何把同一硬體榨出更多效能,是成本最低的最佳化手段。 適用限制 此估算假設訓練受算力限制,且使用率數值已對整份工作取平均。它不計入檢查點寫入、資料載入停頓、硬體故障後的重啟、評估傳遞,以及保留資源卻未運算的閒置時間。網路、儲存,以及競價與保留價格的差異,也都會改變實際總額。請將結果視為規劃用的基準,並為額外開銷預留餘裕。餵入本計算的工作量總量由 訓練 FLOPs 計算推導,而帳單中純粹的租用部分則由 GPU 雲端成本計算機計算。 常見問題(FAQ)訓練時間如何估算將訓練的浮點運算總量除以叢集可維持的速率。該速率為 GPU 數量乘以每張 GPU 的峰值 TFLOP/s 再乘以模型 FLOPs 使用率,換算成每秒運算次數。以此維持速率去除總運算量,即得實際耗時的秒數,計算會以天、小時或分鐘呈現。 此估算假設訓練受算力限制,且使用率數值已涵蓋整份工作的平均效率。 應採用何種使用率數值模型 FLOPs 使用率是訓練實際達成的理論峰值吞吐量比例。在調校良好的系統上進行大型模型訓練,通常落在 35% 到 55% 之間,以 40% 為合理的預設值。較小的模型、較短的序列、繁重的通訊或未最佳化的核心,都會把它拉得更低。 由於時間與使用率成反比,使用率減半會使預估排程加倍,因此一次簡短分析所量得的數值,遠比憑空猜測更準確。 實際帳單為何可能與此估算不同此估算僅計入選定使用率下的穩態算力。真實訓練還會加上檢查點寫入、資料載入的停頓、失敗後的重啟、評估傳遞,以及保留資源卻未運算的閒置時間。 競價或保留價格、網路與儲存費用,以及在訓練過程中漂移的使用率,也都會改變總額。請將此數字視為規劃用的基準,並為額外開銷預留餘裕,而非當成精確的帳單。 免責聲明 此估算假設訓練受算力限制且模型 FLOPs 使用率固定,未計入檢查點、資料載入停頓、重啟、網路與儲存。實際時間與成本會隨硬體、軟體環境與計價方式而異;請將結果視為規劃用的基準。