首頁 ai 算力最佳模型大小計算 產生日期: 2026年7月20日 下午09:34 算力最佳模型大小計算 輸入 算力預算6,000每參數詞元數20 AI & LLM 算力最佳模型大小計算 給定以 petaFLOP/s-days 計的訓練算力預算,在固定的每參數詞元比例下反解 6ND 法則,求出 Chinchilla 算力最佳的參數量與詞元數。 輸入 算力預算 算力預算 可用的訓練算力,以 petaFLOP/s-days 計。一個單位等於一台 petaFLOP/s 機器持續運轉一天,即 8.64 × 10¹⁹ 次浮點運算。 每參數詞元數 求解時固定不變的每參數訓練詞元比例。Chinchilla 算力最佳值約為二十。 結果 輸入數值即可顯示計算結果。 最佳參數量 在給定預算與比例下算力最佳的模型大小,以十億參數計,由反解 6ND 法則求得,約 ... 十億。 最佳詞元數 與最佳模型大小搭配的訓練詞元數,以十億計,等於每參數 20 個詞元乘以 ... 十億參數,約 ... 十億。 詳細資料 最佳詞元數(兆) 同一最佳詞元數以兆為單位表示,方便閱讀,約 ...。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 算力最佳模型大小 給定固定的訓練算力,Chinchilla 擴展律回答了這份算力應建構多大的模型、又該以多少詞元訓練。算力最佳的分配讓參數與資料同步搭配,而非將整份預算花在規模上。本計算輸入以 petaFLOP/s-days 計的算力預算,固定每參數詞元比例,反解 6ND 法則,回傳最佳的參數量與詞元數。 分配算力預算 訓練算力可用 6ND 法則良好近似,即每個參數、每個詞元約六次浮點運算。Chinchilla 研究指出,在固定預算下,當模型大小與資料集大小同步增長、每參數約二十個訓練詞元時,損失最小。固定此比例後,算力方程式便化為僅含參數量的關係式,可解出給定預算所能支撐的模型大小。 計算公式 設預算 CC 以 petaFLOP/s-days 計,rr 為每參數詞元比例。將預算換算為 FLOPs,並把 D=rND = rN 代入 6 N D6\,N\,D 法則,得 6⋅N⋅rN=CFLOPs6 \cdot N \cdot rN = C_{\text{FLOPs}},於是參數量與詞元數為 N=1109C⋅8.64×10196rD=r⋅N\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{C \cdot 8.64 \times 10^{19}}{6r}} \\ D &= r \cdot N \end{aligned}ND=10916rC⋅8.64×1019=r⋅N 其中 NN 為以十億計的最佳參數量,DD 為以十億計的最佳詞元數。8.64×10198.64 \times 10^{19} 係數將 petaFLOP/s-days 換算為 FLOPs,除以 10910^{9} 則將 NN 表示為十億單位。平方根之所以出現,是因為一旦詞元與參數綁定,算力便隨參數量的平方增長。 計算範例 取 6,000 petaFLOP/s-days 的預算,搭配每參數二十個詞元的中央比例: N=11096000×8.64×10196×20≈65.7 十億D=20×65.7≈1314.5 十億=1.31 兆\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{6000 \times 8.64 \times 10^{19}}{6 \times 20}} \approx 65.7\ \text{十億} \\ D &= 20 \times 65.7 \approx 1314.5\ \text{十億} = 1.31\ \text{兆} \end{aligned}ND=10916×206000×8.64×1019≈65.7 十億=20×65.7≈1314.5 十億=1.31 兆 這份預算最佳的用法,是建構一個約 657 億參數的模型,並以約 1.31 兆個詞元訓練。將預算加倍時,最佳參數量只會增加約根號二倍,而非兩倍,這正是平方根依賴關係所致。 適用限制 本工具僅反映固定訓練預算下算力最佳的訓練損失,別無其他。它不衡量服務模型的成本,而後者往往使得以更多詞元訓練較小模型成為更佳的實務選擇,因此部署的模型常低於此處回傳的參數量。固定比例本身也是會隨資料集與架構變動的估計值,且真實訓練只能維持峰值硬體吞吐量的一部分。同一取捨的資料面由 Chinchilla 最佳詞元數計算處理,而任一選定配置的原始算力則由 訓練 FLOPs 計算計算。 常見問題(FAQ)固定的算力預算該如何在模型大小與資料間分配Chinchilla 擴展律指出,在固定的訓練預算下,唯有參數與訓練詞元同步擴展才能最小化損失,而非把大部分預算花在參數上。將每參數詞元比例固定在約二十,並就該預算求解 6ND 算力方程式,即可得出最能善用可用算力的模型大小與資料集大小。預算越大,可支撐的模型與資料集也按比例增大。 為何模型大小與算力的平方根成正比在 6ND 法則下,訓練算力為六乘以參數量再乘以詞元數。將詞元固定在每參數 r 個,使詞元等於 r 乘以 N,於是算力變成六乘以 r 乘以 N 的平方。由於算力隨參數量的平方增長,要從算力預算回推參數量,就必須取平方根:N 等於算力除以六 r 後再開根號。詞元數則隨之為 r 乘以 N。 petaFLOP/s-day 是什麼一個 petaFLOP/s-day 是以一台 petaFLOP/s 機器,即每秒 10¹⁵ 次浮點運算,持續運轉一整天所產生的算力。乘以一天的 86,400 秒,即得 8.64 × 10¹⁹ 次運算。它是報告與比較大型訓練算力預算的標準單位,因為原始的運算次數往往大到難以閱讀。 免責聲明 本工具在固定的每參數詞元比例下反解一階 6ND 法則,僅反映算力最佳的訓練損失。它未計入推論成本,而推論成本往往使得以更多詞元訓練較小模型更為有利,也未計入低於峰值的硬體使用率。請將結果視為規劃用的估計值。 推薦的下一個 Chinchilla 最佳詞元數計算 依 Chinchilla 法則,以每個參數約二十個詞元的比例,計算模型在算力最佳化下應使用的訓練詞元數,並換算出相應的訓練算力(FLOPs)。 深入了解訓練 FLOPs 計算 依 6ND 法則,由參數量與訓練詞元數估算訓練一個 Transformer 所需的浮點運算量,以總 FLOPs 與 petaFLOP/s-days 兩種單位呈現。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算 +6 more Show less 算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 算力最佳模型大小 給定固定的訓練算力,Chinchilla 擴展律回答了這份算力應建構多大的模型、又該以多少詞元訓練。算力最佳的分配讓參數與資料同步搭配,而非將整份預算花在規模上。本計算輸入以 petaFLOP/s-days 計的算力預算,固定每參數詞元比例,反解 6ND 法則,回傳最佳的參數量與詞元數。 分配算力預算 訓練算力可用 6ND 法則良好近似,即每個參數、每個詞元約六次浮點運算。Chinchilla 研究指出,在固定預算下,當模型大小與資料集大小同步增長、每參數約二十個訓練詞元時,損失最小。固定此比例後,算力方程式便化為僅含參數量的關係式,可解出給定預算所能支撐的模型大小。 計算公式 設預算 CC 以 petaFLOP/s-days 計,rr 為每參數詞元比例。將預算換算為 FLOPs,並把 D=rND = rN 代入 6 N D6\,N\,D 法則,得 6⋅N⋅rN=CFLOPs6 \cdot N \cdot rN = C_{\text{FLOPs}},於是參數量與詞元數為 N=1109C⋅8.64×10196rD=r⋅N\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{C \cdot 8.64 \times 10^{19}}{6r}} \\ D &= r \cdot N \end{aligned}ND=10916rC⋅8.64×1019=r⋅N 其中 NN 為以十億計的最佳參數量,DD 為以十億計的最佳詞元數。8.64×10198.64 \times 10^{19} 係數將 petaFLOP/s-days 換算為 FLOPs,除以 10910^{9} 則將 NN 表示為十億單位。平方根之所以出現,是因為一旦詞元與參數綁定,算力便隨參數量的平方增長。 計算範例 取 6,000 petaFLOP/s-days 的預算,搭配每參數二十個詞元的中央比例: N=11096000×8.64×10196×20≈65.7 十億D=20×65.7≈1314.5 十億=1.31 兆\begin{aligned} N &= \frac{1}{10^{9}}\sqrt{\frac{6000 \times 8.64 \times 10^{19}}{6 \times 20}} \approx 65.7\ \text{十億} \\ D &= 20 \times 65.7 \approx 1314.5\ \text{十億} = 1.31\ \text{兆} \end{aligned}ND=10916×206000×8.64×1019≈65.7 十億=20×65.7≈1314.5 十億=1.31 兆 這份預算最佳的用法,是建構一個約 657 億參數的模型,並以約 1.31 兆個詞元訓練。將預算加倍時,最佳參數量只會增加約根號二倍,而非兩倍,這正是平方根依賴關係所致。 適用限制 本工具僅反映固定訓練預算下算力最佳的訓練損失,別無其他。它不衡量服務模型的成本,而後者往往使得以更多詞元訓練較小模型成為更佳的實務選擇,因此部署的模型常低於此處回傳的參數量。固定比例本身也是會隨資料集與架構變動的估計值,且真實訓練只能維持峰值硬體吞吐量的一部分。同一取捨的資料面由 Chinchilla 最佳詞元數計算處理,而任一選定配置的原始算力則由 訓練 FLOPs 計算計算。 常見問題(FAQ)固定的算力預算該如何在模型大小與資料間分配Chinchilla 擴展律指出,在固定的訓練預算下,唯有參數與訓練詞元同步擴展才能最小化損失,而非把大部分預算花在參數上。將每參數詞元比例固定在約二十,並就該預算求解 6ND 算力方程式,即可得出最能善用可用算力的模型大小與資料集大小。預算越大,可支撐的模型與資料集也按比例增大。 為何模型大小與算力的平方根成正比在 6ND 法則下,訓練算力為六乘以參數量再乘以詞元數。將詞元固定在每參數 r 個,使詞元等於 r 乘以 N,於是算力變成六乘以 r 乘以 N 的平方。由於算力隨參數量的平方增長,要從算力預算回推參數量,就必須取平方根:N 等於算力除以六 r 後再開根號。詞元數則隨之為 r 乘以 N。 petaFLOP/s-day 是什麼一個 petaFLOP/s-day 是以一台 petaFLOP/s 機器,即每秒 10¹⁵ 次浮點運算,持續運轉一整天所產生的算力。乘以一天的 86,400 秒,即得 8.64 × 10¹⁹ 次運算。它是報告與比較大型訓練算力預算的標準單位,因為原始的運算次數往往大到難以閱讀。 免責聲明 本工具在固定的每參數詞元比例下反解一階 6ND 法則,僅反映算力最佳的訓練損失。它未計入推論成本,而推論成本往往使得以更多詞元訓練較小模型更為有利,也未計入低於峰值的硬體使用率。請將結果視為規劃用的估計值。