首頁 ai Chinchilla 最佳詞元數計算 產生日期: 2026年7月20日 下午09:34 Chinchilla 最佳詞元數計算 輸入 參數量70每參數詞元數20 AI & LLM Chinchilla 最佳詞元數計算 依 Chinchilla 法則,以每個參數約二十個詞元的比例,計算模型在算力最佳化下應使用的訓練詞元數,並換算出相應的訓練算力(FLOPs)。 輸入 模型 參數量 以十億為單位的模型參數量。最佳詞元數與此數值成正比。 每參數詞元數 每個參數對應的訓練詞元數。Chinchilla 的結論將算力最佳的比例定在約二十;以部署為目標的模型則常以遠高於此的比例訓練。 結果 輸入數值即可顯示計算結果。 最佳詞元數 建議的訓練詞元數,以十億為單位,等於 70 十億參數乘以每參數 20 個詞元,約 ... 十億。 最佳詞元數(兆) 同一建議詞元數以兆為單位表示,方便閱讀,約 ...。 詳細資料 訓練算力 在 6ND 法則下,以此詞元數訓練所需的算力,即每個參數、每個詞元六次運算,約 ... 次浮點運算。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 Chinchilla 最佳詞元數 Chinchilla 的擴展律結論,重新定義了語言模型的規模設定方式。它指出,在固定的算力預算下,最佳的準確度並非來自把模型做到最大,而是來自參數量與訓練詞元同步擴展,讓每個參數搭配約二十個詞元的訓練資料。本計算依此比例,輸入參數量,回傳算力最佳的詞元數,以及它所對應的訓練算力。 算力最佳比例 在 Chinchilla 之前,主流做法是把算力預算大多花在參數上,資料相對偏少,使得模型相對於其規模而言訓練不足。2022 年 DeepMind 的研究在數百次訓練上擬合擴展律,發現在給定預算下,當模型大小與資料集大小同步增長時損失最小。經驗上的平衡點,將最佳資料集定在約每參數二十個訓練詞元。因此一個 NN 參數的模型,應以約 20 N20\,N 個詞元訓練。 計算公式 設以十億計的參數量 NN 與每參數詞元數比例 rr,則最佳詞元數與相應的訓練算力為 D=N⋅rC=6⋅N⋅D⋅1018\begin{aligned} D &= N \cdot r \\ C &= 6 \cdot N \cdot D \cdot 10^{18} \end{aligned}DC=N⋅r=6⋅N⋅D⋅1018 其中 DD 為以十億計的最佳訓練詞元數,CC 為以浮點運算計的訓練算力。算力遵循 6 N D6\,N\,D 法則,即每個參數、每個詞元約收六次運算,而 101810^{18} 係數將 NN 與 DD 的十億單位還原為絕對數量。 計算範例 考慮一個 700 億參數的模型,搭配每參數二十個詞元的中央比例: D=70×20=1400 十億詞元=1.4 兆C=6×70×1400×1018=5.88×1023 FLOPs\begin{aligned} D &= 70 \times 20 = 1400\ \text{十億詞元} = 1.4\ \text{兆} \\ C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \end{aligned}DC=70×20=1400 十億詞元=1.4 兆=6×70×1400×1018=5.88×1023 FLOPs 算力最佳的資料集約為 1.4 兆個詞元,以此訓練約耗費 5.88×10235.88 \times 10^{23} 次運算。若提高比例,例如每參數一百個詞元,詞元數與算力都會等比例增加。 適用限制 二十比一的比例在固定訓練預算下最小化訓練損失,但它刻意忽略了部署成品模型的服務成本。將回答大量請求的模型,常以遠多於 Chinchilla 最佳值的詞元訓練,因為在同等品質下,較小的模型訓練得更久反而運行更便宜。確切的最佳比例也會隨資料集、分詞器與架構變動,因此二十是中央估計值而非常數。在固定算力預算下設定模型大小的互補問題,由 算力最佳模型大小計算處理;而給定配置的原始算力則由 訓練 FLOPs 計算計算。 常見問題(FAQ)Chinchilla 擴展律的結論是什麼Chinchilla 的結論由 DeepMind 於 2022 年發表,發現先前的大型模型訓練不足:在固定的算力預算下,唯有模型大小與訓練詞元同步擴展,準確度才會提升最多,而非將預算大多花在參數上。 該研究在數百次訓練上擬合擴展律,得出算力最佳的配置是每個參數搭配約二十個訓練詞元,與先前以遠低比例訓練的模型形成明顯對比。 為何約為每參數二十個詞元此比例由對訓練資料擬合的擴展律推導而來。在固定的算力預算下,當增加參數的邊際效益等於增加詞元的邊際效益時,損失最小,而 Chinchilla 研究中的經驗指數將此平衡點定在約每參數二十個詞元。確切數值取決於資料集與架構,因此二十是一個概略的中央估計值,而非精確常數。 每參數二十個詞元仍是合適的目標嗎二十是在固定訓練預算下最小化訓練損失的算力最佳比例,但它忽略了推論成本。將服務大量請求的模型,往往以遠高於 Chinchilla 最佳值的詞元數訓練,因為較小的模型訓練得更久,即使其訓練並非算力最佳,運行時仍更便宜。 基於此理由,數個廣為使用的模型以一百以上的比例訓練,因此二十應視為基準而非上限。 免責聲明 每參數二十個詞元的比例是 Chinchilla 擴展律的中央估計值,會隨資料集與架構而變動。它僅就訓練算力進行最佳化,未計入推論成本,而推論成本往往使得以遠多詞元訓練較小模型更為划算。請將結果視為起點,而非固定規則。 推薦的下一個 算力最佳模型大小計算 給定以 petaFLOP/s-days 計的訓練算力預算,在固定的每參數詞元比例下反解 6ND 法則,求出 Chinchilla 算力最佳的參數量與詞元數。 深入了解訓練 FLOPs 計算 依 6ND 法則,由參數量與訓練詞元數估算訓練一個 Transformer 所需的浮點運算量,以總 FLOPs 與 petaFLOP/s-days 兩種單位呈現。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算Chinchilla 最佳詞元數計算 +6 more Show less 算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算LLM 訓練 VRAM 計算機LoRA 參數計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 Chinchilla 最佳詞元數 Chinchilla 的擴展律結論,重新定義了語言模型的規模設定方式。它指出,在固定的算力預算下,最佳的準確度並非來自把模型做到最大,而是來自參數量與訓練詞元同步擴展,讓每個參數搭配約二十個詞元的訓練資料。本計算依此比例,輸入參數量,回傳算力最佳的詞元數,以及它所對應的訓練算力。 算力最佳比例 在 Chinchilla 之前,主流做法是把算力預算大多花在參數上,資料相對偏少,使得模型相對於其規模而言訓練不足。2022 年 DeepMind 的研究在數百次訓練上擬合擴展律,發現在給定預算下,當模型大小與資料集大小同步增長時損失最小。經驗上的平衡點,將最佳資料集定在約每參數二十個訓練詞元。因此一個 NN 參數的模型,應以約 20 N20\,N 個詞元訓練。 計算公式 設以十億計的參數量 NN 與每參數詞元數比例 rr,則最佳詞元數與相應的訓練算力為 D=N⋅rC=6⋅N⋅D⋅1018\begin{aligned} D &= N \cdot r \\ C &= 6 \cdot N \cdot D \cdot 10^{18} \end{aligned}DC=N⋅r=6⋅N⋅D⋅1018 其中 DD 為以十億計的最佳訓練詞元數,CC 為以浮點運算計的訓練算力。算力遵循 6 N D6\,N\,D 法則,即每個參數、每個詞元約收六次運算,而 101810^{18} 係數將 NN 與 DD 的十億單位還原為絕對數量。 計算範例 考慮一個 700 億參數的模型,搭配每參數二十個詞元的中央比例: D=70×20=1400 十億詞元=1.4 兆C=6×70×1400×1018=5.88×1023 FLOPs\begin{aligned} D &= 70 \times 20 = 1400\ \text{十億詞元} = 1.4\ \text{兆} \\ C &= 6 \times 70 \times 1400 \times 10^{18} = 5.88 \times 10^{23}\ \text{FLOPs} \end{aligned}DC=70×20=1400 十億詞元=1.4 兆=6×70×1400×1018=5.88×1023 FLOPs 算力最佳的資料集約為 1.4 兆個詞元,以此訓練約耗費 5.88×10235.88 \times 10^{23} 次運算。若提高比例,例如每參數一百個詞元,詞元數與算力都會等比例增加。 適用限制 二十比一的比例在固定訓練預算下最小化訓練損失,但它刻意忽略了部署成品模型的服務成本。將回答大量請求的模型,常以遠多於 Chinchilla 最佳值的詞元訓練,因為在同等品質下,較小的模型訓練得更久反而運行更便宜。確切的最佳比例也會隨資料集、分詞器與架構變動,因此二十是中央估計值而非常數。在固定算力預算下設定模型大小的互補問題,由 算力最佳模型大小計算處理;而給定配置的原始算力則由 訓練 FLOPs 計算計算。 常見問題(FAQ)Chinchilla 擴展律的結論是什麼Chinchilla 的結論由 DeepMind 於 2022 年發表,發現先前的大型模型訓練不足:在固定的算力預算下,唯有模型大小與訓練詞元同步擴展,準確度才會提升最多,而非將預算大多花在參數上。 該研究在數百次訓練上擬合擴展律,得出算力最佳的配置是每個參數搭配約二十個訓練詞元,與先前以遠低比例訓練的模型形成明顯對比。 為何約為每參數二十個詞元此比例由對訓練資料擬合的擴展律推導而來。在固定的算力預算下,當增加參數的邊際效益等於增加詞元的邊際效益時,損失最小,而 Chinchilla 研究中的經驗指數將此平衡點定在約每參數二十個詞元。確切數值取決於資料集與架構,因此二十是一個概略的中央估計值,而非精確常數。 每參數二十個詞元仍是合適的目標嗎二十是在固定訓練預算下最小化訓練損失的算力最佳比例,但它忽略了推論成本。將服務大量請求的模型,往往以遠高於 Chinchilla 最佳值的詞元數訓練,因為較小的模型訓練得更久,即使其訓練並非算力最佳,運行時仍更便宜。 基於此理由,數個廣為使用的模型以一百以上的比例訓練,因此二十應視為基準而非上限。 免責聲明 每參數二十個詞元的比例是 Chinchilla 擴展律的中央估計值,會隨資料集與架構而變動。它僅就訓練算力進行最佳化,未計入推論成本,而推論成本往往使得以遠多詞元訓練較小模型更為划算。請將結果視為起點,而非固定規則。