首頁 ai 每標記 FLOP 計算機 產生日期: 2026年7月20日 下午09:34 每標記 FLOP 計算機 輸入 傳遞類型前向傳遞(2N)參數量70 AI & LLM 每標記 FLOP 計算機 依據前向 2N 與訓練 6N 法則,從模型以十億為單位的參數量,估算 Transformer 處理每個標記所執行的浮點運算數。 輸入 模型 傳遞類型 前向傳遞 2N 推論用的前向傳遞,計為每個參數兩次運算;或完整的訓練步驟,每個參數六次。訓練的數字包含計算梯度的反向傳遞。 參數量 模型總參數量,單位為十億。估算值與此數量呈線性比例,因此大小加倍的模型,每個標記的運算成本也加倍。 結果 輸入數值即可顯示計算結果。 每標記 GFLOP 每個標記的浮點運算數,單位為十億:傳遞係數乘以 70 十億參數,約 ... GFLOP。是比較模型時方便的大小單位。 詳細資料 每標記 FLOP 以原始浮點運算數寫出的相同數字(...)。乘以所處理的標記數,即可估算一次執行的總運算量。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 每標記 FLOP 語言模型在單一標記上花費多少運算?這個答案是這個領域中幾乎所有粗略估算的基礎——訓練預算、推論成本與硬體使用率都從它開始。標準的捷徑非常簡單:一個密集的 Transformer 處理一個標記,每個參數約執行兩次浮點運算,訓練時約六次。本計算機將這些法則套用到模型的參數量上。 2N 法則 Transformer 的運算由大型矩陣乘法主導,在其中每個權重每個標記被觸及一次。一次乘加運算計為兩次浮點運算——一次乘法與一次加法——因此將一個標記推過具有 NN 個參數的模型,在前向傳遞約耗費每個參數兩次運算,即 2N 法則。這是 Kaplan 縮放定律研究提出的估算,已成為推理模型運算量的通用單位。它刻意忽略所有並非帶參數矩陣乘法的部分,這對大型模型而言是良好的近似。 前向與訓練成本 訓練模型還需要一次反向傳遞來計算梯度。反向傳遞會對活化值與權重兩者產生梯度,各約為前向傳遞的成本,因此大致使前向工作加倍。總計約為三次前向傳遞,即每個參數每個標記六次運算(6N 估算): G=k⋅N(GFLOPs, N in billions)F=k⋅N×109\begin{aligned} G &= k \cdot N \quad (\text{GFLOPs, } N \text{ in billions}) \\ F &= k \cdot N \times 10^{9} \end{aligned}GF=k⋅N(GFLOPs, N in billions)=k⋅N×109 其中係數 kk 在前向傳遞為二,在訓練步驟為六。由於 NN 以十億為單位輸入,前向的數字會直接落在 GFLOP。 計算範例 以一個 700 億參數的模型做前向傳遞為例: G=2×70=140 GFLOPsF=2×70×109=1.4×1011 FLOPs\begin{aligned} G &= 2 \times 70 = 140\ \text{GFLOPs} \\ F &= 2 \times 70 \times 10^{9} = 1.4\times 10^{11}\ \text{FLOPs} \end{aligned}GF=2×70=140 GFLOPs=2×70×109=1.4×1011 FLOPs 每個產生的標記約耗費 140 GFLOP。乘以模型的總吞吐量可得實際達到的運算速率,再除以加速器的峰值便得到其使用率。訓練同一個模型,每個標記則需 6×70=4206 \times 70 = 420 GFLOP;將訓練成本乘以資料集中的總標記數,是估算一次訓練執行運算預算的常用方法。 它略去了什麼 此法則只計入帶參數的矩陣乘法。注意力機制會增加一個獨立的項,隨序列長度增長且不取決於參數量;對中等情境長度下的典型模型而言它很小,但在極長情境下可能變得相當顯著。嵌入與正規化層同樣被略去。基於這些原因,此數值是用於縮放與預算的估算,而非精確的指令數。若想了解實際達到的運算量占硬體峰值的比例,請繼續閱讀模型 FLOP 使用率計算機。 常見問題(FAQ)2N 估算從何而來?Transformer 的運算由矩陣乘法主導,其中每個權重每個標記被使用一次。一次乘加運算為兩次浮點運算——一次乘法與一次加法——因此將單一標記通過 N 個參數約耗費 2N 次運算,發生在前向傳遞。這是 Kaplan 縮放定律研究提出、並在整個領域中沿用的經驗法則。它是一種近似:只計入大型矩陣乘法,並將其餘一切視為可忽略,這對大型模型成立得相當好。 為什麼訓練的成本是三倍?訓練先執行前向傳遞,接著執行反向傳遞以計算梯度。反向傳遞需對活化值與權重兩者計算梯度,各約為前向傳遞的成本,因此反向傳遞約為前向的兩倍,總計約為三倍——每個參數每個標記六次運算。將 6N 乘以資料集中的總標記數,是估算一次訓練執行運算預算的常用方法。 這有包含注意力嗎?沒有。2N 與 6N 法則只計入帶參數的矩陣乘法。注意力機制會增加一個隨序列長度增長、且與參數量無關的項。對中等情境長度下的典型大型模型而言,該項相對於矩陣乘法很小,因此估算值仍相當接近。在極長的情境長度下,注意力可能成為相當大的比例,此時需要更詳細的模型。 免責聲明 這些是一階估算,計入主導性的矩陣乘法,而略去注意力、正規化與嵌入項。實際運算數取決於架構與情境長度。請將此數值用於縮放比較與預算估算,而非精確的硬體計算。 推薦的下一個 模型 FLOP 使用率計算機 計算模型 FLOP 使用率(MFU):從參數量、標記吞吐量與峰值 TFLOP/s,得出一次模型執行實際達到的浮點運算吞吐量占加速器峰值的比例。 深入了解推論吞吐量計算器 依據模型大小、權重精度與加速器記憶體頻寬,估算大型語言模型解碼速度的記憶體頻寬上限——單一串流每秒可產生標記數的屋頂線。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器 +2 more Show less 推論延遲計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 每標記 FLOP 語言模型在單一標記上花費多少運算?這個答案是這個領域中幾乎所有粗略估算的基礎——訓練預算、推論成本與硬體使用率都從它開始。標準的捷徑非常簡單:一個密集的 Transformer 處理一個標記,每個參數約執行兩次浮點運算,訓練時約六次。本計算機將這些法則套用到模型的參數量上。 2N 法則 Transformer 的運算由大型矩陣乘法主導,在其中每個權重每個標記被觸及一次。一次乘加運算計為兩次浮點運算——一次乘法與一次加法——因此將一個標記推過具有 NN 個參數的模型,在前向傳遞約耗費每個參數兩次運算,即 2N 法則。這是 Kaplan 縮放定律研究提出的估算,已成為推理模型運算量的通用單位。它刻意忽略所有並非帶參數矩陣乘法的部分,這對大型模型而言是良好的近似。 前向與訓練成本 訓練模型還需要一次反向傳遞來計算梯度。反向傳遞會對活化值與權重兩者產生梯度,各約為前向傳遞的成本,因此大致使前向工作加倍。總計約為三次前向傳遞,即每個參數每個標記六次運算(6N 估算): G=k⋅N(GFLOPs, N in billions)F=k⋅N×109\begin{aligned} G &= k \cdot N \quad (\text{GFLOPs, } N \text{ in billions}) \\ F &= k \cdot N \times 10^{9} \end{aligned}GF=k⋅N(GFLOPs, N in billions)=k⋅N×109 其中係數 kk 在前向傳遞為二,在訓練步驟為六。由於 NN 以十億為單位輸入,前向的數字會直接落在 GFLOP。 計算範例 以一個 700 億參數的模型做前向傳遞為例: G=2×70=140 GFLOPsF=2×70×109=1.4×1011 FLOPs\begin{aligned} G &= 2 \times 70 = 140\ \text{GFLOPs} \\ F &= 2 \times 70 \times 10^{9} = 1.4\times 10^{11}\ \text{FLOPs} \end{aligned}GF=2×70=140 GFLOPs=2×70×109=1.4×1011 FLOPs 每個產生的標記約耗費 140 GFLOP。乘以模型的總吞吐量可得實際達到的運算速率,再除以加速器的峰值便得到其使用率。訓練同一個模型,每個標記則需 6×70=4206 \times 70 = 420 GFLOP;將訓練成本乘以資料集中的總標記數,是估算一次訓練執行運算預算的常用方法。 它略去了什麼 此法則只計入帶參數的矩陣乘法。注意力機制會增加一個獨立的項,隨序列長度增長且不取決於參數量;對中等情境長度下的典型模型而言它很小,但在極長情境下可能變得相當顯著。嵌入與正規化層同樣被略去。基於這些原因,此數值是用於縮放與預算的估算,而非精確的指令數。若想了解實際達到的運算量占硬體峰值的比例,請繼續閱讀模型 FLOP 使用率計算機。 常見問題(FAQ)2N 估算從何而來?Transformer 的運算由矩陣乘法主導,其中每個權重每個標記被使用一次。一次乘加運算為兩次浮點運算——一次乘法與一次加法——因此將單一標記通過 N 個參數約耗費 2N 次運算,發生在前向傳遞。這是 Kaplan 縮放定律研究提出、並在整個領域中沿用的經驗法則。它是一種近似:只計入大型矩陣乘法,並將其餘一切視為可忽略,這對大型模型成立得相當好。 為什麼訓練的成本是三倍?訓練先執行前向傳遞,接著執行反向傳遞以計算梯度。反向傳遞需對活化值與權重兩者計算梯度,各約為前向傳遞的成本,因此反向傳遞約為前向的兩倍,總計約為三倍——每個參數每個標記六次運算。將 6N 乘以資料集中的總標記數,是估算一次訓練執行運算預算的常用方法。 這有包含注意力嗎?沒有。2N 與 6N 法則只計入帶參數的矩陣乘法。注意力機制會增加一個隨序列長度增長、且與參數量無關的項。對中等情境長度下的典型大型模型而言,該項相對於矩陣乘法很小,因此估算值仍相當接近。在極長的情境長度下,注意力可能成為相當大的比例,此時需要更詳細的模型。 免責聲明 這些是一階估算,計入主導性的矩陣乘法,而略去注意力、正規化與嵌入項。實際運算數取決於架構與情境長度。請將此數值用於縮放比較與預算估算,而非精確的硬體計算。