首頁 ai 模型 FLOP 使用率計算機 產生日期: 2026年7月20日 下午09:34 模型 FLOP 使用率計算機 輸入 工作負載推論(每標記 2N)參數量70標記吞吐量2,000峰值吞吐量989 AI & LLM 模型 FLOP 使用率計算機 計算模型 FLOP 使用率(MFU):從參數量、標記吞吐量與峰值 TFLOP/s,得出一次模型執行實際達到的浮點運算吞吐量占加速器峰值的比例。 輸入 工作負載 工作負載 推論 每標記 2N 計算僅前向傳遞,或一個完整的訓練步驟。推論時每個標記每個參數約耗費兩次浮點運算,訓練時則為六次(前向加反向)。 參數量 模型參數量,單位為十億。與工作負載係數一同用來估算處理每個標記所執行的浮點運算數。 標記吞吐量 硬體上端到端量測的每秒處理標記數。對訓練而言,這是計入下方峰值數字的所有加速器上的全域每秒標記數。 硬體 峰值吞吐量 在模型執行精度下宣稱的峰值浮點運算吞吐量,單位為 TFLOP/s,並對所有參與的加速器加總——例如每張 H100 約 989 TFLOP/s 的密集 16 位元運算。 結果 輸入數值即可顯示計算結果。 模型 FLOP 使用率 % 實際達到的浮點運算速率占峰值的比例:989 TFLOP/s 中的 ... TFLOP/s 即為 ...。數值越高表示硬體的運算能力被運用得越充分。 詳細資料 實際達到吞吐量 估算該次執行持續維持的浮點運算速率——工作負載係數乘以 70 十億參數再乘以每秒 2,000 個標記,約 ... TFLOP/s。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 模型 FLOP 使用率 模型 FLOP 使用率,即 MFU,衡量一次模型執行實際用到加速器理論運算能力的多少。兩個使用相同硬體的叢集,實際產出可能相差數倍,而 MFU 正是捕捉這道落差的單一數字:它將工作負載真正執行的浮點運算數,除以硬體宣稱的峰值。本計算機從參數量、標記吞吐量與加速器的峰值 TFLOP/s 來估算它。 MFU 告訴我們什麼 硬體廠商會標示一個峰值速率——以當前的資料中心加速器而言,約為每秒一千個 16 位元 TFLOP/s——這個數字假設資料已在暫存器中、可連續完美執行融合乘加運算。沒有任何實際工作負載能持續維持這個速率。MFU 回報實際達到的比例,因此 40% 的 MFU 表示該次執行從理論峰值的每一塊錢中榨取出四毛錢的運算。它是判斷訓練或推論設定是否經過良好最佳化、以及判斷某項更動是否真正帶來幫助的標準量尺。 公式 一次前向傳遞每個參數每個標記約耗費兩次浮點運算;一個訓練步驟多了反向傳遞,總計約六次。以工作負載係數 kk(推論為二,訓練為六)、以十億為單位的參數量 NN,以及以每秒標記數為單位的吞吐量 vv,實際達到的速率與使用率為 A=k⋅N⋅v1000U=AP\begin{aligned} A &= \frac{k \cdot N \cdot v}{1000} \\ U &= \frac{A}{P} \end{aligned}AU=1000k⋅N⋅v=PA 其中 AA 為實際達到的 TFLOP/s,PP 為該次執行所有加速器加總的峰值 TFLOP/s,UU 為使用率。除以 1000 是將十億參數乘以每秒標記數換算為 TFLOP/s。 計算範例 以一個 700 億參數的模型為例,在單張額定 989 TFLOP/s 密集 16 位元運算的加速器上,以每秒 2,000 個標記提供推論: A=2×70×20001000=280 TFLOP/sU=280989≈0.283=28.3%\begin{aligned} A &= \frac{2 \times 70 \times 2000}{1000} = 280\ \text{TFLOP/s} \\ U &= \frac{280}{989} \approx 0.283 = 28.3\% \end{aligned}AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3% 該次執行用到晶片峰值略多於四分之一——對受記憶體頻寬限制的解碼而言相當典型,因為大部分時間花在讀取權重而非乘法運算。一個調校良好、較受運算限制的大型模型訓練工作,則較常落在 35% 至 55% 之間。 為何永遠到不了 100% 實際執行會在記憶體傳輸、加速器之間的通訊、管線氣泡,以及注意力與正規化等非純矩陣乘法的層上流失時間。完美的使用率將意味著這些額外開銷都不存在。MFU 的實務用途是比較性的:在同一工作負載與硬體上,於某項最佳化前後量測,數值越高表示所支付的運算能力中有更多在做有用的工作。驅動此估算的每標記運算數,在每標記 FLOP 計算機中有更深入的探討;同一硬體在記憶體頻寬一側的情況,則見推論吞吐量計算器。 常見問題(FAQ)怎樣才算良好的 MFU?對大型模型的訓練而言,調校良好的系統通常回報的模型 FLOP 使用率約落在 35% 至 55% 之間;推廣此指標的 PaLM 研究回報約 46%。推論時的使用率通常較低,因為在受記憶體頻寬限制的解碼過程中,加速器大部分時間花在讀取權重而非運算。並沒有一個通用的目標值——有用的比較是在同一硬體上對同一工作負載做最佳化前後相比,數值越高表示所支付的運算能力中有更多在做有用的工作。 為什麼訓練是每個參數六次 FLOP,而推論是兩次?一次前向傳遞在主導性的矩陣乘法中,每個參數每個標記約執行兩次浮點運算——一次乘法與一次加法。訓練多了計算梯度的反向傳遞,需對活化值與權重兩者求梯度,成本約為前向傳遞的兩倍,因此總計每個參數每個標記約六次運算。這些是標準的一階估算,忽略了對大型模型而言相對較小的注意力與其他項。 為什麼使用率無法達到 100%?峰值吞吐量是一個理論數字,假設資料已在暫存器中、可連續執行融合乘加運算。實際執行會在記憶體傳輸、加速器之間的通訊、管線氣泡,以及注意力與正規化等非純矩陣乘法的層上流失時間,還有無法完美填滿運算單元的核心。使用率接近一將意味著這些額外開銷都不存在,而這在實務上從未發生。 免責聲明 MFU 採用一階 FLOP 估算(推論 2N、訓練 6N),略去注意力與其他次要項,並假設峰值數字與執行精度及加速器數量相符。請將其視為比較性的效率指標,而非每一次運算的精確計算。 推薦的下一個 每標記 FLOP 計算機 依據前向 2N 與訓練 6N 法則,從模型以十億為單位的參數量,估算 Transformer 處理每個標記所執行的浮點運算數。 深入了解推論吞吐量計算器 依據模型大小、權重精度與加速器記憶體頻寬,估算大型語言模型解碼速度的記憶體頻寬上限——單一串流每秒可產生標記數的屋頂線。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機模型 FLOP 使用率計算機 +2 more Show less 推論吞吐量計算器推論延遲計算器 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 模型 FLOP 使用率 模型 FLOP 使用率,即 MFU,衡量一次模型執行實際用到加速器理論運算能力的多少。兩個使用相同硬體的叢集,實際產出可能相差數倍,而 MFU 正是捕捉這道落差的單一數字:它將工作負載真正執行的浮點運算數,除以硬體宣稱的峰值。本計算機從參數量、標記吞吐量與加速器的峰值 TFLOP/s 來估算它。 MFU 告訴我們什麼 硬體廠商會標示一個峰值速率——以當前的資料中心加速器而言,約為每秒一千個 16 位元 TFLOP/s——這個數字假設資料已在暫存器中、可連續完美執行融合乘加運算。沒有任何實際工作負載能持續維持這個速率。MFU 回報實際達到的比例,因此 40% 的 MFU 表示該次執行從理論峰值的每一塊錢中榨取出四毛錢的運算。它是判斷訓練或推論設定是否經過良好最佳化、以及判斷某項更動是否真正帶來幫助的標準量尺。 公式 一次前向傳遞每個參數每個標記約耗費兩次浮點運算;一個訓練步驟多了反向傳遞,總計約六次。以工作負載係數 kk(推論為二,訓練為六)、以十億為單位的參數量 NN,以及以每秒標記數為單位的吞吐量 vv,實際達到的速率與使用率為 A=k⋅N⋅v1000U=AP\begin{aligned} A &= \frac{k \cdot N \cdot v}{1000} \\ U &= \frac{A}{P} \end{aligned}AU=1000k⋅N⋅v=PA 其中 AA 為實際達到的 TFLOP/s,PP 為該次執行所有加速器加總的峰值 TFLOP/s,UU 為使用率。除以 1000 是將十億參數乘以每秒標記數換算為 TFLOP/s。 計算範例 以一個 700 億參數的模型為例,在單張額定 989 TFLOP/s 密集 16 位元運算的加速器上,以每秒 2,000 個標記提供推論: A=2×70×20001000=280 TFLOP/sU=280989≈0.283=28.3%\begin{aligned} A &= \frac{2 \times 70 \times 2000}{1000} = 280\ \text{TFLOP/s} \\ U &= \frac{280}{989} \approx 0.283 = 28.3\% \end{aligned}AU=10002×70×2000=280 TFLOP/s=989280≈0.283=28.3% 該次執行用到晶片峰值略多於四分之一——對受記憶體頻寬限制的解碼而言相當典型,因為大部分時間花在讀取權重而非乘法運算。一個調校良好、較受運算限制的大型模型訓練工作,則較常落在 35% 至 55% 之間。 為何永遠到不了 100% 實際執行會在記憶體傳輸、加速器之間的通訊、管線氣泡,以及注意力與正規化等非純矩陣乘法的層上流失時間。完美的使用率將意味著這些額外開銷都不存在。MFU 的實務用途是比較性的:在同一工作負載與硬體上,於某項最佳化前後量測,數值越高表示所支付的運算能力中有更多在做有用的工作。驅動此估算的每標記運算數,在每標記 FLOP 計算機中有更深入的探討;同一硬體在記憶體頻寬一側的情況,則見推論吞吐量計算器。 常見問題(FAQ)怎樣才算良好的 MFU?對大型模型的訓練而言,調校良好的系統通常回報的模型 FLOP 使用率約落在 35% 至 55% 之間;推廣此指標的 PaLM 研究回報約 46%。推論時的使用率通常較低,因為在受記憶體頻寬限制的解碼過程中,加速器大部分時間花在讀取權重而非運算。並沒有一個通用的目標值——有用的比較是在同一硬體上對同一工作負載做最佳化前後相比,數值越高表示所支付的運算能力中有更多在做有用的工作。 為什麼訓練是每個參數六次 FLOP,而推論是兩次?一次前向傳遞在主導性的矩陣乘法中,每個參數每個標記約執行兩次浮點運算——一次乘法與一次加法。訓練多了計算梯度的反向傳遞,需對活化值與權重兩者求梯度,成本約為前向傳遞的兩倍,因此總計每個參數每個標記約六次運算。這些是標準的一階估算,忽略了對大型模型而言相對較小的注意力與其他項。 為什麼使用率無法達到 100%?峰值吞吐量是一個理論數字,假設資料已在暫存器中、可連續執行融合乘加運算。實際執行會在記憶體傳輸、加速器之間的通訊、管線氣泡,以及注意力與正規化等非純矩陣乘法的層上流失時間,還有無法完美填滿運算單元的核心。使用率接近一將意味著這些額外開銷都不存在,而這在實務上從未發生。 免責聲明 MFU 採用一階 FLOP 估算(推論 2N、訓練 6N),略去注意力與其他次要項,並假設峰值數字與執行精度及加速器數量相符。請將其視為比較性的效率指標,而非每一次運算的精確計算。