首頁 ai 推論吞吐量計算器 產生日期: 2026年7月20日 下午09:34 推論吞吐量計算器 輸入 參數量70權重精度16 位元(2 個位元組)記憶體頻寬3,350 AI & LLM 推論吞吐量計算器 依據模型大小、權重精度與加速器記憶體頻寬,估算大型語言模型解碼速度的記憶體頻寬上限——單一串流每秒可產生標記數的屋頂線。 輸入 模型 參數量 模型總參數量,以十億為單位。70 代表 700 億參數的模型。這是參數數量,而非提示詞的標記數。 權重精度 16 位元 2 個位元組 每個參數儲存的位元組數,由量化格式決定:16 位元權重為 2 個位元組,8 位元為 1 個位元組,4 位元為半個位元組。精度越低,模型越小,解碼上限越高。 硬體 記憶體頻寬 加速器的記憶體頻寬,以每秒十億位元組為單位——例如 H100 SXM 約為 3,350 GB/s。解碼時每產生一個標記就要從記憶體讀取一次權重,因此這決定了標記速率的上限。 結果 輸入數值即可顯示計算結果。 吞吐量上限 單一串流解碼速度的上界——3,350 GB/s 除以 ... GB 的模型,約為每秒 ... 個標記。實際服務只能達到其中的一部分。 詳細資料 模型大小 權重所佔用的記憶體:70 十億參數在所選精度下約為 ... GB。每產生一個輸出標記,解碼器都必須串流完整的權重。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 推論吞吐量 推論吞吐量是指語言模型每秒能生成多少個標記。對於單一請求,其上限並非由加速器的原始算術能力決定,而是取決於它從記憶體讀取模型權重的速度。本計算器將模型大小、權重精度與硬體的記憶體頻寬,換算成這個上限——單一解碼串流每秒可產生標記數的屋頂線。 解碼為何受記憶體限制 自迴歸式生成文字,意味著產生一個標記後,再將它回饋以產生下一個。其中每一步都必須讀取模型中的每個權重,才能計算出單一個新標記。當批次大小為一時,加速器每載入一個位元組所執行的算術運算極少,因此幾乎所有時間都花在搬移權重而非乘法運算上。標記速率因此由記憶體頻寬主導。(提示詞預填則相反:它一次處理所有提示詞標記,受運算能力限制。) 公式 先求出權重佔用多少記憶體,再以可用頻寬除以它: M=N×bv=BWM\begin{aligned} M &= N \times b \\ v &= \frac{BW}{M} \end{aligned}Mv=N×b=MBW 此處 NN 是以十億為單位的參數量,bb 是每個參數儲存的位元組數,MM 是以 GB 為單位的模型大小,BWBW 是以每秒 GB 為單位的記憶體頻寬,vv 是以每秒標記數為單位的吞吐量上限。由於十億個位元組約等於一個 GB,以十億為單位輸入參數,會使大小直接落在 GB 上。權重精度 bb 對 16 位元權重為 2 個位元組、8 位元為 1 個位元組、4 位元為半個位元組。 範例計算 以一個 700 億參數、16 位元精度的模型,在記憶體頻寬為 3,350 GB/s 的加速器上服務為例: M=70×2=140 GBv=3350140≈23.9 tokens/s\begin{aligned} M &= 70 \times 2 = 140\ \text{GB} \\ v &= \frac{3350}{140} \approx 23.9\ \text{tokens/s} \end{aligned}Mv=70×2=140 GB=1403350≈23.9 tokens/s 因此單一串流的上限接近每秒 24 個標記。將同一模型量化為 4 位元,會將其縮小至 35 GB,並把上限提高到約每秒 96 個標記——這四倍的提升正對應於每個標記讀取位元組數的四倍減少。 解讀結果 這個數值是上界,而非承諾。它僅計入串流權重的流量;鍵值快取、注意力運算與核心開銷都會侵蝕它,因此實際的單一串流通常只能達到屋頂線的二分之一到四分之三之間。在批次中服務多個請求,整組只讀取一次權重,會將總吞吐量推升至遠高於單一串流數值——請參閱批次推論吞吐量計算器。若要將標記速率換算成使用者可見的等待時間,請搭配推論延遲計算器;若要衡量硬體運算能力的利用程度,請參閱模型 FLOP 使用率計算機。 常見問題(FAQ)為何解碼受限於記憶體頻寬,而非運算能力?在自迴歸解碼過程中,模型一次產生一個標記,而每一步都必須從記憶體讀取每個權重以計算下一個標記。當批次大小為一時,每讀取一個位元組所對應的算術運算極少,因此加速器大部分時間都在搬移權重,而非進行乘法運算。標記速率因此由記憶體讀取速度決定,而非浮點運算的峰值吞吐量。預填則相反——它一次處理整段提示詞,受運算能力限制。 伺服器真的能達到這個數值嗎?不會。這個數值是乾淨的上界,假設唯一的記憶體流量就是權重。實務上,鍵值快取、注意力運算、核心啟動開銷以及不完美的記憶體使用率都會折損它,因此單一串流通常只能達到屋頂線的二分之一到四分之三之間。將多個請求合併批次處理,由於整批只讀取一次權重,可使總吞吐量遠高於單一串流上限。 量化能提升多少吞吐量?吞吐量與模型大小成反比,因此將每個參數的位元組數減半,大約會使上限翻倍。將 16 位元權重轉為 8 位元可使每個標記讀取的位元組數減半,4 位元再減半一次。量化可能降低輸出品質,因此速度的提升需與該任務上準確度的下降相互權衡。 免責聲明 這是僅計入權重記憶體流量並假設單一串流解碼的一階屋頂線。實際吞吐量取決於服務堆疊、批次大小、序列長度與鍵值快取,通常只是上限的一部分。在決定容量規劃之前,請先在目標硬體上進行基準測試。 推薦的下一個 推論延遲計算器 依據首個標記產生時間、每個輸出標記的間隔時間以及輸出標記數量,估算串流式大型語言模型補全的端對端回應時間。 深入了解模型 FLOP 使用率計算機 計算模型 FLOP 使用率(MFU):從參數量、標記吞吐量與峰值 TFLOP/s,得出一次模型執行實際達到的浮點運算吞吐量占加速器峰值的比例。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器 +2 more Show less 推論延遲計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 推論吞吐量 推論吞吐量是指語言模型每秒能生成多少個標記。對於單一請求,其上限並非由加速器的原始算術能力決定,而是取決於它從記憶體讀取模型權重的速度。本計算器將模型大小、權重精度與硬體的記憶體頻寬,換算成這個上限——單一解碼串流每秒可產生標記數的屋頂線。 解碼為何受記憶體限制 自迴歸式生成文字,意味著產生一個標記後,再將它回饋以產生下一個。其中每一步都必須讀取模型中的每個權重,才能計算出單一個新標記。當批次大小為一時,加速器每載入一個位元組所執行的算術運算極少,因此幾乎所有時間都花在搬移權重而非乘法運算上。標記速率因此由記憶體頻寬主導。(提示詞預填則相反:它一次處理所有提示詞標記,受運算能力限制。) 公式 先求出權重佔用多少記憶體,再以可用頻寬除以它: M=N×bv=BWM\begin{aligned} M &= N \times b \\ v &= \frac{BW}{M} \end{aligned}Mv=N×b=MBW 此處 NN 是以十億為單位的參數量,bb 是每個參數儲存的位元組數,MM 是以 GB 為單位的模型大小,BWBW 是以每秒 GB 為單位的記憶體頻寬,vv 是以每秒標記數為單位的吞吐量上限。由於十億個位元組約等於一個 GB,以十億為單位輸入參數,會使大小直接落在 GB 上。權重精度 bb 對 16 位元權重為 2 個位元組、8 位元為 1 個位元組、4 位元為半個位元組。 範例計算 以一個 700 億參數、16 位元精度的模型,在記憶體頻寬為 3,350 GB/s 的加速器上服務為例: M=70×2=140 GBv=3350140≈23.9 tokens/s\begin{aligned} M &= 70 \times 2 = 140\ \text{GB} \\ v &= \frac{3350}{140} \approx 23.9\ \text{tokens/s} \end{aligned}Mv=70×2=140 GB=1403350≈23.9 tokens/s 因此單一串流的上限接近每秒 24 個標記。將同一模型量化為 4 位元,會將其縮小至 35 GB,並把上限提高到約每秒 96 個標記——這四倍的提升正對應於每個標記讀取位元組數的四倍減少。 解讀結果 這個數值是上界,而非承諾。它僅計入串流權重的流量;鍵值快取、注意力運算與核心開銷都會侵蝕它,因此實際的單一串流通常只能達到屋頂線的二分之一到四分之三之間。在批次中服務多個請求,整組只讀取一次權重,會將總吞吐量推升至遠高於單一串流數值——請參閱批次推論吞吐量計算器。若要將標記速率換算成使用者可見的等待時間,請搭配推論延遲計算器;若要衡量硬體運算能力的利用程度,請參閱模型 FLOP 使用率計算機。 常見問題(FAQ)為何解碼受限於記憶體頻寬,而非運算能力?在自迴歸解碼過程中,模型一次產生一個標記,而每一步都必須從記憶體讀取每個權重以計算下一個標記。當批次大小為一時,每讀取一個位元組所對應的算術運算極少,因此加速器大部分時間都在搬移權重,而非進行乘法運算。標記速率因此由記憶體讀取速度決定,而非浮點運算的峰值吞吐量。預填則相反——它一次處理整段提示詞,受運算能力限制。 伺服器真的能達到這個數值嗎?不會。這個數值是乾淨的上界,假設唯一的記憶體流量就是權重。實務上,鍵值快取、注意力運算、核心啟動開銷以及不完美的記憶體使用率都會折損它,因此單一串流通常只能達到屋頂線的二分之一到四分之三之間。將多個請求合併批次處理,由於整批只讀取一次權重,可使總吞吐量遠高於單一串流上限。 量化能提升多少吞吐量?吞吐量與模型大小成反比,因此將每個參數的位元組數減半,大約會使上限翻倍。將 16 位元權重轉為 8 位元可使每個標記讀取的位元組數減半,4 位元再減半一次。量化可能降低輸出品質,因此速度的提升需與該任務上準確度的下降相互權衡。 免責聲明 這是僅計入權重記憶體流量並假設單一串流解碼的一階屋頂線。實際吞吐量取決於服務堆疊、批次大小、序列長度與鍵值快取,通常只是上限的一部分。在決定容量規劃之前,請先在目標硬體上進行基準測試。