首頁 ai 有效每秒標記數計算器 產生日期: 2026年7月20日 下午09:34 有效每秒標記數計算器 輸入 每張加速器尖峰每秒標記數2,500加速器數量8利用率70 % AI & LLM 有效每秒標記數計算器 從每張加速器的尖峰速度、加速器數量與利用率,估算推論叢集可持續的標記吞吐量——也就是符合現實的產能,而非單一串流的尖峰值。 輸入 叢集 每張加速器尖峰每秒標記數 單張加速器在完整批次化下所達到、由基準測試量得的最佳可持續吞吐量。這是該加速器上所有並行請求的彙總輸出,而非單一串流。 加速器數量 ≥ 1 有多少張加速器並行服務該工作負載。當每張各自承擔一份獨立的流量時,吞吐量會隨此數量近乎線性擴增。 利用率 % 1 – 100 % 叢集以其基準尖峰運作的時間比例。真實流量有離峰時段、負載不均與排程空檔,因此可持續的輸出會低於理論總和。 結果 輸入數值即可顯示計算結果。 有效吞吐量 整個叢集可持續的每秒標記數——每張加速器 2,500 乘以 8 張加速器再乘以 70 % 利用率,約為 ...。這是規劃產能時應依據的數字。 詳細資料 每日標記數 叢集以有效速率在一整天內可服務的標記數(...)——即可持續吞吐量乘以一天的 86,400 秒。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 有效每秒標記數 單張加速器的尖峰標記速率,是在其最佳時刻擷取的基準數字。整個部署在一整天裡真正能持續的吞吐量則是另一回事:流量有起有落、加速器部分閒置,且要保留產能以應付尖峰。本計算器從每張加速器的尖峰值、加速器數量與一個利用率因子,估算這個叢集層級的可持續速率——這正是規劃產能時應依據的數字。 尖峰相對於可持續吞吐量 把各個尖峰數字相加很容易高估產能。尖峰假設每張加速器在任何時刻都被完整批次塞滿,而這在真實叢集、真實時間裡從不成立。需求不均、負載平衡並不完美,而且營運者會刻意保留餘裕以吸收激增。利用率因子把這一切折進單一乘數,將樂觀的上限變成一個能向工作負載承諾的數字。 公式 veff=vg⋅G⋅uTd=veff⋅86400\begin{aligned} v_{eff} &= v_g \cdot G \cdot u \\ T_d &= v_{eff} \cdot 86400 \end{aligned}veffTd=vg⋅G⋅u=veff⋅86400 其中 vgv_g 是每張加速器以每秒標記數計的尖峰值,GG 是加速器數量,uu 是利用率比例,veffv_{eff} 是可持續吞吐量,TdT_d 是每日服務的標記數(一天有 86,400 秒)。當每張加速器各自承擔一份獨立的流量時,吞吐量會隨加速器數量近乎線性擴增。 範例 以一組 8 張加速器為例,每張在完整批次化下基準測得每秒 2,500 個標記,在 70% 利用率下運作: veff=2500×8×0.7=14,000 tokens/sTd=14,000×86400≈1.21×109 tokens/day\begin{aligned} v_{eff} &= 2500 \times 8 \times 0.7 = 14{,}000\ \text{tokens/s} \\ T_d &= 14{,}000 \times 86400 \approx 1.21 \times 10^{9}\ \text{tokens/day} \end{aligned}veffTd=2500×8×0.7=14,000 tokens/s=14,000×86400≈1.21×109 tokens/day 這組叢集可持續每秒 14,000 個標記,每天約能服務 12 億個標記。請注意它離天真的尖峰值每秒 20,000 個標記有多遠——因不完美利用率而流失的那 30% 產能,正是更好的批次化與排程所能重新奪回的餘裕。 用於規劃 把每日標記數與預期需求相比較:將需求除以這個產能,即可算出需要多少組這種規模的叢集,再為高於平均的尖峰加上邊際。由於輸出同時隨加速器數量與利用率上升,達成目標的途徑可以是購買更多硬體,或靠提升利用率——後者通常是較便宜的手段。每張加速器的尖峰值本身來自批次化基準測試,批次推論吞吐量計算器 對此有所探討,而在低於完整利用率下運作的成本後果,則由 GPU 利用率成本計算器 涵蓋。 常見問題(FAQ)這與尖峰吞吐量有何不同?尖峰吞吐量是單張加速器在完整批次化、完全飽和那一刻所達到的速度。有效吞吐量則是整個叢集在現實介入後,長時間所能持續的輸出:流量不均勻地到來、有些加速器部分閒置、批次並非總是填滿,而且還要保留產能以應付尖峰。把每張加速器的尖峰乘以加速器數量得到的是理論上限;再乘以利用率,就降到一個真正能承諾的數字。產能規劃應採用有效數字,而非尖峰值。 每張加速器的尖峰值從何而來?最好的方式是在預計採用的批次大小下,針對特定模型於特定硬體做基準測試,因為它取決於模型大小、精度、序列長度與服務堆疊。作為合理性檢查,記憶體頻寬的 roofline 可為單串流解碼提供一個上限,而批次化服務則會將其乘以並行請求數。有基準數字時請採用基準值,roofline 僅作為樂觀的上限參考。 我要如何用它做產能規劃?把有效吞吐量或每日標記數,與預期的需求相比較。若某工作負載每天需要一定數量的標記,將該需求除以每日產能,即可算出需要多少組這種規模的叢集,再為高於平均的尖峰加上餘裕。由於輸出同時隨加速器數量與利用率擴增,達成目標的途徑可以是增添硬體,或靠更好的批次化與排程來提升利用率——後者通常較便宜。 免責聲明 這假設吞吐量隨加速器數量線性擴增,且單一利用率因子即可涵蓋所有現實世界的損耗。網路、負載平衡、不均的序列長度與尾端延遲都可能進一步降低可持續輸出。請在目標硬體上做基準測試,並在平均需求之上保留餘裕。 推薦的下一個 批次推論吞吐量計算器 將實測的批次完成時間換算成總吞吐量、單一請求速度與每秒請求數——批次式大型語言模型服務在吞吐量與延遲之間的取捨。 深入了解GPU 利用率成本計算器 在計入閒置時間後,看清一張保留的加速器的真實成本。輸入每小時價格與利用率,即可得到每有效小時的實際成本,以及花在閒置產能上的金額。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器 +2 more Show less 推論延遲計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 有效每秒標記數 單張加速器的尖峰標記速率,是在其最佳時刻擷取的基準數字。整個部署在一整天裡真正能持續的吞吐量則是另一回事:流量有起有落、加速器部分閒置,且要保留產能以應付尖峰。本計算器從每張加速器的尖峰值、加速器數量與一個利用率因子,估算這個叢集層級的可持續速率——這正是規劃產能時應依據的數字。 尖峰相對於可持續吞吐量 把各個尖峰數字相加很容易高估產能。尖峰假設每張加速器在任何時刻都被完整批次塞滿,而這在真實叢集、真實時間裡從不成立。需求不均、負載平衡並不完美,而且營運者會刻意保留餘裕以吸收激增。利用率因子把這一切折進單一乘數,將樂觀的上限變成一個能向工作負載承諾的數字。 公式 veff=vg⋅G⋅uTd=veff⋅86400\begin{aligned} v_{eff} &= v_g \cdot G \cdot u \\ T_d &= v_{eff} \cdot 86400 \end{aligned}veffTd=vg⋅G⋅u=veff⋅86400 其中 vgv_g 是每張加速器以每秒標記數計的尖峰值,GG 是加速器數量,uu 是利用率比例,veffv_{eff} 是可持續吞吐量,TdT_d 是每日服務的標記數(一天有 86,400 秒)。當每張加速器各自承擔一份獨立的流量時,吞吐量會隨加速器數量近乎線性擴增。 範例 以一組 8 張加速器為例,每張在完整批次化下基準測得每秒 2,500 個標記,在 70% 利用率下運作: veff=2500×8×0.7=14,000 tokens/sTd=14,000×86400≈1.21×109 tokens/day\begin{aligned} v_{eff} &= 2500 \times 8 \times 0.7 = 14{,}000\ \text{tokens/s} \\ T_d &= 14{,}000 \times 86400 \approx 1.21 \times 10^{9}\ \text{tokens/day} \end{aligned}veffTd=2500×8×0.7=14,000 tokens/s=14,000×86400≈1.21×109 tokens/day 這組叢集可持續每秒 14,000 個標記,每天約能服務 12 億個標記。請注意它離天真的尖峰值每秒 20,000 個標記有多遠——因不完美利用率而流失的那 30% 產能,正是更好的批次化與排程所能重新奪回的餘裕。 用於規劃 把每日標記數與預期需求相比較:將需求除以這個產能,即可算出需要多少組這種規模的叢集,再為高於平均的尖峰加上邊際。由於輸出同時隨加速器數量與利用率上升,達成目標的途徑可以是購買更多硬體,或靠提升利用率——後者通常是較便宜的手段。每張加速器的尖峰值本身來自批次化基準測試,批次推論吞吐量計算器 對此有所探討,而在低於完整利用率下運作的成本後果,則由 GPU 利用率成本計算器 涵蓋。 常見問題(FAQ)這與尖峰吞吐量有何不同?尖峰吞吐量是單張加速器在完整批次化、完全飽和那一刻所達到的速度。有效吞吐量則是整個叢集在現實介入後,長時間所能持續的輸出:流量不均勻地到來、有些加速器部分閒置、批次並非總是填滿,而且還要保留產能以應付尖峰。把每張加速器的尖峰乘以加速器數量得到的是理論上限;再乘以利用率,就降到一個真正能承諾的數字。產能規劃應採用有效數字,而非尖峰值。 每張加速器的尖峰值從何而來?最好的方式是在預計採用的批次大小下,針對特定模型於特定硬體做基準測試,因為它取決於模型大小、精度、序列長度與服務堆疊。作為合理性檢查,記憶體頻寬的 roofline 可為單串流解碼提供一個上限,而批次化服務則會將其乘以並行請求數。有基準數字時請採用基準值,roofline 僅作為樂觀的上限參考。 我要如何用它做產能規劃?把有效吞吐量或每日標記數,與預期的需求相比較。若某工作負載每天需要一定數量的標記,將該需求除以每日產能,即可算出需要多少組這種規模的叢集,再為高於平均的尖峰加上餘裕。由於輸出同時隨加速器數量與利用率擴增,達成目標的途徑可以是增添硬體,或靠更好的批次化與排程來提升利用率——後者通常較便宜。 免責聲明 這假設吞吐量隨加速器數量線性擴增,且單一利用率因子即可涵蓋所有現實世界的損耗。網路、負載平衡、不均的序列長度與尾端延遲都可能進一步降低可持續輸出。請在目標硬體上做基準測試,並在平均需求之上保留餘裕。