首頁 ai 推論延遲計算器 產生日期: 2026年7月20日 下午09:34 推論延遲計算器 輸入 首個標記產生時間200 ms每個輸出標記的間隔時間20 ms輸出標記數500 AI & LLM 推論延遲計算器 依據首個標記產生時間、每個輸出標記的間隔時間以及輸出標記數量,估算串流式大型語言模型補全的端對端回應時間。 輸入 服務設定 首個標記產生時間 ms 使用者在看到第一個標記之前需要等待的時間。它涵蓋提示詞處理(預填)以及解碼第一個標記的過程,通常以毫秒為單位回報。 每個輸出標記的間隔時間 ms 生成過程中,相鄰兩個串流標記之間的間隔,也稱為標記間延遲。其倒數即為穩態下每秒可產生的標記數。 輸出標記數 ≥ 1 模型在回應中生成的標記數量。回答越長,每多一個標記就多一段標記間延遲,因此延遲大致隨此數量線性成長。 結果 輸入數值即可顯示計算結果。 總回應時間 秒 完成一段 500 個標記回答的端對端時間:200 ms 的首字延遲,加上第一個標記之後每個標記各一段標記間延遲(...)。 詳細資料 整體吞吐量 輸出標記數除以總回應時間(每秒 ... 個標記)。由於固定的首字延遲被分攤到整段回答中,這個數值會略低於純生成速度。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 推論延遲 推論延遲是使用者等待語言模型回答所花的時間。對於串流式補全,它由兩個明顯不同的部分組成:任何文字出現前的初始停頓,以及之後標記穩定流出的節奏。本計算器結合這兩者與回答長度,估算端對端的回應時間,以及單一請求實際感受到的吞吐量。 首個標記產生時間與每個輸出標記的間隔時間 兩項量測描述了一個串流端點。首個標記產生時間(tttftt_{ttft})是從送出請求到看見第一個標記的延遲。它涵蓋讀取提示詞、為每個提示詞標記建立注意力快取(運算受限的預填階段),以及解碼一個標記。提示詞越長,此時間越久。每個輸出標記的間隔時間(ttpott_{tpot}),也稱為標記間延遲,是解碼階段每個後續標記之間的間隔。解碼受記憶體頻寬限制:每個新標記都要將完整的模型權重讀取一次,因此這個數值大致維持固定,其倒數即為穩態下每秒生成的標記數。 公式 第一個標記已包含在首個標記產生時間之中,因此其餘每個標記各增加一段標記間間隔: T=tttft+(Nout−1) ttpotv=NoutT\begin{aligned} T &= t_{ttft} + (N_{out} - 1)\, t_{tpot} \\ v &= \frac{N_{out}}{T} \end{aligned}Tv=tttft+(Nout−1)ttpot=TNout 其中 NoutN_{out} 是輸出標記數,TT 是總回應時間,vv 是整體吞吐量。減一項使計數保持精確;對於較長的回答,它幾乎不改變結果。 範例計算 假設某端點回報首個標記產生時間為 200 ms、每個輸出標記的間隔時間為 20 ms(即穩態生成速度為每秒 50 個標記),而模型產生一段 500 個標記的回答: T=0.2+(500−1)×0.02=0.2+9.98=10.18 sv=50010.18≈49.1 tokens/s\begin{aligned} T &= 0.2 + (500 - 1)\times 0.02 \\ &= 0.2 + 9.98 = 10.18\ \text{s} \\ v &= \frac{500}{10.18} \approx 49.1\ \text{tokens/s} \end{aligned}Tv=0.2+(500−1)×0.02=0.2+9.98=10.18 s=10.18500≈49.1 tokens/s 這段回答約需十秒,整體吞吐量每秒 49.1 個標記略低於純生成的每秒 50 個標記,因為固定的首字延遲被分攤到整段回應中。兩者的差距在回答較長時縮小,在回答較短時擴大,此時啟動停頓佔據主導地位。 降低延遲 首個標記產生時間會因縮短提示詞、提示詞快取與更快的預填硬體而下降。每個輸出標記的間隔時間會因更高的記憶體頻寬、量化,以及如推測解碼這類每次模型運算輸出超過一個標記的技術而下降。由於總時間隨著每個生成的標記增加,限制最大輸出長度通常是互動式應用最直接的調整手段。若要探討草稿模型的接受率如何改變每個標記的數值,請參閱推測解碼加速計算機;若要模擬機群層級的容量,請參閱有效每秒標記數計算器。 常見問題(FAQ)首個標記產生時間與每個輸出標記的間隔時間有何差異?首個標記產生時間(TTFT)衡量最初的等待:模型讀取整段提示詞、填滿注意力快取,並輸出第一個標記。每個輸出標記的間隔時間(TPOT),即標記間延遲,衡量之後穩定的節奏,此時每個新標記只需一個解碼步驟。TTFT 隨提示詞長度增加,並由運算密集的預填階段主導;TPOT 則由解碼階段的記憶體頻寬決定,每個標記大致維持固定。 公式為何乘以輸出標記數減一?第一個標記已計入首個標記產生時間之中,因此只有其餘標記會增加標記間延遲。一段 500 個標記的回答,會在第一個標記之後增加 499 段標記間間隔。對於較長的回答,乘以標記數與乘以標記數減一的差異很小,但減一的形式才是精確的。 如何降低服務延遲?首個標記產生時間可藉由縮短提示詞、提示詞快取以及更快的預填硬體來降低;每個輸出標記的間隔時間可藉由提高記憶體頻寬、量化或推測解碼來降低。限制最大輸出長度通常是最簡單的調整方式,因為總時間會隨著每個生成的標記而增加。 免責聲明 結果假設為單一不中斷的串流,且每個標記的延遲固定不變。實際服務系統會因批次處理、排隊、網路傳輸與負載而變動,因此此數值應視為規劃用的估算,而非服務水準保證。 推薦的下一個 有效每秒標記數計算器 從每張加速器的尖峰速度、加速器數量與利用率,估算推論叢集可持續的標記吞吐量——也就是符合現實的產能,而非單一串流的尖峰值。 深入了解批次推論吞吐量計算器 將實測的批次完成時間換算成總吞吐量、單一請求速度與每秒請求數——批次式大型語言模型服務在吞吐量與延遲之間的取捨。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論延遲計算器 +2 more Show less 推論吞吐量計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 推論延遲 推論延遲是使用者等待語言模型回答所花的時間。對於串流式補全,它由兩個明顯不同的部分組成:任何文字出現前的初始停頓,以及之後標記穩定流出的節奏。本計算器結合這兩者與回答長度,估算端對端的回應時間,以及單一請求實際感受到的吞吐量。 首個標記產生時間與每個輸出標記的間隔時間 兩項量測描述了一個串流端點。首個標記產生時間(tttftt_{ttft})是從送出請求到看見第一個標記的延遲。它涵蓋讀取提示詞、為每個提示詞標記建立注意力快取(運算受限的預填階段),以及解碼一個標記。提示詞越長,此時間越久。每個輸出標記的間隔時間(ttpott_{tpot}),也稱為標記間延遲,是解碼階段每個後續標記之間的間隔。解碼受記憶體頻寬限制:每個新標記都要將完整的模型權重讀取一次,因此這個數值大致維持固定,其倒數即為穩態下每秒生成的標記數。 公式 第一個標記已包含在首個標記產生時間之中,因此其餘每個標記各增加一段標記間間隔: T=tttft+(Nout−1) ttpotv=NoutT\begin{aligned} T &= t_{ttft} + (N_{out} - 1)\, t_{tpot} \\ v &= \frac{N_{out}}{T} \end{aligned}Tv=tttft+(Nout−1)ttpot=TNout 其中 NoutN_{out} 是輸出標記數,TT 是總回應時間,vv 是整體吞吐量。減一項使計數保持精確;對於較長的回答,它幾乎不改變結果。 範例計算 假設某端點回報首個標記產生時間為 200 ms、每個輸出標記的間隔時間為 20 ms(即穩態生成速度為每秒 50 個標記),而模型產生一段 500 個標記的回答: T=0.2+(500−1)×0.02=0.2+9.98=10.18 sv=50010.18≈49.1 tokens/s\begin{aligned} T &= 0.2 + (500 - 1)\times 0.02 \\ &= 0.2 + 9.98 = 10.18\ \text{s} \\ v &= \frac{500}{10.18} \approx 49.1\ \text{tokens/s} \end{aligned}Tv=0.2+(500−1)×0.02=0.2+9.98=10.18 s=10.18500≈49.1 tokens/s 這段回答約需十秒,整體吞吐量每秒 49.1 個標記略低於純生成的每秒 50 個標記,因為固定的首字延遲被分攤到整段回應中。兩者的差距在回答較長時縮小,在回答較短時擴大,此時啟動停頓佔據主導地位。 降低延遲 首個標記產生時間會因縮短提示詞、提示詞快取與更快的預填硬體而下降。每個輸出標記的間隔時間會因更高的記憶體頻寬、量化,以及如推測解碼這類每次模型運算輸出超過一個標記的技術而下降。由於總時間隨著每個生成的標記增加,限制最大輸出長度通常是互動式應用最直接的調整手段。若要探討草稿模型的接受率如何改變每個標記的數值,請參閱推測解碼加速計算機;若要模擬機群層級的容量,請參閱有效每秒標記數計算器。 常見問題(FAQ)首個標記產生時間與每個輸出標記的間隔時間有何差異?首個標記產生時間(TTFT)衡量最初的等待:模型讀取整段提示詞、填滿注意力快取,並輸出第一個標記。每個輸出標記的間隔時間(TPOT),即標記間延遲,衡量之後穩定的節奏,此時每個新標記只需一個解碼步驟。TTFT 隨提示詞長度增加,並由運算密集的預填階段主導;TPOT 則由解碼階段的記憶體頻寬決定,每個標記大致維持固定。 公式為何乘以輸出標記數減一?第一個標記已計入首個標記產生時間之中,因此只有其餘標記會增加標記間延遲。一段 500 個標記的回答,會在第一個標記之後增加 499 段標記間間隔。對於較長的回答,乘以標記數與乘以標記數減一的差異很小,但減一的形式才是精確的。 如何降低服務延遲?首個標記產生時間可藉由縮短提示詞、提示詞快取以及更快的預填硬體來降低;每個輸出標記的間隔時間可藉由提高記憶體頻寬、量化或推測解碼來降低。限制最大輸出長度通常是最簡單的調整方式,因為總時間會隨著每個生成的標記而增加。 免責聲明 結果假設為單一不中斷的串流,且每個標記的延遲固定不變。實際服務系統會因批次處理、排隊、網路傳輸與負載而變動,因此此數值應視為規劃用的估算,而非服務水準保證。