首頁 ai 推測解碼加速計算機 產生日期: 2026年7月20日 下午09:34 推測解碼加速計算機 輸入 接受率70 %每輪草稿標記數5草稿成本比15 % AI & LLM 推測解碼加速計算機 估算推測取樣帶來的解碼加速:輸入草稿模型的接受率、每輪草稿標記數,以及相對草稿成本,即可得到預期接受的標記數與實際時間的加速比。 輸入 草稿模型 接受率 % 0 – 99 % 目標模型接受草稿模型所提議標記的機率。草稿模型與目標模型對齊程度越高,接受率越高;接受率必須低於 100%,估算結果才會維持為有限值。 每輪草稿標記數 ≥ 1 草稿模型在目標模型一次驗證之前所提議的標記數量。提議越多會提高每輪可產生標記數的上限,但只要其中較早的一個被拒絕,後續的努力就會浪費掉。 草稿成本比 % 0 – 100 % 一次草稿前向傳遞相對於一次目標前向傳遞的成本。若草稿模型大小約為目標模型的十分之一,此值約落在 10%。設為零則得到忽略草稿工作的理想化加速比。 結果 輸入數值即可顯示計算結果。 加速比 在計入執行草稿模型的成本後,相對於一般解碼的實際時間加速比——在 70 % 接受率與 5 個草稿標記下約為 ...×。 詳細資料 每次目標驗證的標記數 目標模型每一次前向傳遞預期產生的標記數量(...)。這是在扣除草稿模型本身成本之前,加速比的上限。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 推測解碼加速 推測解碼透過讓一個小而便宜的草稿模型先猜測前面數個標記,再由大型的目標模型一次驗證這些猜測,藉此加速語言模型的生成。當猜測正確時,目標模型只花一次前向傳遞的成本就產生數個標記;當猜測錯誤時,便退回一般解碼。本計算機從三個數字估算最終的加速比:草稿標記被接受的頻率、每輪提議的數量,以及草稿模型相對於目標模型的成本。 運作方式 在一般的解碼器中,目標模型每產生一個標記就執行一次。推測解碼則改為要求草稿模型提議 γ\gamma 個標記,再執行一次目標模型來平行檢查它們。只要提議的標記與目標模型自己會取樣的結果一致,目標模型就接受它,並在第一個不一致處停下,從自己的分布重新取樣該位置。由於被拒絕的標記會由目標模型修正,輸出在統計上與一般解碼完全相同——此方法是以額外的草稿運算換取較少的昂貴目標驗證,而不改變模型所說的內容。 公式 若每個標記以機率 α\alpha 獨立被接受,每次目標驗證預期產生的標記數為 τ=1−αγ+11−α\tau = \frac{1 - \alpha^{\gamma+1}}{1 - \alpha}τ=1−α1−αγ+1 若草稿模型不需成本,這就會是加速比。將每次草稿傳遞計為目標傳遞的成本比例 cc 後,相對於一般解碼的實際時間加速比變為 S=1−αγ+1(γ c+1)(1−α)S = \frac{1 - \alpha^{\gamma+1}}{(\gamma\, c + 1)(1 - \alpha)}S=(γc+1)(1−α)1−αγ+1 分子獎勵較高的接受率與較長的提議;分母則對這些提議所耗費的草稿工作加以懲罰。 計算範例 假設草稿模型有 70% 的時間被接受,每輪提議 5 個標記,且每次草稿傳遞的成本為目標傳遞的 15%: τ=1−0.761−0.7=0.88240.3≈2.94S=0.8824(5×0.15+1)(0.3)=0.88240.525≈1.68\begin{aligned} \tau &= \frac{1 - 0.7^{6}}{1 - 0.7} = \frac{0.8824}{0.3} \approx 2.94 \\ S &= \frac{0.8824}{(5 \times 0.15 + 1)(0.3)} = \frac{0.8824}{0.525} \approx 1.68 \end{aligned}τS=1−0.71−0.76=0.30.8824≈2.94=(5×0.15+1)(0.3)0.8824=0.5250.8824≈1.68 每次目標驗證平均產生近三個標記,但在支付五次草稿傳遞的成本後,實現的加速比約為 1.7×。將接受率提高到 90% 可使其遠超過 2×,而較重的草稿模型——例如目標成本的 40%——則會奪回大部分的收益。 選擇設定 有兩個槓桿最為關鍵。接受率會在草稿模型與目標模型緊密對齊時上升,因此草稿模型通常是同一系列的較小模型,或目標模型的蒸餾版本。草稿長度則有一個最佳點:由於接受率會連乘累積,整輪存活的機率以幾何級數下降,因此超過少數幾個標記之後,額外的草稿成本就會超過罕見的長串接受所帶來的好處。在此掃描草稿標記數量即可看出,在給定的接受率下加速比的高峰落在何處。若想了解改善後的每標記速度如何影響端到端的回應時間,請參閱推論延遲計算器。 常見問題(FAQ)接受率是什麼?草稿模型提議一連串標記之後,目標模型會逐一檢查,只要某個標記與目標模型自己會取樣的結果相符就接受它。接受率就是每個標記相符的機率。當草稿模型與目標模型對齊良好時接受率會上升——例如同一系列的較小版本,或經過微調以模仿目標模型的模型——在困難或分布外的文字上則會下降。值得注意的是,推測解碼是精確的:被拒絕的標記會從目標模型重新取樣,因此輸出分布與一般解碼完全相同。 為什麼草稿模型的成本會降低加速比?每一輪都會多次執行草稿模型以提議標記,並執行一次目標模型來驗證。若草稿模型不需成本,加速比就會等於每次目標驗證預期接受的標記數。實際上每次草稿傳遞都需要時間,因此分母會加上草稿標記數乘以其相對成本。草稿模型若太大會侵蝕自身帶來的好處,這也是有效的草稿模型遠小於目標模型的原因。 每輪應該提議多少個草稿標記?存在一個最佳點。提議更多標記會提高最佳情況,但由於接受率會連乘累積,整輪存活的機率以幾何級數下降——一旦某個標記被拒絕,該輪後續的所有提議都會被捨棄。超過少數幾個標記之後,增加的草稿成本就會超過罕見的長串接受所帶來的好處。最佳值取決於接受率與草稿成本;在此嘗試幾個數值即可看出加速比的高峰落在何處。 免責聲明 這是一個簡化模型,假設每個標記的接受率固定,且相對草稿成本固定。實際接受率會隨文字內容與取樣溫度而變,驗證也會帶來此處未涵蓋的額外開銷,因此實測加速比會有所不同。此數值適合用來比較不同設定,而非作為精確預測。 推薦的下一個 推論延遲計算器 依據首個標記產生時間、每個輸出標記的間隔時間以及輸出標記數量,估算串流式大型語言模型補全的端對端回應時間。 深入了解推論吞吐量計算器 依據模型大小、權重精度與加速器記憶體頻寬,估算大型語言模型解碼速度的記憶體頻寬上限——單一串流每秒可產生標記數的屋頂線。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器 +2 more Show less 推論延遲計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 推測解碼加速 推測解碼透過讓一個小而便宜的草稿模型先猜測前面數個標記,再由大型的目標模型一次驗證這些猜測,藉此加速語言模型的生成。當猜測正確時,目標模型只花一次前向傳遞的成本就產生數個標記;當猜測錯誤時,便退回一般解碼。本計算機從三個數字估算最終的加速比:草稿標記被接受的頻率、每輪提議的數量,以及草稿模型相對於目標模型的成本。 運作方式 在一般的解碼器中,目標模型每產生一個標記就執行一次。推測解碼則改為要求草稿模型提議 γ\gamma 個標記,再執行一次目標模型來平行檢查它們。只要提議的標記與目標模型自己會取樣的結果一致,目標模型就接受它,並在第一個不一致處停下,從自己的分布重新取樣該位置。由於被拒絕的標記會由目標模型修正,輸出在統計上與一般解碼完全相同——此方法是以額外的草稿運算換取較少的昂貴目標驗證,而不改變模型所說的內容。 公式 若每個標記以機率 α\alpha 獨立被接受,每次目標驗證預期產生的標記數為 τ=1−αγ+11−α\tau = \frac{1 - \alpha^{\gamma+1}}{1 - \alpha}τ=1−α1−αγ+1 若草稿模型不需成本,這就會是加速比。將每次草稿傳遞計為目標傳遞的成本比例 cc 後,相對於一般解碼的實際時間加速比變為 S=1−αγ+1(γ c+1)(1−α)S = \frac{1 - \alpha^{\gamma+1}}{(\gamma\, c + 1)(1 - \alpha)}S=(γc+1)(1−α)1−αγ+1 分子獎勵較高的接受率與較長的提議;分母則對這些提議所耗費的草稿工作加以懲罰。 計算範例 假設草稿模型有 70% 的時間被接受,每輪提議 5 個標記,且每次草稿傳遞的成本為目標傳遞的 15%: τ=1−0.761−0.7=0.88240.3≈2.94S=0.8824(5×0.15+1)(0.3)=0.88240.525≈1.68\begin{aligned} \tau &= \frac{1 - 0.7^{6}}{1 - 0.7} = \frac{0.8824}{0.3} \approx 2.94 \\ S &= \frac{0.8824}{(5 \times 0.15 + 1)(0.3)} = \frac{0.8824}{0.525} \approx 1.68 \end{aligned}τS=1−0.71−0.76=0.30.8824≈2.94=(5×0.15+1)(0.3)0.8824=0.5250.8824≈1.68 每次目標驗證平均產生近三個標記,但在支付五次草稿傳遞的成本後,實現的加速比約為 1.7×。將接受率提高到 90% 可使其遠超過 2×,而較重的草稿模型——例如目標成本的 40%——則會奪回大部分的收益。 選擇設定 有兩個槓桿最為關鍵。接受率會在草稿模型與目標模型緊密對齊時上升,因此草稿模型通常是同一系列的較小模型,或目標模型的蒸餾版本。草稿長度則有一個最佳點:由於接受率會連乘累積,整輪存活的機率以幾何級數下降,因此超過少數幾個標記之後,額外的草稿成本就會超過罕見的長串接受所帶來的好處。在此掃描草稿標記數量即可看出,在給定的接受率下加速比的高峰落在何處。若想了解改善後的每標記速度如何影響端到端的回應時間,請參閱推論延遲計算器。 常見問題(FAQ)接受率是什麼?草稿模型提議一連串標記之後,目標模型會逐一檢查,只要某個標記與目標模型自己會取樣的結果相符就接受它。接受率就是每個標記相符的機率。當草稿模型與目標模型對齊良好時接受率會上升——例如同一系列的較小版本,或經過微調以模仿目標模型的模型——在困難或分布外的文字上則會下降。值得注意的是,推測解碼是精確的:被拒絕的標記會從目標模型重新取樣,因此輸出分布與一般解碼完全相同。 為什麼草稿模型的成本會降低加速比?每一輪都會多次執行草稿模型以提議標記,並執行一次目標模型來驗證。若草稿模型不需成本,加速比就會等於每次目標驗證預期接受的標記數。實際上每次草稿傳遞都需要時間,因此分母會加上草稿標記數乘以其相對成本。草稿模型若太大會侵蝕自身帶來的好處,這也是有效的草稿模型遠小於目標模型的原因。 每輪應該提議多少個草稿標記?存在一個最佳點。提議更多標記會提高最佳情況,但由於接受率會連乘累積,整輪存活的機率以幾何級數下降——一旦某個標記被拒絕,該輪後續的所有提議都會被捨棄。超過少數幾個標記之後,增加的草稿成本就會超過罕見的長串接受所帶來的好處。最佳值取決於接受率與草稿成本;在此嘗試幾個數值即可看出加速比的高峰落在何處。 免責聲明 這是一個簡化模型,假設每個標記的接受率固定,且相對草稿成本固定。實際接受率會隨文字內容與取樣溫度而變,驗證也會帶來此處未涵蓋的額外開銷,因此實測加速比會有所不同。此數值適合用來比較不同設定,而非作為精確預測。