首頁 ai 情境成本增長計算機 產生日期: 2026年7月20日 下午09:34 情境成本增長計算機 輸入 輪數10系統提示詞元800每輪詞元600每輪輸出詞元400輸入價格(每百萬詞元)3 $輸出價格(每百萬詞元)15 $ AI & LLM 情境成本增長計算機 估算多輪對話的累積 API 成本,其中每一輪都重新送出完整歷史,因此輸入詞元會隨每一輪而增長。 輸入 對話 輪數 ≥ 1 對話進行的輪數。每一輪為一則使用者訊息與一則模型回覆。 系統提示詞元 每一輪開頭送出的系統提示之詞元。在整段對話中,此固定成本每輪支付一次。 每輪詞元 每一輪新增的歷史詞元,即使用者訊息加上前一則回覆。由於完整歷史會被重新送出,這些詞元在之後的每一輪都會再次支付。 每輪輸出詞元 模型在每則回覆中生成的詞元。 價格 輸入價格(每百萬詞元) $ 供應商對每一百萬個輸入詞元的收費。 輸出價格(每百萬詞元) $ 供應商對每一百萬個輸出詞元的收費,通常為輸入費率的數倍。 結果 輸入數值即可顯示計算結果。 總成本 $ 在給定的每百萬價格下,整段對話所有輸入與輸出詞元的合計成本。 詳細資料 總輸入詞元 所有輪次加總的輸入詞元。累積的歷史每輪重新送出,因此此值會隨輪數的平方成長。 總輸出詞元 所有輪次加總的輸出詞元:10 輪乘以每輪 400 個詞元。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 為什麼多輪成本會增長 語言模型的 API 呼叫是無狀態的:模型在呼叫之間不保留記憶,因此用戶端必須在每次請求都重新送出先前的對話作為情境,模型才能保持連貫。那些重新送出的歷史每次都以輸入詞元計費。隨著對話拉長,每一輪的輸入帶有先前各輪累積的歷史,因此每輪輸入增長,而累積輸入的增長快於輪數。 公式 設 NN 為輪數,nsysn_{sys} 為每輪重新送出的系統提示,nturnn_{turn} 為每輪新增的歷史(使用者訊息加上前一則回覆),noutn_{out} 為每輪的輸出。在第 kk 輪,輸入為 nsys+(k−1) nturnn_{sys} + (k-1)\,n_{turn}。對所有輪次加總: Tin=N⋅nsys+nturn⋅N(N−1)2T_{in} = N \cdot n_{sys} + n_{turn} \cdot \frac{N(N-1)}{2}Tin=N⋅nsys+nturn⋅2N(N−1) Tout=N⋅noutT_{out} = N \cdot n_{out}Tout=N⋅nout 三角項 N(N−1)2\tfrac{N(N-1)}{2} 對 NN 是二次的,這就是長對話的成本遠高於單輪所暗示之數的原因。以每百萬價格 pinp_{in} 與 poutp_{out} 計: C=Tin pin+Tout pout106C = \frac{T_{in}\,p_{in} + T_{out}\,p_{out}}{10^{6}}C=106Tinpin+Toutpout 範例計算 取 N = 10 輪、800 個詞元的系統提示、每輪 600 個新詞元、每輪 400 個輸出詞元,價格為每百萬輸入 $3、每百萬輸出 $15: Tin=10⋅800+600⋅10⋅92=8000+27,000=35,000T_{in} = 10 \cdot 800 + 600 \cdot \frac{10 \cdot 9}{2} = 8000 + 27{,}000 = 35{,}000Tin=10⋅800+600⋅210⋅9=8000+27,000=35,000 Tout=10⋅400=4000T_{out} = 10 \cdot 400 = 4000Tout=10⋅400=4000 C=35,000⋅3+4000⋅15106=105,000+60,000106=$0.165C = \frac{35{,}000 \cdot 3 + 4000 \cdot 15}{10^{6}} = \frac{105{,}000 + 60{,}000}{10^{6}} = \$0.165C=10635,000⋅3+4000⋅15=106105,000+60,000=$0.165 這段對話成本約 16.5 美分。歷史項(27,000 個詞元)遠超過 8000 個詞元的重複系統提示,輸入帳單大部分來自重新送出不斷增長的對話記錄,而非固定的指令。 二次效應 由於 TinT_{in} 隨 N2N^2 放大,將輪數加倍會使輸入成本大約變為四倍,而非兩倍。上述範例的 20 輪版本將重新送出 600⋅20⋅192=114,000600 \cdot \tfrac{20 \cdot 19}{2} = 114{,}000 個歷史詞元,超過十輪時 27,000 個的四倍。這種複合是重新送出完整歷史的特性,與每詞元價格無關。 緩解 藉由較少次數或較低費率支付累積歷史,可降低此增長:摘要或截斷舊的輪次可限制重新送出多少歷史,而提示快取則讓供應商以較低費率為重複的情境計費。對情境中靜態部分進行快取所得的節省,可以 提示快取節省計算機 估算。要在成本成為考量之前確認不斷增長的對話記錄仍能容納於模型,請參閱 情境視窗容納計算機。 常見問題(FAQ)為什麼成本的增長快於輪數?當完整對話歷史在每一輪都重新送出時,第 k 輪的輸入包含先前各輪的全部內容。因此累積的歷史一再被支付,總輸入詞元會隨輪數的平方而非線性成長。輪數加倍可使輸入成本大約變為四倍。 為什麼每一輪都要重新送出歷史?語言模型的 API 呼叫是無狀態的:模型對先前的呼叫沒有記憶,因此用戶端必須在每次請求都納入先前的訊息作為情境,模型才能保持連貫。那些重新送出的歷史每次都以輸入詞元計費。 該如何降低這項成本?常見策略包括摘要或截斷舊的歷史、限制保留的輪數上限,以及在供應商對重複情境提供折扣費率時使用提示快取。每一種做法都能減少累積歷史以完整輸入費率被支付的次數。 免責聲明 詞元數量取決於模型的詞元化工具,並隨語言與內容而異。公布的價格會隨時間變動,且可能未計入快取或批次處理的折扣。此模型假設完整歷史每一輪都以完整輸入費率重新送出;實際使用快取或截斷時將有所不同。 推薦的下一個 詞元成本計算機 依輸入與輸出的詞元數量,以及模型每百萬詞元的價格,計算單次大型語言模型(LLM)API 呼叫的成本,其中輸入與輸出分別計費。 深入了解情境視窗容納計算機 檢查提示加上保留的輸出詞元是否能容納於模型的情境視窗(上下文視窗)內。情境視窗界定了單次呼叫中輸入與輸出的合計上限。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機情境成本增長計算機 +20 more Show less 批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機 其他ai計算機 inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 為什麼多輪成本會增長 語言模型的 API 呼叫是無狀態的:模型在呼叫之間不保留記憶,因此用戶端必須在每次請求都重新送出先前的對話作為情境,模型才能保持連貫。那些重新送出的歷史每次都以輸入詞元計費。隨著對話拉長,每一輪的輸入帶有先前各輪累積的歷史,因此每輪輸入增長,而累積輸入的增長快於輪數。 公式 設 NN 為輪數,nsysn_{sys} 為每輪重新送出的系統提示,nturnn_{turn} 為每輪新增的歷史(使用者訊息加上前一則回覆),noutn_{out} 為每輪的輸出。在第 kk 輪,輸入為 nsys+(k−1) nturnn_{sys} + (k-1)\,n_{turn}。對所有輪次加總: Tin=N⋅nsys+nturn⋅N(N−1)2T_{in} = N \cdot n_{sys} + n_{turn} \cdot \frac{N(N-1)}{2}Tin=N⋅nsys+nturn⋅2N(N−1) Tout=N⋅noutT_{out} = N \cdot n_{out}Tout=N⋅nout 三角項 N(N−1)2\tfrac{N(N-1)}{2} 對 NN 是二次的,這就是長對話的成本遠高於單輪所暗示之數的原因。以每百萬價格 pinp_{in} 與 poutp_{out} 計: C=Tin pin+Tout pout106C = \frac{T_{in}\,p_{in} + T_{out}\,p_{out}}{10^{6}}C=106Tinpin+Toutpout 範例計算 取 N = 10 輪、800 個詞元的系統提示、每輪 600 個新詞元、每輪 400 個輸出詞元,價格為每百萬輸入 $3、每百萬輸出 $15: Tin=10⋅800+600⋅10⋅92=8000+27,000=35,000T_{in} = 10 \cdot 800 + 600 \cdot \frac{10 \cdot 9}{2} = 8000 + 27{,}000 = 35{,}000Tin=10⋅800+600⋅210⋅9=8000+27,000=35,000 Tout=10⋅400=4000T_{out} = 10 \cdot 400 = 4000Tout=10⋅400=4000 C=35,000⋅3+4000⋅15106=105,000+60,000106=$0.165C = \frac{35{,}000 \cdot 3 + 4000 \cdot 15}{10^{6}} = \frac{105{,}000 + 60{,}000}{10^{6}} = \$0.165C=10635,000⋅3+4000⋅15=106105,000+60,000=$0.165 這段對話成本約 16.5 美分。歷史項(27,000 個詞元)遠超過 8000 個詞元的重複系統提示,輸入帳單大部分來自重新送出不斷增長的對話記錄,而非固定的指令。 二次效應 由於 TinT_{in} 隨 N2N^2 放大,將輪數加倍會使輸入成本大約變為四倍,而非兩倍。上述範例的 20 輪版本將重新送出 600⋅20⋅192=114,000600 \cdot \tfrac{20 \cdot 19}{2} = 114{,}000 個歷史詞元,超過十輪時 27,000 個的四倍。這種複合是重新送出完整歷史的特性,與每詞元價格無關。 緩解 藉由較少次數或較低費率支付累積歷史,可降低此增長:摘要或截斷舊的輪次可限制重新送出多少歷史,而提示快取則讓供應商以較低費率為重複的情境計費。對情境中靜態部分進行快取所得的節省,可以 提示快取節省計算機 估算。要在成本成為考量之前確認不斷增長的對話記錄仍能容納於模型,請參閱 情境視窗容納計算機。 常見問題(FAQ)為什麼成本的增長快於輪數?當完整對話歷史在每一輪都重新送出時,第 k 輪的輸入包含先前各輪的全部內容。因此累積的歷史一再被支付,總輸入詞元會隨輪數的平方而非線性成長。輪數加倍可使輸入成本大約變為四倍。 為什麼每一輪都要重新送出歷史?語言模型的 API 呼叫是無狀態的:模型對先前的呼叫沒有記憶,因此用戶端必須在每次請求都納入先前的訊息作為情境,模型才能保持連貫。那些重新送出的歷史每次都以輸入詞元計費。 該如何降低這項成本?常見策略包括摘要或截斷舊的歷史、限制保留的輪數上限,以及在供應商對重複情境提供折扣費率時使用提示快取。每一種做法都能減少累積歷史以完整輸入費率被支付的次數。 免責聲明 詞元數量取決於模型的詞元化工具,並隨語言與內容而異。公布的價格會隨時間變動,且可能未計入快取或批次處理的折扣。此模型假設完整歷史每一輪都以完整輸入費率重新送出;實際使用快取或截斷時將有所不同。