首頁 ai 多模態影像詞元計算器 產生日期: 2026年7月20日 下午09:34 多模態影像詞元計算器 輸入 寬度1,024高度1,024細節高細節基礎詞元85每分塊詞元數170 AI & LLM 多模態影像詞元計算器 依影像的像素尺寸與細節設定,採用文件記載的縮放分塊計費方式,估算視覺模型對一張影像收取多少詞元。 輸入 影像 寬度 ≥ 1 送往模型的影像寬度,以像素計。影像在分塊前會於模型內部縮放,因此原始解析度才是此處的關鍵。 高度 ≥ 1 送往模型的影像高度,以像素計。 細節 高細節 高細節會把影像切成分塊並逐塊計費;低細節則不論尺寸大小只收取單一固定成本,以較低的固定價格換取較低的精細度。 詞元常數 結果 輸入數值即可顯示計算結果。 影像詞元 該影像收取的詞元總數(...):在細節為高時,等於基礎成本加上每分塊成本乘以 ... 個分塊。 詳細資料 分塊數 覆蓋縮放後影像所需的 512 像素分塊數量(...)。在高細節模式下,每個分塊都會加上其每分塊成本。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 多模態影像詞元 當具備視覺能力的語言模型讀取一張影像時,它並非收取固定費用——而是把影像換算成 一個詞元數,並以與文字相同的費率對這些詞元計費。這個數字取決於影像的像素尺寸與 所要求的細節等級,依循一套文件記載的縮放分塊程序。這個計算器重現了該程序,讓你 可以在送出影像前估算其詞元成本,這很重要,因為單一張高解析度影像所耗的詞元可能 比一整段文字還多。 詞元數如何構成 在高細節模式下,模型會以兩個步驟縮放影像,再以方形分塊覆蓋它。首先,若任一邊超過 2048 像素,便等比例縮小影像,使其容納於一個 2048 像素的正方形內: s1=min (1, 2048max(w,h))s_1 = \min\!\left(1,\ \frac{2048}{\max(w, h)}\right)s1=min(1, max(w,h)2048) 接著再縮放一次,使較短邊變為 768 像素: s2=768min(w⋅s1, h⋅s1)s_2 = \frac{768}{\min(w \cdot s_1,\ h \cdot s_1)}s2=min(w⋅s1, h⋅s1)768 縮放後的影像,尺寸為 w2×h2w_2 \times h_2,會被切分成 512 像素分塊組成的網格,每個軸都 向上取整,使不完整的分塊仍被計入: k=⌈w2512⌉⋅⌈h2512⌉k = \left\lceil \frac{w_2}{512} \right\rceil \cdot \left\lceil \frac{h_2}{512} \right\rceilk=⌈512w2⌉⋅⌈512h2⌉ 每個分塊收取固定數量的詞元,並加上一筆固定的基礎成本,用以涵蓋模型一律會收到的 低解析度概覽: timg=t0+ttile⋅kt_{img} = t_0 + t_{tile} \cdot ktimg=t0+ttile⋅k 在低細節模式下,會完全跳過分塊,影像僅以基礎成本計費,timg=t0t_{img} = t_0。 計算範例 取一張 1024×1024 的影像,採高細節,基礎成本為 85 個詞元、每分塊 170 個詞元。 兩邊皆未超過 2048,因此第一道縮放維持原狀;第二道縮放把較短邊縮至 768: s2=7681024=0.75w2=h2=1024×0.75=768 px\begin{aligned} s_2 &= \frac{768}{1024} = 0.75 \\ w_2 = h_2 &= 1024 \times 0.75 = 768 \text{ px} \end{aligned}s2w2=h2=1024768=0.75=1024×0.75=768 px 分塊網格為 k=⌈768512⌉⋅⌈768512⌉=2×2=4\begin{aligned} k &= \left\lceil \frac{768}{512} \right\rceil \cdot \left\lceil \frac{768}{512} \right\rceil = 2 \times 2 = 4 \end{aligned}k=⌈512768⌉⋅⌈512768⌉=2×2=4 總數則為 timg=85+170×4=765 tokens\begin{aligned} t_{img} &= 85 + 170 \times 4 = 765 \text{ tokens} \end{aligned}timg=85+170×4=765 tokens 以每百萬詞元三美元的中階輸入費率計算,這單一張影像約花費 0.0023 美元——單看一張 不多,但數千張影像的批次很快就會主導一份純文字的預算。 注意事項與變化 由於較短邊在分塊前固定為 768 像素,任何已達到或超過此尺寸的影像都會產生相同的 網格:一張 4096×4096 的照片計費與上述 1024×1024 範例同為 765 個詞元。送出更高的 解析度,在上限之後既買不到額外細節,也不會增加成本。確切的常數——基礎成本、分塊 大小、2048 與 768 的門檻——會因供應商與模型版本而異,因此請把此處的預設值視為其中 一種文件記載的方案,而非通用規則。 應用 影像詞元會直接餵入每次呼叫的計價:把它們加上提示詞的文字詞元,再以 詞元成本計算機 計算總額的價格。當影像本身是生成而非讀取時,其成本 則由 影像生成成本計算機 另行估算。 常見問題(FAQ)影像分塊如何決定詞元數?模型會先縮放影像:若任一邊較大,便先把影像縮小至能容納於一個 2,048 像素的正方形內,再縮放一次使較短邊變為 768 像素。縮放後的影像會被切分成 512 像素分塊組成的網格,每個分塊收取固定數量的詞元。 此外還會加上一筆固定的基礎成本,用以涵蓋模型同時會收到的低解析度概覽。總數等於基礎成本加上每分塊成本乘以分塊數。 低細節與高細節有什麼差別?高細節會執行完整的縮放分塊程序,因此成本會隨影像尺寸增加,模型也能讀取小字等細微元素。低細節則完全跳過分塊,只收取固定的基礎成本,以較低的固定價格給模型一份粗略的概覽。低細節適合只需掌握整體內容的影像,例如圖表形狀或場景類別。 送出較大的影像會比較貴嗎?在一定範圍內會。由於影像在分塊前會縮放至較短邊為 768 像素,任何已達到或超過此尺寸的影像都會產生相同的分塊網格與相同的詞元數。因此在高細節下,送出一張 4K 照片不會比 1,024 像素的影像更貴;而較短邊低於 768 像素的小影像則可能產生較少的分塊。確切的上限與分塊大小取決於模型。 免責聲明 視覺詞元計費方式因供應商與模型而異,且供應商會隨時間修訂。此處的預設值遵循其中一種文件記載的方案;在憑某個數字進行計費前,請先確認您所用特定模型當前的基礎成本、分塊大小與縮放規則。 推薦的下一個 詞元成本計算機 依輸入與輸出的詞元數量,以及模型每百萬詞元的價格,計算單次大型語言模型(LLM)API 呼叫的成本,其中輸入與輸出分別計費。 深入了解影像生成成本計算機 由影像數量與所選解析度及品質的每張單價,估算使用 AI 影像 API 生成影像的成本,支援任意幣別。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器 +2 more Show less 推論延遲計算器模型 FLOP 使用率計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 多模態影像詞元 當具備視覺能力的語言模型讀取一張影像時,它並非收取固定費用——而是把影像換算成 一個詞元數,並以與文字相同的費率對這些詞元計費。這個數字取決於影像的像素尺寸與 所要求的細節等級,依循一套文件記載的縮放分塊程序。這個計算器重現了該程序,讓你 可以在送出影像前估算其詞元成本,這很重要,因為單一張高解析度影像所耗的詞元可能 比一整段文字還多。 詞元數如何構成 在高細節模式下,模型會以兩個步驟縮放影像,再以方形分塊覆蓋它。首先,若任一邊超過 2048 像素,便等比例縮小影像,使其容納於一個 2048 像素的正方形內: s1=min (1, 2048max(w,h))s_1 = \min\!\left(1,\ \frac{2048}{\max(w, h)}\right)s1=min(1, max(w,h)2048) 接著再縮放一次,使較短邊變為 768 像素: s2=768min(w⋅s1, h⋅s1)s_2 = \frac{768}{\min(w \cdot s_1,\ h \cdot s_1)}s2=min(w⋅s1, h⋅s1)768 縮放後的影像,尺寸為 w2×h2w_2 \times h_2,會被切分成 512 像素分塊組成的網格,每個軸都 向上取整,使不完整的分塊仍被計入: k=⌈w2512⌉⋅⌈h2512⌉k = \left\lceil \frac{w_2}{512} \right\rceil \cdot \left\lceil \frac{h_2}{512} \right\rceilk=⌈512w2⌉⋅⌈512h2⌉ 每個分塊收取固定數量的詞元,並加上一筆固定的基礎成本,用以涵蓋模型一律會收到的 低解析度概覽: timg=t0+ttile⋅kt_{img} = t_0 + t_{tile} \cdot ktimg=t0+ttile⋅k 在低細節模式下,會完全跳過分塊,影像僅以基礎成本計費,timg=t0t_{img} = t_0。 計算範例 取一張 1024×1024 的影像,採高細節,基礎成本為 85 個詞元、每分塊 170 個詞元。 兩邊皆未超過 2048,因此第一道縮放維持原狀;第二道縮放把較短邊縮至 768: s2=7681024=0.75w2=h2=1024×0.75=768 px\begin{aligned} s_2 &= \frac{768}{1024} = 0.75 \\ w_2 = h_2 &= 1024 \times 0.75 = 768 \text{ px} \end{aligned}s2w2=h2=1024768=0.75=1024×0.75=768 px 分塊網格為 k=⌈768512⌉⋅⌈768512⌉=2×2=4\begin{aligned} k &= \left\lceil \frac{768}{512} \right\rceil \cdot \left\lceil \frac{768}{512} \right\rceil = 2 \times 2 = 4 \end{aligned}k=⌈512768⌉⋅⌈512768⌉=2×2=4 總數則為 timg=85+170×4=765 tokens\begin{aligned} t_{img} &= 85 + 170 \times 4 = 765 \text{ tokens} \end{aligned}timg=85+170×4=765 tokens 以每百萬詞元三美元的中階輸入費率計算,這單一張影像約花費 0.0023 美元——單看一張 不多,但數千張影像的批次很快就會主導一份純文字的預算。 注意事項與變化 由於較短邊在分塊前固定為 768 像素,任何已達到或超過此尺寸的影像都會產生相同的 網格:一張 4096×4096 的照片計費與上述 1024×1024 範例同為 765 個詞元。送出更高的 解析度,在上限之後既買不到額外細節,也不會增加成本。確切的常數——基礎成本、分塊 大小、2048 與 768 的門檻——會因供應商與模型版本而異,因此請把此處的預設值視為其中 一種文件記載的方案,而非通用規則。 應用 影像詞元會直接餵入每次呼叫的計價:把它們加上提示詞的文字詞元,再以 詞元成本計算機 計算總額的價格。當影像本身是生成而非讀取時,其成本 則由 影像生成成本計算機 另行估算。 常見問題(FAQ)影像分塊如何決定詞元數?模型會先縮放影像:若任一邊較大,便先把影像縮小至能容納於一個 2,048 像素的正方形內,再縮放一次使較短邊變為 768 像素。縮放後的影像會被切分成 512 像素分塊組成的網格,每個分塊收取固定數量的詞元。 此外還會加上一筆固定的基礎成本,用以涵蓋模型同時會收到的低解析度概覽。總數等於基礎成本加上每分塊成本乘以分塊數。 低細節與高細節有什麼差別?高細節會執行完整的縮放分塊程序,因此成本會隨影像尺寸增加,模型也能讀取小字等細微元素。低細節則完全跳過分塊,只收取固定的基礎成本,以較低的固定價格給模型一份粗略的概覽。低細節適合只需掌握整體內容的影像,例如圖表形狀或場景類別。 送出較大的影像會比較貴嗎?在一定範圍內會。由於影像在分塊前會縮放至較短邊為 768 像素,任何已達到或超過此尺寸的影像都會產生相同的分塊網格與相同的詞元數。因此在高細節下,送出一張 4K 照片不會比 1,024 像素的影像更貴;而較短邊低於 768 像素的小影像則可能產生較少的分塊。確切的上限與分塊大小取決於模型。 免責聲明 視覺詞元計費方式因供應商與模型而異,且供應商會隨時間修訂。此處的預設值遵循其中一種文件記載的方案;在憑某個數字進行計費前,請先確認您所用特定模型當前的基礎成本、分塊大小與縮放規則。