首頁 ai 注意力記憶體計算機 產生日期: 2026年7月20日 下午09:34 注意力記憶體計算機 輸入 序列長度4,096注意力頭數32批次大小1精度FP16 / BF16(2 bytes) AI & LLM 注意力記憶體計算機 依序列長度、頭數、批次大小與每元素 bytes,估算標準 transformer 注意力中具現化注意力分數矩陣的記憶體——也就是 FlashAttention 所消除的二次項。 輸入 工作負載 序列長度 彼此相互關注的 token 數量。分數矩陣的維度是序列長度乘以序列長度,因此記憶體隨此值的平方成長。 注意力頭數 注意力頭的數量。每個頭各自計算自己的分數矩陣,因此記憶體隨頭數線性成長。 批次大小 一次處理的序列數量。每個序列各帶自己的分數矩陣,因此記憶體隨批次線性成長。 精度 FP16 / BF16 2 bytes 每個儲存分數所用的 bytes。半精度用兩個 bytes;單精度(有時用於 softmax)用四個。 結果 輸入數值即可顯示計算結果。 注意力記憶體 分數矩陣的記憶體估計:批次乘以 32 個頭,再乘以 4,096 個 token 的平方,約 ... GB。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 注意力記憶體 標準 transformer 注意力會把每個 token 與其他每個 token 比較,在 softmax 之前建立一個分數矩陣。該矩陣在序列長度上是方陣,因此其記憶體隨上下文的平方成長——這就是著名的注意力二次成本。本計算機依序列長度、注意力頭數、批次大小,以及每個分數所用的 bytes,估算這個具現化矩陣的大小。它正是 FlashAttention 所避免儲存的記憶體。 二次項 對於一段 ss 個 token 的序列,注意力會形成一個 s×ss \times s 的分數矩陣:第 ii 列、第 jj 行存放 token ii 對 token jj 的關注程度。儲存它所需的記憶體與 s2s^2 成正比。這與隨上下文線性成長的模型權重或 key-value 快取不同——分數矩陣隨其平方成長,因此在長上下文下,它成為最主要的中間緩衝,也是樸素注意力會耗盡記憶體的原因。 公式 每個頭各自建立自己的分數矩陣,而批次中每個序列各帶一份副本,因此記憶體(以 bytes 計)為 Abytes=B⋅H⋅s2⋅eA_\text{bytes} = B \cdot H \cdot s^2 \cdot eAbytes=B⋅H⋅s2⋅e 其中 BB 是批次大小,HH 是注意力頭數,ss 是序列長度,ee 是每個儲存分數的 bytes。除以 10910^9 即得 GB。ss 上的平方正是長上下文昂貴的原因:頭數與批次只線性相乘。 這項記憶體是什麼 這個數字量測的是標準注意力在 query-key 乘積與對 value 的 softmax 加權和之間,寫入記憶體的具現化分數矩陣。它是樸素實作必須持有的激活值緩衝。它是否持續存在,取決於情境:在單純的前向傳播中它是暫時的,可在各層之間重複使用;而訓練框架除非有檢查點或融合核心介入,否則可能為反向傳播保留各層的副本。 FlashAttention FlashAttention 計算出完全相同的輸出,卻從不寫入完整的 s×ss \times s 矩陣。它以小區塊走過 key 與 value,維護執行中的 softmax 統計量,因此一次只需在記憶體中持有一個區塊,這把儲存從序列長度的二次轉為線性。本計算機所估算的矩陣,正是 FlashAttention 拒絕儲存的部分——因此此處的結果是融合注意力核心在給定上下文長度下所節省記憶體的良好代理指標。 範例計算 取單一序列、4,096 個 token、32 個注意力頭,以 16-bit 精度: Abytes=1×32×40962×2=1,073,741,824A_\text{bytes} = 1 \times 32 \times 4096^2 \times 2 = 1{,}073{,}741{,}824Abytes=1×32×40962×2=1,073,741,824 單一層分數矩陣約為 1.07 GB。把上下文加倍到 8,192 個 token,平方項便主導全局:同一算式得出約 4.29 GB,長度兩倍卻是四倍的量。同一注意力預算的 key-value 面,在 KV 快取大小計算機 中有說明,而模型權重的部分則在 LLM 推論 VRAM 計算器。 常見問題(FAQ)為什麼注意力記憶體與序列長度成平方關係?注意力會把每個 token 與其他每個 token 比較,產生一個維度皆為序列長度的分數矩陣。儲存這整個矩陣所需的記憶體因此與序列長度的平方成正比。上下文加倍,分數矩陣就變為四倍,這正是標準注意力在長上下文下會受記憶體限制的原因——二次項超越了權重與激活值的線性成本。 FlashAttention 如何降低這項記憶體?FlashAttention 計算出相同的結果,卻從不具現化完整的分數矩陣。它以 key 與 value 的小區塊串流地處理注意力,保留執行中的 softmax 統計量,因此一次只持有一個區塊。本計算機所量測的二次矩陣,正是 FlashAttention 所避免儲存的記憶體,這也是它能擴展到長得多的序列的原因。算術運算不變;只有中間儲存從二次縮減為線性。 這項記憶體是每層的,還是整個模型的?視實作而定。此處的數字是單一層分數矩陣的大小。在樸素的前向傳播中,這個緩衝可在各層之間釋放並重複使用,因此是暫時性的,而非乘以層數。然而在訓練期間,除非使用了梯度檢查點或 FlashAttention,框架可能為反向傳播保留各層的注意力張量,此時總量便可能隨層數成長。 免責聲明 此估計僅涵蓋指定精度下具現化的分數矩陣;它不含 query、key、value 張量、輸出投影以及其他激活值。它描述的是標準注意力——FlashAttention 之類的核心根本不儲存此矩陣。 推薦的下一個 KV 快取大小計算機 依層數、key/value 頭數、頭維度、上下文長度、批次大小與每元素 bytes,估算 transformer 推論期間保留的 key-value 快取記憶體。 深入了解LLM 推論 VRAM 計算器 根據參數量、權重精度,以及 KV 快取、激活值與碎片化所佔的執行階段開銷,估算為大型語言模型提供推論服務所需的 GPU VRAM。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機 +2 more Show less LLM 推論 VRAM 計算器Transformer 參數量計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 注意力記憶體 標準 transformer 注意力會把每個 token 與其他每個 token 比較,在 softmax 之前建立一個分數矩陣。該矩陣在序列長度上是方陣,因此其記憶體隨上下文的平方成長——這就是著名的注意力二次成本。本計算機依序列長度、注意力頭數、批次大小,以及每個分數所用的 bytes,估算這個具現化矩陣的大小。它正是 FlashAttention 所避免儲存的記憶體。 二次項 對於一段 ss 個 token 的序列,注意力會形成一個 s×ss \times s 的分數矩陣:第 ii 列、第 jj 行存放 token ii 對 token jj 的關注程度。儲存它所需的記憶體與 s2s^2 成正比。這與隨上下文線性成長的模型權重或 key-value 快取不同——分數矩陣隨其平方成長,因此在長上下文下,它成為最主要的中間緩衝,也是樸素注意力會耗盡記憶體的原因。 公式 每個頭各自建立自己的分數矩陣,而批次中每個序列各帶一份副本,因此記憶體(以 bytes 計)為 Abytes=B⋅H⋅s2⋅eA_\text{bytes} = B \cdot H \cdot s^2 \cdot eAbytes=B⋅H⋅s2⋅e 其中 BB 是批次大小,HH 是注意力頭數,ss 是序列長度,ee 是每個儲存分數的 bytes。除以 10910^9 即得 GB。ss 上的平方正是長上下文昂貴的原因:頭數與批次只線性相乘。 這項記憶體是什麼 這個數字量測的是標準注意力在 query-key 乘積與對 value 的 softmax 加權和之間,寫入記憶體的具現化分數矩陣。它是樸素實作必須持有的激活值緩衝。它是否持續存在,取決於情境:在單純的前向傳播中它是暫時的,可在各層之間重複使用;而訓練框架除非有檢查點或融合核心介入,否則可能為反向傳播保留各層的副本。 FlashAttention FlashAttention 計算出完全相同的輸出,卻從不寫入完整的 s×ss \times s 矩陣。它以小區塊走過 key 與 value,維護執行中的 softmax 統計量,因此一次只需在記憶體中持有一個區塊,這把儲存從序列長度的二次轉為線性。本計算機所估算的矩陣,正是 FlashAttention 拒絕儲存的部分——因此此處的結果是融合注意力核心在給定上下文長度下所節省記憶體的良好代理指標。 範例計算 取單一序列、4,096 個 token、32 個注意力頭,以 16-bit 精度: Abytes=1×32×40962×2=1,073,741,824A_\text{bytes} = 1 \times 32 \times 4096^2 \times 2 = 1{,}073{,}741{,}824Abytes=1×32×40962×2=1,073,741,824 單一層分數矩陣約為 1.07 GB。把上下文加倍到 8,192 個 token,平方項便主導全局:同一算式得出約 4.29 GB,長度兩倍卻是四倍的量。同一注意力預算的 key-value 面,在 KV 快取大小計算機 中有說明,而模型權重的部分則在 LLM 推論 VRAM 計算器。 常見問題(FAQ)為什麼注意力記憶體與序列長度成平方關係?注意力會把每個 token 與其他每個 token 比較,產生一個維度皆為序列長度的分數矩陣。儲存這整個矩陣所需的記憶體因此與序列長度的平方成正比。上下文加倍,分數矩陣就變為四倍,這正是標準注意力在長上下文下會受記憶體限制的原因——二次項超越了權重與激活值的線性成本。 FlashAttention 如何降低這項記憶體?FlashAttention 計算出相同的結果,卻從不具現化完整的分數矩陣。它以 key 與 value 的小區塊串流地處理注意力,保留執行中的 softmax 統計量,因此一次只持有一個區塊。本計算機所量測的二次矩陣,正是 FlashAttention 所避免儲存的記憶體,這也是它能擴展到長得多的序列的原因。算術運算不變;只有中間儲存從二次縮減為線性。 這項記憶體是每層的,還是整個模型的?視實作而定。此處的數字是單一層分數矩陣的大小。在樸素的前向傳播中,這個緩衝可在各層之間釋放並重複使用,因此是暫時性的,而非乘以層數。然而在訓練期間,除非使用了梯度檢查點或 FlashAttention,框架可能為反向傳播保留各層的注意力張量,此時總量便可能隨層數成長。 免責聲明 此估計僅涵蓋指定精度下具現化的分數矩陣;它不含 query、key、value 張量、輸出投影以及其他激活值。它描述的是標準注意力——FlashAttention 之類的核心根本不儲存此矩陣。