首頁 ai Transformer 參數量計算機 產生日期: 2026年7月20日 下午09:34 Transformer 參數量計算機 輸入 層數32隱藏層維度4,096前饋擴展倍率4詞彙表大小32,000 AI & LLM Transformer 參數量計算機 以一階架構公式,從層數、隱藏層維度、前饋擴展倍率與詞彙表大小,估算純解碼器(decoder-only)Transformer 的總參數量。 輸入 架構 層數 堆疊在模型中的解碼器區塊數量。每個區塊會為參數總量貢獻一個注意力子層與一個前饋子層。 隱藏層維度 殘差流的寬度,亦稱為模型維度。注意力與前饋的權重矩陣會隨它的平方成長,因此它主導了整個參數量。 前饋擴展倍率 前饋內層維度與隱藏層維度的比值,因此內層寬度等於此倍率乘以隱藏層維度。常見值為四。 詞彙表大小 模型詞彙表中的 token 數量。嵌入表為每個 token 持有一個隱藏層維度長的向量,因而增加「詞彙表大小乘以隱藏層維度」的參數。 結果 輸入數值即可顯示計算結果。 參數量(十億/億) 同一總量以十億為單位表示,即一般用來為模型命名的單位:約 ... 億。 詳細資料 總參數量 涵蓋所有層與嵌入表的估算參數量:對上方所輸入的架構而言約為 ...。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 Transformer 參數量 大型語言模型的規模,通常以一個醒目的數字來標示——七十億、七百億——但那個數字完全由少數幾項架構選擇所決定。給定層數、隱藏層維度、前饋擴展與詞彙表,總參數量便可由一條簡短的公式推得。本計算機套用該公式,給出一階估算,也就是在任何權重存在之前用來估量模型規模的那種信封背面式推算。 參數住在哪裡 純解碼器 Transformer 中幾乎每個權重都落在三個地方之一。每個區塊的注意力子層持有四個方形權重矩陣——查詢、鍵、值與輸出投影——各為「隱藏層維度乘以隱藏層維度」。前饋子層持有兩個矩陣,把隱藏流擴展到更寬的內層維度再投影回來。而獨立於這疊層之外,token 嵌入表為詞彙表中的每個項目儲存一個隱藏層維度長的向量。 把這些計算起來,就得到架構估算。注意力區塊每一層貢獻約 4d24d^2 個數值,其中 dd 是隱藏層維度。前饋區塊擴展到 m⋅dm \cdot d 的內層寬度,貢獻約 2md22 m d^2。嵌入表則貢獻詞彙表大小 VV 乘以 dd。 公式 設 LL 層、隱藏層維度為 dd、前饋倍率為 mm、詞彙表大小為 VV,則總參數量為 N=L⋅d2⋅(4+2m)+V⋅dN = L \cdot d^2 \cdot (4 + 2m) + V \cdot dN=L⋅d2⋅(4+2m)+V⋅d 第一項彙總所有層的每層注意力與前饋權重;第二項是嵌入表。由於每層項與隱藏層維度的平方成正比,模型的寬度遠比深度更為關鍵:隱藏層維度加倍,參數量約莫變為四倍,而層數加倍,參數量只變為兩倍。 計算範例 以一個 32 層、隱藏層維度為 4096、前饋擴展為四、詞彙表為 32,000 個 token 的模型為例。每層因子為 4+2×4=124 + 2 \times 4 = 12,於是 N=32×40962×12+32000×4096=6,442,450,944+131,072,000≈6.57 十億\begin{aligned} N &= 32 \times 4096^2 \times 12 + 32000 \times 4096 \\ &= 6{,}442{,}450{,}944 + 131{,}072{,}000 \\ &\approx 6.57 \text{ 十億} \end{aligned}N=32×40962×12+32000×4096=6,442,450,944+131,072,000≈6.57 十億 層疊佔了其中幾乎全部;嵌入表只增加約 1.31 億,略多於百分之二。在常見的四倍擴展下,每一層約有三分之二的權重落在前饋,三分之一落在注意力。 這個估算省略了什麼 這是一階的計數。它涵蓋了主導總量的矩陣,卻省略了那些較小的項目:偏置、層正規化的縮放與平移值,以及任何學習到的位置嵌入。這些加總起來在大型模型中通常遠低於百分之一,因此不會動搖那個醒目的數字。此估算同時假設輸入嵌入與輸出投影共用一個矩陣——亦即綁定嵌入——因此該表只計入一次;採用非綁定嵌入的模型則會帶有兩份這個表。 一旦參數量已知,它便驅動了部署的實務問題。容納權重所需的記憶體取決於參數量與數值精度,詳見 量化模型大小計算器。在權重之上再加上最佳化器狀態與激活值、訓練同一模型所需的記憶體,則涵蓋於 LLM 訓練 VRAM 計算機。 常見問題(FAQ)什麼算是一個參數?參數是儲存在模型中的單一個學習到的權重或偏置(bias)值。最主要的貢獻來自注意力投影與前饋層的權重矩陣,以及 token 嵌入表。本估算計入這些矩陣與嵌入表,但省略了那些較小的項目——偏置、層正規化(layer normalization)的縮放與平移值,以及任何學習到的位置嵌入——這些加總起來,在大型模型中通常遠低於百分之一。 嵌入表貢獻了多少?token 嵌入表為詞彙表中的每個項目儲存一個隱藏層維度長的向量,因此它持有「詞彙表大小乘以隱藏層維度」個數值。對於詞彙表很大的小型模型,這可能佔總量的一個可觀比例;但對大型模型而言,每一層的注意力與前饋權重才是主導,嵌入表則成為次要的一小部分。當輸入嵌入與輸出投影共用同一個矩陣時——亦即綁定嵌入(tied embeddings)——這個表只計入一次而非兩次。 注意力層與前饋層,哪一個持有的權重較多?就每一層而言,注意力區塊持有約「四倍隱藏層維度平方」的數值,來自查詢、鍵、值與輸出投影;前饋區塊則持有約「兩倍擴展倍率乘以隱藏層維度平方」。在常見的四倍擴展下,前饋區塊持有約「八倍隱藏層維度平方」,而注意力區塊為「四倍」,因此每一層約有三分之二的權重落在前饋上。 免責聲明 這是一階估算。它涵蓋注意力投影、前饋權重與嵌入表,但省略了偏置、層正規化參數與位置嵌入,並假設輸入與輸出嵌入為綁定。特定模型已公布的參數量可能會有小幅差異。 推薦的下一個 量化模型大小計算器 根據參數量與量化位元寬度,估算大型語言模型在磁碟與記憶體中的大小,同時以十進位 GB 與二進位 GiB 兩種單位呈現。 深入了解LLM 訓練 VRAM 計算機 依參數量、最佳化器選擇與激活值記憶體,搭配混合精度 Adam 每參數 16 bytes 的經驗法則,估算完整微調大型語言模型所需的 GPU VRAM。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機Transformer 參數量計算機 +2 more Show less KV 快取大小計算機LLM 推論 VRAM 計算器 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 Transformer 參數量 大型語言模型的規模,通常以一個醒目的數字來標示——七十億、七百億——但那個數字完全由少數幾項架構選擇所決定。給定層數、隱藏層維度、前饋擴展與詞彙表,總參數量便可由一條簡短的公式推得。本計算機套用該公式,給出一階估算,也就是在任何權重存在之前用來估量模型規模的那種信封背面式推算。 參數住在哪裡 純解碼器 Transformer 中幾乎每個權重都落在三個地方之一。每個區塊的注意力子層持有四個方形權重矩陣——查詢、鍵、值與輸出投影——各為「隱藏層維度乘以隱藏層維度」。前饋子層持有兩個矩陣,把隱藏流擴展到更寬的內層維度再投影回來。而獨立於這疊層之外,token 嵌入表為詞彙表中的每個項目儲存一個隱藏層維度長的向量。 把這些計算起來,就得到架構估算。注意力區塊每一層貢獻約 4d24d^2 個數值,其中 dd 是隱藏層維度。前饋區塊擴展到 m⋅dm \cdot d 的內層寬度,貢獻約 2md22 m d^2。嵌入表則貢獻詞彙表大小 VV 乘以 dd。 公式 設 LL 層、隱藏層維度為 dd、前饋倍率為 mm、詞彙表大小為 VV,則總參數量為 N=L⋅d2⋅(4+2m)+V⋅dN = L \cdot d^2 \cdot (4 + 2m) + V \cdot dN=L⋅d2⋅(4+2m)+V⋅d 第一項彙總所有層的每層注意力與前饋權重;第二項是嵌入表。由於每層項與隱藏層維度的平方成正比,模型的寬度遠比深度更為關鍵:隱藏層維度加倍,參數量約莫變為四倍,而層數加倍,參數量只變為兩倍。 計算範例 以一個 32 層、隱藏層維度為 4096、前饋擴展為四、詞彙表為 32,000 個 token 的模型為例。每層因子為 4+2×4=124 + 2 \times 4 = 12,於是 N=32×40962×12+32000×4096=6,442,450,944+131,072,000≈6.57 十億\begin{aligned} N &= 32 \times 4096^2 \times 12 + 32000 \times 4096 \\ &= 6{,}442{,}450{,}944 + 131{,}072{,}000 \\ &\approx 6.57 \text{ 十億} \end{aligned}N=32×40962×12+32000×4096=6,442,450,944+131,072,000≈6.57 十億 層疊佔了其中幾乎全部;嵌入表只增加約 1.31 億,略多於百分之二。在常見的四倍擴展下,每一層約有三分之二的權重落在前饋,三分之一落在注意力。 這個估算省略了什麼 這是一階的計數。它涵蓋了主導總量的矩陣,卻省略了那些較小的項目:偏置、層正規化的縮放與平移值,以及任何學習到的位置嵌入。這些加總起來在大型模型中通常遠低於百分之一,因此不會動搖那個醒目的數字。此估算同時假設輸入嵌入與輸出投影共用一個矩陣——亦即綁定嵌入——因此該表只計入一次;採用非綁定嵌入的模型則會帶有兩份這個表。 一旦參數量已知,它便驅動了部署的實務問題。容納權重所需的記憶體取決於參數量與數值精度,詳見 量化模型大小計算器。在權重之上再加上最佳化器狀態與激活值、訓練同一模型所需的記憶體,則涵蓋於 LLM 訓練 VRAM 計算機。 常見問題(FAQ)什麼算是一個參數?參數是儲存在模型中的單一個學習到的權重或偏置(bias)值。最主要的貢獻來自注意力投影與前饋層的權重矩陣,以及 token 嵌入表。本估算計入這些矩陣與嵌入表,但省略了那些較小的項目——偏置、層正規化(layer normalization)的縮放與平移值,以及任何學習到的位置嵌入——這些加總起來,在大型模型中通常遠低於百分之一。 嵌入表貢獻了多少?token 嵌入表為詞彙表中的每個項目儲存一個隱藏層維度長的向量,因此它持有「詞彙表大小乘以隱藏層維度」個數值。對於詞彙表很大的小型模型,這可能佔總量的一個可觀比例;但對大型模型而言,每一層的注意力與前饋權重才是主導,嵌入表則成為次要的一小部分。當輸入嵌入與輸出投影共用同一個矩陣時——亦即綁定嵌入(tied embeddings)——這個表只計入一次而非兩次。 注意力層與前饋層,哪一個持有的權重較多?就每一層而言,注意力區塊持有約「四倍隱藏層維度平方」的數值,來自查詢、鍵、值與輸出投影;前饋區塊則持有約「兩倍擴展倍率乘以隱藏層維度平方」。在常見的四倍擴展下,前饋區塊持有約「八倍隱藏層維度平方」,而注意力區塊為「四倍」,因此每一層約有三分之二的權重落在前饋上。 免責聲明 這是一階估算。它涵蓋注意力投影、前饋權重與嵌入表,但省略了偏置、層正規化參數與位置嵌入,並假設輸入與輸出嵌入為綁定。特定模型已公布的參數量可能會有小幅差異。