首頁 ai 專家混合活躍參數計算機 產生日期: 2026年7月20日 下午09:34 專家混合活躍參數計算機 輸入 總專家數8活躍專家數(top-k)2單一專家參數7共享參數1 AI & LLM 專家混合活躍參數計算機 依專家數量、top-k 路由、單一專家規模與共享權重,計算專家混合(MoE)模型的總參數與活躍參數,將記憶體佔用與每個 token 的運算量分開來看。 輸入 模型 總專家數 模型內含的專家前饋區塊數量。即使任一 token 只會經過其中少數幾個,所有專家仍會佔用記憶體。 活躍專家數(top-k) 路由器為每個 token 選取的專家數量,也就是 top-k 值。只有這些專家會對 token 進行運算,決定了每個 token 的成本。 單一專家參數 單一專家的規模,以十億參數為單位。乘上專家總數得到總參數,乘上活躍數得到運算量估計。 共享參數 專家以外永遠活躍的參數,以十億為單位——注意力、路由器、嵌入層,以及任何共享專家。總參數與活躍參數都會計入。 結果 輸入數值即可顯示計算結果。 活躍參數 共享參數只加上被路由的專家:約 ... 十億。這個數字決定了每個 token 所花費的運算量。 詳細資料 總參數 共享參數加上每一個專家:約 ... 十億。這個數字決定了容納模型所需的記憶體。 活躍比例 % 活躍參數佔總參數的比例:... 十億中的 ... 十億等於 ...。比例越低,代表每個 token 保留的容量越多。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 專家混合活躍參數 專家混合模型帶著一對引人注目的數字:一個描述它能容納多少的龐大總參數,以及一個描述它每個 token 做多少工的小得多的活躍參數。這兩者常被混淆,卻回答著不同的問題——一個決定記憶體帳單,另一個決定運算帳單。本計算機依專家數量、top-k 路由、單一專家規模與共享權重,將兩者區分開來。 專家混合如何構成 在稠密的 transformer 中,每個 token 都會經過每一個權重。專家混合把一層的前饋區塊換成許多並列的專家,並加上一個小型路由器,為每個 token 只挑出其中 top-k 個。模型的其餘部分——注意力、路由器、嵌入層,有時還有一個永遠運作的共享專家——對所有 token 維持共用。因此一個 token 的路徑只會觸及共享權重以及它被路由到的少數專家,其餘專家對該 token 則處於閒置狀態。 這讓兩個在稠密模型中連動的量得以解耦。容量隨專家數量成長,因為更多專家能儲存更多專門化的知識。運算則只隨活躍專家成長,因為只有它們會對特定 token 進行運算。 兩個數字 設總專家數為 EE、每個 token 活躍 kk 個、單一專家參數為 pp、共享參數為 ss,則總參數與活躍參數為 T=s+E⋅pA=s+k⋅pr=AT\begin{aligned} T &= s + E \cdot p \\ A &= s + k \cdot p \\ r &= \frac{A}{T} \end{aligned}TAr=s+E⋅p=s+k⋅p=TA 其中 TT 是決定記憶體佔用的總參數,AA 是決定每個 token 運算量的活躍參數,rr 則是每個 token 觸及的權重比例。 計算範例 考慮一個模型,有八個各七十億參數的專家,每個 token 路由兩個,再加上十億共享參數: T=1+8×7=57 billionA=1+2×7=15 billionr=1557≈0.263=26.3%\begin{aligned} T &= 1 + 8 \times 7 = 57 \text{ billion} \\ A &= 1 + 2 \times 7 = 15 \text{ billion} \\ r &= \frac{15}{57} \approx 0.263 = 26.3\% \end{aligned}TAr=1+8×7=57 billion=1+2×7=15 billion=5715≈0.263=26.3% 這個模型容納 570 億參數,但每個 token 所花的運算量卻像一個 150 億參數的模型——每次大約有四分之一的權重活躍。這正是其魅力所在:以接近 150 億模型的每 token 成本,獲得 570 億模型的容量。 記憶體仍跟隨總參數 關鍵在於,節省的是運算而非記憶體。由於任一專家都可能被任一 token 選中,而一批 token 又會分散到許多專家,所有專家都必須同時駐留——模型無法預測未來的 token 會需要哪些專家。因此記憶體佔用隨總參數 TT 成長,只有運算量隨活躍參數 AA 成長。專家混合模型因此是「容納成本高、執行成本低」,與同等每 token 成本的稠密模型恰好相反的取捨。 驅動記憶體面的總參數,可以從架構出發用 Transformer 參數量計算機 推算,而實際服務這些權重所需的記憶體,則由 LLM 推論 VRAM 計算器 涵蓋。 常見問題(FAQ)為什麼要使用專家混合?專家混合讓模型能擴大參數量——也就是儲存知識的容量——而不必相應提高每個 token 的運算量。路由器只把每個 token 送往少數幾個專家,因此每個 token 的浮點運算量跟著活躍參數走,而非總參數。這使得訓練與服務一個遠比同等每 token 成本的稠密模型參數量更大的模型成為可能。 總參數與活躍參數有什麼差別?總參數計入模型中的每一個權重:共享層加上所有專家。活躍參數只計入單一 token 所用到的權重:共享層加上路由器選取的少數專家。總參數決定記憶體佔用,因為所有專家都必須隨時可供選取。活躍參數則決定每個 token 的運算量與延遲,因為只有被路由的專家會進行運算。 若每個 token 只跑少數專家,為什麼記憶體會隨總參數成長?任一專家都可能被任一 token 選中,而在一批 token 中往往會用到許多不同的專家,因此所有專家都必須同時駐留在記憶體中。模型無法預先得知未來的 token 會需要哪些專家。結果是記憶體佔用隨總參數成長,即使任一 token 的運算量只隨活躍參數成長。這正是此方法的核心取捨:運算便宜,但完整權重仍須全數容納。 免責聲明 這是一階估計,假設各專家規模一致,並將共享權重視為永遠活躍。它忽略路由不均衡、路由器網路本身,以及跨裝置專家平行化所產生的任何複製。請用它來比較設計方案,而非作為精確的會計依據。 推薦的下一個 Transformer 參數量計算機 以一階架構公式,從層數、隱藏層維度、前饋擴展倍率與詞彙表大小,估算純解碼器(decoder-only)Transformer 的總參數量。 深入了解LLM 推論 VRAM 計算器 根據參數量、權重精度,以及 KV 快取、激活值與碎片化所佔的執行階段開銷,估算為大型語言模型提供推論服務所需的 GPU VRAM。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機 +2 more Show less LLM 推論 VRAM 計算器Transformer 參數量計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 專家混合活躍參數 專家混合模型帶著一對引人注目的數字:一個描述它能容納多少的龐大總參數,以及一個描述它每個 token 做多少工的小得多的活躍參數。這兩者常被混淆,卻回答著不同的問題——一個決定記憶體帳單,另一個決定運算帳單。本計算機依專家數量、top-k 路由、單一專家規模與共享權重,將兩者區分開來。 專家混合如何構成 在稠密的 transformer 中,每個 token 都會經過每一個權重。專家混合把一層的前饋區塊換成許多並列的專家,並加上一個小型路由器,為每個 token 只挑出其中 top-k 個。模型的其餘部分——注意力、路由器、嵌入層,有時還有一個永遠運作的共享專家——對所有 token 維持共用。因此一個 token 的路徑只會觸及共享權重以及它被路由到的少數專家,其餘專家對該 token 則處於閒置狀態。 這讓兩個在稠密模型中連動的量得以解耦。容量隨專家數量成長,因為更多專家能儲存更多專門化的知識。運算則只隨活躍專家成長,因為只有它們會對特定 token 進行運算。 兩個數字 設總專家數為 EE、每個 token 活躍 kk 個、單一專家參數為 pp、共享參數為 ss,則總參數與活躍參數為 T=s+E⋅pA=s+k⋅pr=AT\begin{aligned} T &= s + E \cdot p \\ A &= s + k \cdot p \\ r &= \frac{A}{T} \end{aligned}TAr=s+E⋅p=s+k⋅p=TA 其中 TT 是決定記憶體佔用的總參數,AA 是決定每個 token 運算量的活躍參數,rr 則是每個 token 觸及的權重比例。 計算範例 考慮一個模型,有八個各七十億參數的專家,每個 token 路由兩個,再加上十億共享參數: T=1+8×7=57 billionA=1+2×7=15 billionr=1557≈0.263=26.3%\begin{aligned} T &= 1 + 8 \times 7 = 57 \text{ billion} \\ A &= 1 + 2 \times 7 = 15 \text{ billion} \\ r &= \frac{15}{57} \approx 0.263 = 26.3\% \end{aligned}TAr=1+8×7=57 billion=1+2×7=15 billion=5715≈0.263=26.3% 這個模型容納 570 億參數,但每個 token 所花的運算量卻像一個 150 億參數的模型——每次大約有四分之一的權重活躍。這正是其魅力所在:以接近 150 億模型的每 token 成本,獲得 570 億模型的容量。 記憶體仍跟隨總參數 關鍵在於,節省的是運算而非記憶體。由於任一專家都可能被任一 token 選中,而一批 token 又會分散到許多專家,所有專家都必須同時駐留——模型無法預測未來的 token 會需要哪些專家。因此記憶體佔用隨總參數 TT 成長,只有運算量隨活躍參數 AA 成長。專家混合模型因此是「容納成本高、執行成本低」,與同等每 token 成本的稠密模型恰好相反的取捨。 驅動記憶體面的總參數,可以從架構出發用 Transformer 參數量計算機 推算,而實際服務這些權重所需的記憶體,則由 LLM 推論 VRAM 計算器 涵蓋。 常見問題(FAQ)為什麼要使用專家混合?專家混合讓模型能擴大參數量——也就是儲存知識的容量——而不必相應提高每個 token 的運算量。路由器只把每個 token 送往少數幾個專家,因此每個 token 的浮點運算量跟著活躍參數走,而非總參數。這使得訓練與服務一個遠比同等每 token 成本的稠密模型參數量更大的模型成為可能。 總參數與活躍參數有什麼差別?總參數計入模型中的每一個權重:共享層加上所有專家。活躍參數只計入單一 token 所用到的權重:共享層加上路由器選取的少數專家。總參數決定記憶體佔用,因為所有專家都必須隨時可供選取。活躍參數則決定每個 token 的運算量與延遲,因為只有被路由的專家會進行運算。 若每個 token 只跑少數專家,為什麼記憶體會隨總參數成長?任一專家都可能被任一 token 選中,而在一批 token 中往往會用到許多不同的專家,因此所有專家都必須同時駐留在記憶體中。模型無法預先得知未來的 token 會需要哪些專家。結果是記憶體佔用隨總參數成長,即使任一 token 的運算量只隨活躍參數成長。這正是此方法的核心取捨:運算便宜,但完整權重仍須全數容納。 免責聲明 這是一階估計,假設各專家規模一致,並將共享權重視為永遠活躍。它忽略路由不均衡、路由器網路本身,以及跨裝置專家平行化所產生的任何複製。請用它來比較設計方案,而非作為精確的會計依據。