首頁 ai LoRA 參數計算機 產生日期: 2026年7月20日 下午09:34 LoRA 參數計算機 輸入 層數32每層適配模組數4隱藏層維度4,096LoRA 秩8 AI & LLM LoRA 參數計算機 依層數、每層適配的模組數、隱藏層維度與 LoRA 秩,估算 LoRA 微調所增加的可訓練參數數量,以及所需的最佳化器記憶體。 輸入 模型架構 層數 模型中 transformer 區塊的數量。LoRA 適配器套用在每個區塊內,因此可訓練參數隨此數量線性成長。 每層適配模組數 每個區塊中有多少權重矩陣接受 LoRA 適配器——常見的是四個注意力投影(query、key、value、output),有時也包含前饋矩陣。 隱藏層維度 被適配矩陣的模型維度,假設為方陣,使輸入與輸出寬度相等。每個適配器貢獻兩個「秩乘隱藏層維度」的因子。 LoRA 適配器 LoRA 秩 低秩更新的秩(rank)。每個被適配的矩陣會獲得兩個由秩決定大小的因子,因此可訓練參數隨之線性成長。典型值介於 4 到 64 之間。 結果 輸入數值即可顯示計算結果。 可訓練參數 微調期間更新的參數總數:32 層乘 4 個模組乘兩倍的秩乘隱藏層維度,得到 ...。 詳細資料 可訓練參數(百萬) 同一數字以百萬表示——... 百萬——這也是報告適配器規模時通常引用的數字。 最佳化器記憶體 以混合精度 Adam 每個可訓練參數約 16 位元組估算的最佳化器與主權重狀態:... MB。此處不含凍結的基礎模型與激活值。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 LoRA 參數 低秩適配(Low-Rank Adaptation,LoRA)是在有限預算下微調大型語言模型最常見的方法。它不更新每一個權重,而是凍結基礎模型,並在每個被適配的權重矩陣旁訓練一對小型低秩矩陣。其結果幾乎與完整微調一樣,卻只觸及極小一部分參數。本計算機依模型形狀與適配器的秩,估算這一部分相當於多少參數,以及需要多少最佳化器記憶體。 LoRA 如何縮小可訓練集合 一個 transformer 權重矩陣把一個隱藏向量映射到另一個,因此對方陣層而言,它約含 d×dd \times d 個值。對所有值進行微調代價高昂:最佳化器必須為每一個值儲存梯度與運行統計量。LoRA 把這個稠密更新換成兩個窄矩陣的乘積——一個形狀為 d×rd \times r、一個為 r×dr \times d,其中秩 rr 遠小於 dd。基礎權重始終不動,只有這兩個因子被訓練,推論時它們的乘積再加回原矩陣。 由於每個被適配矩陣貢獻 r⋅(din+dout)r \cdot (d_{\text{in}} + d_{\text{out}}) 個可訓練值——在輸入與輸出寬度相等時為 2rdmodel2 r d_{\text{model}}——可訓練集合通常遠低於整個模型的百分之一。這正是 LoRA 能在單一加速器上實作的原因。 公式 設層數為 LL、每層適配模組數為 mm、秩為 rr、隱藏層維度為 dd,可訓練參數數量為 P=L⋅m⋅2⋅r⋅dP = L \cdot m \cdot 2 \cdot r \cdot dP=L⋅m⋅2⋅r⋅d 混合精度 Adam 對每個可訓練參數約保留十六位元組的最佳化器與主權重狀態——32 位元的主副本,加上第一與第二動量估計——因此以百萬位元組(MB)計的最佳化器記憶體為 M=16 P106M = \frac{16\,P}{10^6}M=10616P 這只計入適配器狀態。凍結的基礎模型仍佔用記憶體存放其權重,但它不需要梯度或最佳化器狀態,節省正是來自於此。 計算範例 取一個 32 層的模型,在每層適配四個注意力投影,秩為 8,隱藏層維度為 4096: P=32×4×2×8×4096=8 388 608P = 32 \times 4 \times 2 \times 8 \times 4096 = 8\,388\,608P=32×4×2×8×4096=8388608 這約為 839 萬個可訓練參數。最佳化器狀態為 M=16×8 388 608106≈134.2 MBM = \frac{16 \times 8\,388\,608}{10^6} \approx 134.2\ \text{MB}M=10616×8388608≈134.2 MB 對一個七十億參數的基礎模型而言,這 839 萬個適配器約為整體的千分之一——卻足以讓模型專門化以勝任許多下游任務。 選擇秩與模組 秩是主要的容量旋鈕。秩 4 到 8 常用於輕量的任務適配;16 到 64 在目標任務遠離基礎模型的訓練範圍時提供更多空間。秩加倍會同時讓可訓練參數與最佳化器記憶體加倍,因此只有在較低的秩欠擬合時才值得提高。「每層適配模組數」這個輸入反映哪些矩陣接受適配器:只取 query 與 value 為兩個,完整注意力區塊為四個,若納入前饋矩陣則更多。 若要將適配器與完整模型的規模相比較,請見 Transformer 參數量計算機。若要估算包含凍結權重與激活值在內的整個訓練執行的記憶體,請見 LLM 訓練 VRAM 計算機。 常見問題(FAQ)LoRA 的秩控制什麼?秩設定加到每個被適配權重矩陣上的低秩更新的維度。較高的秩讓適配器有更多容量去捕捉與基礎模型的差異,代價是更多可訓練參數與最佳化器記憶體,兩者皆隨秩線性成長。較低的秩較小且較快,但對較難的任務可能欠擬合。多數微調使用 4 到 64 之間的秩,8 或 16 是常見的起點;最佳值取決於目標任務與基礎模型的差距有多大。 LoRA 微調比完整微調小多少?LoRA 只訓練低秩適配器並凍結基礎權重,因此可訓練集合通常遠低於整個模型的百分之一。一個七十億參數的模型以適中的秩適配,往往只有數百萬個可訓練參數。由於最佳化器狀態隨可訓練參數而非總參數成長,記憶體節省相當可觀。用於比較的完整模型規模,可用 parameter-count-from-architecture 計算機估算。 通常會適配哪些模組?最常見的選擇是注意力投影矩陣——query、key、value 與 output——對應每層四個模組。有些做法只適配 query 與 value 投影(兩個模組),另一些則加入前饋矩陣以獲得更廣的覆蓋,代價是更高的參數量。請將「每層適配模組數」設定為符合你的設定所針對的矩陣。 免責聲明 此估計假設被適配的矩陣為方陣,並只計入 LoRA 因子及其混合精度 Adam 最佳化器狀態(每個參數約 16 位元組)。它不含凍結的基礎模型、激活值、非適配器參數的梯度,以及任何偏置或嵌入層調整。請將其視為規劃用的數字,而非精確的記憶體會計。 推薦的下一個 LLM 訓練 VRAM 計算機 依參數量、最佳化器選擇與激活值記憶體,搭配混合精度 Adam 每參數 16 bytes 的經驗法則,估算完整微調大型語言模型所需的 GPU VRAM。 深入了解Transformer 參數量計算機 以一階架構公式,從層數、隱藏層維度、前饋擴展倍率與詞彙表大小,估算純解碼器(decoder-only)Transformer 的總參數量。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算LoRA 參數計算機 +6 more Show less 算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 LoRA 參數 低秩適配(Low-Rank Adaptation,LoRA)是在有限預算下微調大型語言模型最常見的方法。它不更新每一個權重,而是凍結基礎模型,並在每個被適配的權重矩陣旁訓練一對小型低秩矩陣。其結果幾乎與完整微調一樣,卻只觸及極小一部分參數。本計算機依模型形狀與適配器的秩,估算這一部分相當於多少參數,以及需要多少最佳化器記憶體。 LoRA 如何縮小可訓練集合 一個 transformer 權重矩陣把一個隱藏向量映射到另一個,因此對方陣層而言,它約含 d×dd \times d 個值。對所有值進行微調代價高昂:最佳化器必須為每一個值儲存梯度與運行統計量。LoRA 把這個稠密更新換成兩個窄矩陣的乘積——一個形狀為 d×rd \times r、一個為 r×dr \times d,其中秩 rr 遠小於 dd。基礎權重始終不動,只有這兩個因子被訓練,推論時它們的乘積再加回原矩陣。 由於每個被適配矩陣貢獻 r⋅(din+dout)r \cdot (d_{\text{in}} + d_{\text{out}}) 個可訓練值——在輸入與輸出寬度相等時為 2rdmodel2 r d_{\text{model}}——可訓練集合通常遠低於整個模型的百分之一。這正是 LoRA 能在單一加速器上實作的原因。 公式 設層數為 LL、每層適配模組數為 mm、秩為 rr、隱藏層維度為 dd,可訓練參數數量為 P=L⋅m⋅2⋅r⋅dP = L \cdot m \cdot 2 \cdot r \cdot dP=L⋅m⋅2⋅r⋅d 混合精度 Adam 對每個可訓練參數約保留十六位元組的最佳化器與主權重狀態——32 位元的主副本,加上第一與第二動量估計——因此以百萬位元組(MB)計的最佳化器記憶體為 M=16 P106M = \frac{16\,P}{10^6}M=10616P 這只計入適配器狀態。凍結的基礎模型仍佔用記憶體存放其權重,但它不需要梯度或最佳化器狀態,節省正是來自於此。 計算範例 取一個 32 層的模型,在每層適配四個注意力投影,秩為 8,隱藏層維度為 4096: P=32×4×2×8×4096=8 388 608P = 32 \times 4 \times 2 \times 8 \times 4096 = 8\,388\,608P=32×4×2×8×4096=8388608 這約為 839 萬個可訓練參數。最佳化器狀態為 M=16×8 388 608106≈134.2 MBM = \frac{16 \times 8\,388\,608}{10^6} \approx 134.2\ \text{MB}M=10616×8388608≈134.2 MB 對一個七十億參數的基礎模型而言,這 839 萬個適配器約為整體的千分之一——卻足以讓模型專門化以勝任許多下游任務。 選擇秩與模組 秩是主要的容量旋鈕。秩 4 到 8 常用於輕量的任務適配;16 到 64 在目標任務遠離基礎模型的訓練範圍時提供更多空間。秩加倍會同時讓可訓練參數與最佳化器記憶體加倍,因此只有在較低的秩欠擬合時才值得提高。「每層適配模組數」這個輸入反映哪些矩陣接受適配器:只取 query 與 value 為兩個,完整注意力區塊為四個,若納入前饋矩陣則更多。 若要將適配器與完整模型的規模相比較,請見 Transformer 參數量計算機。若要估算包含凍結權重與激活值在內的整個訓練執行的記憶體,請見 LLM 訓練 VRAM 計算機。 常見問題(FAQ)LoRA 的秩控制什麼?秩設定加到每個被適配權重矩陣上的低秩更新的維度。較高的秩讓適配器有更多容量去捕捉與基礎模型的差異,代價是更多可訓練參數與最佳化器記憶體,兩者皆隨秩線性成長。較低的秩較小且較快,但對較難的任務可能欠擬合。多數微調使用 4 到 64 之間的秩,8 或 16 是常見的起點;最佳值取決於目標任務與基礎模型的差距有多大。 LoRA 微調比完整微調小多少?LoRA 只訓練低秩適配器並凍結基礎權重,因此可訓練集合通常遠低於整個模型的百分之一。一個七十億參數的模型以適中的秩適配,往往只有數百萬個可訓練參數。由於最佳化器狀態隨可訓練參數而非總參數成長,記憶體節省相當可觀。用於比較的完整模型規模,可用 parameter-count-from-architecture 計算機估算。 通常會適配哪些模組?最常見的選擇是注意力投影矩陣——query、key、value 與 output——對應每層四個模組。有些做法只適配 query 與 value 投影(兩個模組),另一些則加入前饋矩陣以獲得更廣的覆蓋,代價是更高的參數量。請將「每層適配模組數」設定為符合你的設定所針對的矩陣。 免責聲明 此估計假設被適配的矩陣為方陣,並只計入 LoRA 因子及其混合精度 Adam 最佳化器狀態(每個參數約 16 位元組)。它不含凍結的基礎模型、激活值、非適配器參數的梯度,以及任何偏置或嵌入層調整。請將其視為規劃用的數字,而非精確的記憶體會計。