首頁 ai 量化模型大小計算器 產生日期: 2026年7月20日 下午09:34 量化模型大小計算器 輸入 參數量7量化FP16 / BF16(16 bit) AI & LLM 量化模型大小計算器 根據參數量與量化位元寬度,估算大型語言模型在磁碟與記憶體中的大小,同時以十進位 GB 與二進位 GiB 兩種單位呈現。 輸入 模型 參數量 以十億為單位的模型參數量。權重檔大小與參數量直接成正比,因此在相同精度下,參數量加倍的模型大小也大約加倍。 量化 FP16 / BF16 16 bit 用來儲存每個權重的位元數。全精度為 32 bit;常見格式會逐步將大小減半,4 bit 量化只用 FP32 八分之一的空間來儲存一個參數。 結果 輸入數值即可顯示計算結果。 大小(GB) 以十進位 GB 表示的權重檔估算大小:7 十億參數乘以 FP16 / BF16(16 bit) bit,再除以八將位元換算為位元組,約為 ... GB。 詳細資料 大小(GiB) 同樣的大小以二進位 GiB 表示,這是多數作業系統與 GPU 工具採用的單位。... GB 約等於 ... GiB。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 量化模型大小 大型語言模型在磁碟上的大小,幾乎完全取決於它有多少參數,以及每個參數用多少位元儲存。一個權重就是一個數字,而一個模型就是一長串這樣的數字,因此把參數量乘以每權重的位元寬度,再換算成位元組,就能得到相當接近的檔案大小估算,也就是載入它所需的記憶體量。這個計算器把參數量與量化格式轉換成十進位 GB 與二進位 GiB 兩種數值。 公式 當參數量為 NN(以十億計),每參數位元寬度為 bb 時,以十進位 GB 表示的權重大小為 S=N⋅b8S = \frac{N \cdot b}{8}S=8N⋅b 除以八是把位元換算為位元組。由於十億位元組剛好是一個十進位 GB,將 NN 以十億表示時,結果便會直接以 GB 呈現。同樣的量以二進位 GiB(多數作業系統與 GPU 工具顯示的單位)表示則為 G=S⋅1091073741824G = S \cdot \frac{10^9}{1073741824}G=S⋅1073741824109 因為一個 GiB 是 230=1,073,741,8242^{30} = 1{,}073{,}741{,}824 位元組。 計算範例 考慮一個 7 十億參數的模型,以每權重 16 bit 儲存,也就是多數模型發布時採用的標準半精度格式: S=7×168=14 GB,G=14×1091073741824≈13.04 GiBS = \frac{7 \times 16}{8} = 14\ \text{GB}, \qquad G = 14 \times \frac{10^9}{1073741824} \approx 13.04\ \text{GiB}S=87×16=14 GB,G=14×1073741824109≈13.04 GiB 因此這些權重在磁碟上約佔 14 GB,記憶體工具會回報約 13 GiB。把同一個模型量化到 4 bit,每個權重只佔四分之一的空間,檔案會降到約 3.5 GB。 選擇精度 全 32 bit 精度主要用於訓練。在部署時,16 bit 是常見的參考標準,而 8 bit 與 4 bit 量化則以一些精度換取一半或四分之一的佔用空間。INT4 這類低位元格式,正是讓數百億參數的模型得以塞進單一張消費級 GPU 的關鍵。這裡的大小估算只涵蓋權重;執行模型還需要空間給激活值與 key-value 快取,這部分由 LLM 推論 VRAM 計算器 處理。若要把大小換算成在特定連線下的傳輸時間,請參考 模型下載時間計算器。 常見問題(FAQ)模型應該採用哪種位元寬度?大多數模型以 16 bit(FP16 或 BF16)訓練與發布,這通常是參考用的標準大小。若要在較小的硬體上執行,8 bit 與 4 bit 量化可分別將佔用空間縮減為一半與四分之一,但會犧牲一些精度。 INT4 很適合把較大的模型塞進消費級 GPU,而 FP32 主要用於訓練,或在需要最高數值保真度時使用。正確的選擇取決於可用的記憶體大小,以及對品質損失的容忍程度。 GB 與 GiB 有什麼差別?GB(gigabyte)是十億位元組,而 GiB(gibibyte)是 2^30,即 1,073,741,824 位元組,約大 7.4%。儲存裝置廠商與下載大小通常使用十進位 GB,但作業系統、GPU 記憶體工具與許多模型載入器則回報二進位 GiB。因此同一個檔案以 GiB 表示時數字會略小於 GB,這也是這裡同時列出兩個數值的原因。 量化會降低模型品質嗎?降低精度會捨棄部分數值細節,因此可能降低準確度,但影響往往很小。現代的 8 bit 量化在推論時通常近乎無損,而 GPTQ、AWQ 等 4 bit 方法在許多模型上能保留大部分品質,同時把記憶體縮減為四分之一。 位元寬度極低與小型模型通常會退化得較明顯。這裡的大小估算與量化方法無關,只有精度上的取捨會有所不同。 免責聲明 此估算只計算權重的儲存空間。實際的檔案與記憶體用量還包含 embedding、量化中繼資料、激活緩衝區,以及推論時的 key-value 快取,因此實際的磁碟與 GPU 用量可能略高於這裡顯示的數值。 推薦的下一個 LLM 推論 VRAM 計算器 根據參數量、權重精度,以及 KV 快取、激活值與碎片化所佔的執行階段開銷,估算為大型語言模型提供推論服務所需的 GPU VRAM。 深入了解模型下載時間計算器 根據參數量、量化位元寬度與網路頻寬,估算下載大型語言模型需要多久,以分鐘與小時呈現,並附上權重大小。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機 +2 more Show less LLM 推論 VRAM 計算器Transformer 參數量計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算學習率暖身計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 量化模型大小 大型語言模型在磁碟上的大小,幾乎完全取決於它有多少參數,以及每個參數用多少位元儲存。一個權重就是一個數字,而一個模型就是一長串這樣的數字,因此把參數量乘以每權重的位元寬度,再換算成位元組,就能得到相當接近的檔案大小估算,也就是載入它所需的記憶體量。這個計算器把參數量與量化格式轉換成十進位 GB 與二進位 GiB 兩種數值。 公式 當參數量為 NN(以十億計),每參數位元寬度為 bb 時,以十進位 GB 表示的權重大小為 S=N⋅b8S = \frac{N \cdot b}{8}S=8N⋅b 除以八是把位元換算為位元組。由於十億位元組剛好是一個十進位 GB,將 NN 以十億表示時,結果便會直接以 GB 呈現。同樣的量以二進位 GiB(多數作業系統與 GPU 工具顯示的單位)表示則為 G=S⋅1091073741824G = S \cdot \frac{10^9}{1073741824}G=S⋅1073741824109 因為一個 GiB 是 230=1,073,741,8242^{30} = 1{,}073{,}741{,}824 位元組。 計算範例 考慮一個 7 十億參數的模型,以每權重 16 bit 儲存,也就是多數模型發布時採用的標準半精度格式: S=7×168=14 GB,G=14×1091073741824≈13.04 GiBS = \frac{7 \times 16}{8} = 14\ \text{GB}, \qquad G = 14 \times \frac{10^9}{1073741824} \approx 13.04\ \text{GiB}S=87×16=14 GB,G=14×1073741824109≈13.04 GiB 因此這些權重在磁碟上約佔 14 GB,記憶體工具會回報約 13 GiB。把同一個模型量化到 4 bit,每個權重只佔四分之一的空間,檔案會降到約 3.5 GB。 選擇精度 全 32 bit 精度主要用於訓練。在部署時,16 bit 是常見的參考標準,而 8 bit 與 4 bit 量化則以一些精度換取一半或四分之一的佔用空間。INT4 這類低位元格式,正是讓數百億參數的模型得以塞進單一張消費級 GPU 的關鍵。這裡的大小估算只涵蓋權重;執行模型還需要空間給激活值與 key-value 快取,這部分由 LLM 推論 VRAM 計算器 處理。若要把大小換算成在特定連線下的傳輸時間,請參考 模型下載時間計算器。 常見問題(FAQ)模型應該採用哪種位元寬度?大多數模型以 16 bit(FP16 或 BF16)訓練與發布,這通常是參考用的標準大小。若要在較小的硬體上執行,8 bit 與 4 bit 量化可分別將佔用空間縮減為一半與四分之一,但會犧牲一些精度。 INT4 很適合把較大的模型塞進消費級 GPU,而 FP32 主要用於訓練,或在需要最高數值保真度時使用。正確的選擇取決於可用的記憶體大小,以及對品質損失的容忍程度。 GB 與 GiB 有什麼差別?GB(gigabyte)是十億位元組,而 GiB(gibibyte)是 2^30,即 1,073,741,824 位元組,約大 7.4%。儲存裝置廠商與下載大小通常使用十進位 GB,但作業系統、GPU 記憶體工具與許多模型載入器則回報二進位 GiB。因此同一個檔案以 GiB 表示時數字會略小於 GB,這也是這裡同時列出兩個數值的原因。 量化會降低模型品質嗎?降低精度會捨棄部分數值細節,因此可能降低準確度,但影響往往很小。現代的 8 bit 量化在推論時通常近乎無損,而 GPTQ、AWQ 等 4 bit 方法在許多模型上能保留大部分品質,同時把記憶體縮減為四分之一。 位元寬度極低與小型模型通常會退化得較明顯。這裡的大小估算與量化方法無關,只有精度上的取捨會有所不同。 免責聲明 此估算只計算權重的儲存空間。實際的檔案與記憶體用量還包含 embedding、量化中繼資料、激活緩衝區,以及推論時的 key-value 快取,因此實際的磁碟與 GPU 用量可能略高於這裡顯示的數值。