由於記憶體與每權重的位元數直接成正比,量化是最直接的手段:16 bit 到 8 bit 把權重記憶體減半,8 bit 到 4 bit 再減半,通常只伴隨溫和且可接受的輸出品質損失。當連量化後的模型都超過單一加速器時,可選方案是把權重跨多張 GPU 分片,或把部分模型卸載到系統記憶體,但後者會付出很高的速度代價。估算一個模型需要多少加速器,由 GPU 數量需求計算機 處理。請把這裡的數值視為規劃用的估算,並以實際的服務執行加以驗證,因為框架、上下文長度與批次大小都會改變真正的數字。
記憶體與每權重的位元數直接成正比,因此從 16 bit 降到 8 bit 會把權重記憶體減半,降到 4 bit 則減為四分之一。一個 13 十億參數的模型在 16 bit 下約需 26 GB 權重,但在 8 bit 下只需 13 GB,在 4 bit 下約 6.5 GB(皆未計入開銷)。較低的精度讓較大的模型得以放進較小的卡,而在 8 bit 與 4 bit 下,輸出品質的損失通常溫和且可接受。