模型量化(Quantization)是什麼?
模型量化是把模型權重等數值從 32 位元浮點數改用 int8、int4 等低精度格式表示,以減少記憶體與運算量的技術。依 Hugging Face 文件,int8 相較 float32 約可讓模型縮小 4 倍,代價是可能略微降低準確度。
模型技術Quantization量化int8 量化4-bit 量化
一句話說明
把模型裡的數字改用較少位元儲存,讓模型變小、跑得更快的壓縮技術。
模型量化怎麼運作?
- 找出模型權重數值的分布範圍
- 用比例與零點把浮點數對應到整數範圍(例如 -128 到 127)
- 以低精度格式儲存並進行推論運算
- 必要時用量化感知訓練減少準確度損失
實際例子
- 把大型語言模型量化成 4 位元,讓一般電腦也跑得動
- Google 研究人員 2017 年提出只用整數運算的量化推論方法,用於手機
常見誤解
誤解:量化一定會讓模型變很笨
事實:適度量化通常只帶來小幅準確度下降,但位元數壓得越低,風險越高
事實:適度量化通常只帶來小幅準確度下降,但位元數壓得越低,風險越高
常見問題
模型量化後為什麼能在筆電上執行?
量化降低了每個參數佔用的位元數,模型需要的記憶體大幅減少,例如 int8 約為 float32 的四分之一,讓記憶體有限的設備也能載入。
訓練後量化和量化感知訓練差在哪裡?
訓練後量化(PTQ)是模型訓練完才轉換,簡單快速;量化感知訓練(QAT)在訓練時就模擬量化效果,通常能保留較好的準確度。
相關名詞
參考來源
- Hugging Face Transformers:Quantization concepts
- arXiv:Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference(Jacob et al., 2017)
查核日期:2026-09-26。API:/api/term?id=quantization