AI 與科技名詞白話解釋

模型蒸餾(Knowledge Distillation)是什麼?

模型蒸餾是讓較小的「學生模型」學習較大「老師模型」的輸出,以較低成本保留大部分能力的技術。這個方法由 Geoffrey Hinton、Oriol Vinyals 與 Jeff Dean 在 2015 年的論文中系統化提出。

模型技術Distillation知識蒸餾Knowledge Distillation模型蒸餾

一句話說明

讓小模型模仿大模型的輸出來學習,把大模型的能力「濃縮」到小模型裡。

模型蒸餾怎麼運作?

  1. 先準備一個表現好但運算昂貴的老師模型
  2. 讓老師模型對大量資料產生預測結果
  3. 訓練較小的學生模型去模仿老師的輸出
  4. 得到體積較小、執行較快的學生模型

實際例子

常見誤解

誤解:蒸餾就是把大模型直接切小
事實:蒸餾是重新訓練一個小模型去學習大模型的行為,不是直接刪減大模型

常見問題

模型蒸餾和模型量化有什麼不同?

蒸餾是訓練一個新的小模型去學大模型;量化則是把同一個模型的數字改用較低精度儲存。兩者都能讓模型變輕,也常一起使用。

蒸餾後的小模型會跟大模型一樣強嗎?

通常會保留相當比例的能力,但在困難或廣泛的任務上多半仍有差距,實際效果要看任務與訓練方式。

相關名詞

模型量化、小型語言模型、開放權重模型

參考來源

查核日期:2026-09-26。API:/api/term?id=distillation