模型蒸餾(Knowledge Distillation)是什麼?
模型蒸餾是讓較小的「學生模型」學習較大「老師模型」的輸出,以較低成本保留大部分能力的技術。這個方法由 Geoffrey Hinton、Oriol Vinyals 與 Jeff Dean 在 2015 年的論文中系統化提出。
模型技術Distillation知識蒸餾Knowledge Distillation模型蒸餾
一句話說明
讓小模型模仿大模型的輸出來學習,把大模型的能力「濃縮」到小模型裡。
模型蒸餾怎麼運作?
- 先準備一個表現好但運算昂貴的老師模型
- 讓老師模型對大量資料產生預測結果
- 訓練較小的學生模型去模仿老師的輸出
- 得到體積較小、執行較快的學生模型
實際例子
- 把大型語言模型的能力蒸餾成可在手機上執行的小模型
- 原始論文把多個模型組成的集成模型能力壓縮到單一模型
常見誤解
誤解:蒸餾就是把大模型直接切小
事實:蒸餾是重新訓練一個小模型去學習大模型的行為,不是直接刪減大模型
事實:蒸餾是重新訓練一個小模型去學習大模型的行為,不是直接刪減大模型
常見問題
模型蒸餾和模型量化有什麼不同?
蒸餾是訓練一個新的小模型去學大模型;量化則是把同一個模型的數字改用較低精度儲存。兩者都能讓模型變輕,也常一起使用。
蒸餾後的小模型會跟大模型一樣強嗎?
通常會保留相當比例的能力,但在困難或廣泛的任務上多半仍有差距,實際效果要看任務與訓練方式。
相關名詞
參考來源
查核日期:2026-09-26。API:/api/term?id=distillation