AI 與科技名詞白話解釋

大型語言模型(Large Language Model (LLM))是什麼?

大型語言模型(LLM)是用海量文字訓練、透過預測下一個詞元來理解與產生文字的大型神經網路。2020 年 OpenAI 發表的 GPT-3 有 1,750 億個參數,展示了只給幾個範例就能完成新任務的能力。目前主流 LLM 多採用 Transformer 架構。

基礎概念LLMLarge Language Model大語言模型語言模型大模型

一句話說明

用大量文字資料訓練、能理解與產生自然語言的超大型 AI 模型,是 ChatGPT 等聊天 AI 的核心。

大型語言模型怎麼運作?

  1. 收集大量公開文字、書籍、程式碼等資料,切成詞元(Token)。
  2. 預訓練:讓模型反覆練習「猜下一個詞元」,學會語言規律與知識。
  3. 再用人工示範與回饋調整,讓模型更會遵循指令、回答更有幫助。
  4. 使用時,模型根據輸入逐一產生詞元,組成完整回答。

實際例子

常見誤解

誤解:LLM 像資料庫一樣把資料存起來再查詢。
事實:LLM 是從資料中學到統計規律,回答是「生成」出來的,不是查表,所以可能出錯。
誤解:參數越多的模型一定越好用。
事實:訓練方法也很關鍵;OpenAI 2022 年研究顯示,經人類回饋調整的 13 億參數模型,回答比 1,750 億參數的 GPT-3 更受人偏好。

常見問題

大型語言模型的「大」是指什麼?

主要指參數數量與訓練資料量都非常大。參數是模型內部可調整的數值,數量可達數十億到上兆;訓練資料則常是數千億個詞元以上的文字。

大型語言模型會不會自己上網查資料?

模型本身只根據訓練時學到的內容回答,有知識截止日期。要取得最新資訊,需要由應用程式提供搜尋工具或用 RAG 把資料放進上下文。

大型語言模型和生成式 AI 是同一件事嗎?

不完全相同。生成式 AI 泛指能產生文字、圖片、聲音、影片的 AI;大型語言模型是其中專門處理語言的一類,也是目前最常見的生成式 AI。

延伸閱讀

相關名詞

Transformer 架構、詞元、生成式 AI、微調、上下文視窗

參考來源

查核日期:2026-09-26。API:/api/term?id=llm