多模態(Multimodal)是什麼?
多模態是指 AI 模型能處理不只一種資料形式,例如同時看懂圖片和文字,或聽懂語音。OpenAI 在 2023 年 3 月的 GPT-4 技術報告中,將 GPT-4 描述為可接受圖片與文字輸入、輸出文字的大型多模態模型。
模型技術Multimodal多模態 AI多模態模型Multimodal AI多模式
一句話說明
能同時理解或產生文字、圖片、聲音、影片等多種資料形式的 AI 能力。
多模態怎麼運作?
- 不同形式的資料(文字、圖片、聲音)各自被轉換成模型能處理的 token 或向量。
- 模型在訓練時學習不同形式資料之間的對應關係。
- 使用時可混合輸入,例如一張照片加一句問題。
- 模型綜合各種資訊後輸出文字、圖片或語音。
實際例子
- 拍一張冰箱照片,請 AI 建議可以煮什麼。
- 上傳圖表截圖,請 AI 解讀其中趨勢。
- 用語音跟 AI 對話,並即時得到語音回覆。
常見誤解
誤解:多模態就是把幾個不同的 AI 工具串起來。
事實:有些系統是串接,但多模態模型通常是在同一個模型中一起理解多種資料。
事實:有些系統是串接,但多模態模型通常是在同一個模型中一起理解多種資料。
誤解:多模態模型一定什麼格式都能輸入和輸出。
事實:每個模型支援的輸入與輸出形式不同,例如有的能看圖但只能輸出文字。
事實:每個模型支援的輸入與輸出形式不同,例如有的能看圖但只能輸出文字。
常見問題
多模態模型是怎麼處理圖片的?
圖片會被切成小區塊並轉成 token,和文字一起送進模型。例如 Gemini 文件說明,大圖片會切成 768×768 像素的區塊,每塊計為 258 個 token。
多模態 AI 和一般聊天 AI 有什麼不同?
一般聊天 AI 只處理文字;多模態 AI 還能理解圖片、聲音或影片,因此能做看圖回答、語音對話、分析截圖等任務。
相關名詞
大型語言模型、生成式 AI、詞元、Transformer 架構
參考來源
- OpenAI, GPT-4 Technical Report(arXiv 2303.08774)
- Google AI for Developers:Understand and count tokens(含圖片、影片、音訊計算)
查核日期:2026-09-26。API:/api/term?id=multimodal