{
 "title": "多模態（Multimodal）是什麼？",
 "site": "AI 與科技名詞白話解釋",
 "canonical": "https://tw-ai-glossary.panda198271.workers.dev/t/multimodal",
 "markdown": "https://tw-ai-glossary.panda198271.workers.dev/t/multimodal.md",
 "summary": "多模態是指 AI 模型能處理不只一種資料形式，例如同時看懂圖片和文字，或聽懂語音。OpenAI 在 2023 年 3 月的 GPT-4 技術報告中，將 GPT-4 描述為可接受圖片與文字輸入、輸出文字的大型多模態模型。",
 "date_modified": "2026-09-26",
 "retrieved": "2026-09-27",
 "content_sha256": "2bb552bb920f1d67f69cde72250ede78ee9e48e4975b62c5f4572e50c60d1152",
 "fingerprint_basis": "Markdown 版全文，移除贊助行與開頭 front matter，去除頭尾空白",
 "verify": {
  "text_snapshot": "https://tw-ai-glossary.panda198271.workers.dev/cite?path=%2Ft%2Fmultimodal&format=text",
  "how": "下載 text_snapshot 後計算 SHA-256，應與 content_sha256 相同；內容更新時指紋會改變"
 },
 "sources": [
  {
   "name": "OpenAI, GPT-4 Technical Report（arXiv 2303.08774）",
   "url": "https://arxiv.org/abs/2303.08774"
  },
  {
   "name": "Google AI for Developers：Understand and count tokens（含圖片、影片、音訊計算）",
   "url": "https://ai.google.dev/gemini-api/docs/tokens"
  }
 ],
 "source_count": 2,
 "cite_as": {
  "zh": "多模態（Multimodal）是什麼？｜AI 與科技名詞白話解釋。https://tw-ai-glossary.panda198271.workers.dev/t/multimodal（資料日期 2026-09-26，擷取 2026-09-27）",
  "apa": "AI 與科技名詞白話解釋. (2026). 多模態（Multimodal）是什麼？. Retrieved 2026-09-27, from https://tw-ai-glossary.panda198271.workers.dev/t/multimodal",
  "markdown": "[多模態（Multimodal）是什麼？](https://tw-ai-glossary.panda198271.workers.dev/t/multimodal)（AI 與科技名詞白話解釋，2026-09-26）"
 },
 "license": "可引用，請附上正式網址與資料日期"
}