> For the complete documentation index, see [llms.txt](https://doc.thordata.com/doc/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.thordata.com/doc/zh-hk/chang-jian-wen-ti/chan-pin-wen-ti/duo-mo-tai-shu-ju-ji/wei-shen-mo-ai-mo-xing-xu-yao-duo-mo-tai-xun-lian-shu-ju-er-bu-zhi-shi-wen-zi.md).

# 為什麼 AI 模型需要多模態訓練數據，而不只是文字？

因為真實世界的資訊大多不是純文字形態：只用單一模態訓練的模型無法理解用戶實際接觸的其他格式，而多模態訓練數據能教會模型把「看到的、聽到的、讀到的」連接起來。

只餵逐字稿的 ASR 引擎聽不懂口音；影片理解大型語言模型需要的是配好字幕與元資料的影片片段，而不是單純的文字描述；具身智慧代理必須把攝影機畫面、感測器讀數和動作序列關聯起來。音訊與逐字稿逐字對齊、影片配字幕、影像帶 OCR 標註文字——正是這些多模態配對讓模型學會跨模態推理，而且模態間的對齊品質比原始數據量更重要。這也是前沿實驗室越來越多直接採購「配對好的多模態數據」、而不是把幾份單一模態數據拼在一起的原因。
