> For the complete documentation index, see [llms.txt](https://doc.thordata.com/doc/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.thordata.com/doc/zh/chang-jian-wen-ti/chan-pin-wen-ti/duo-mo-tai-shu-ju-ji/wei-shen-me-ai-mo-xing-xu-yao-duo-mo-tai-xun-lian-shu-ju-er-bu-zhi-shi-wen-ben.md).

# 为什么 AI 模型需要多模态训练数据，而不只是文本？

因为真实世界的信息大多不是纯文本形态：只用单一模态训练的模型无法理解用户实际接触的其他格式，而多模态训练数据能教会模型把"看到的、听到的、读到的"连接起来。

只喂转写文本的 ASR 引擎听不懂口音；视频理解大模型需要的是配好字幕与元数据的视频片段，而不是单纯的文字描述；具身智能体必须把摄像头画面、传感器读数和动作序列关联起来。音频与转写逐字对齐、视频配字幕、图片带 OCR 标注文本——正是这些多模态配对让模型学会跨模态推理，而且模态间的对齐质量比原始数据量更重要。这也是前沿实验室越来越多直接采购"配对好的多模态数据"、而不是把几份单模态数据拼在一起的原因。
