> For the complete documentation index, see [llms.txt](https://doc.thordata.com/doc/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.thordata.com/doc/zh/chang-jian-wen-ti/chan-pin-wen-ti/duo-mo-tai-shu-ju-ji/shen-me-shi-duo-mo-tai-shu-ju-ji.md).

# 什么是多模态数据集？

多模态数据集是指将两种或两种以上数据类型（如文本、图片、音频、视频）组合在一起、且各模态之间保持对齐关系的结构化数据集合，用于训练能够同时理解多种输入格式的 AI 模型。

与单模态数据集不同，多模态数据集还原了信息在真实世界中的呈现方式。一段视频配上它的字幕转写、一条音频与其文本逐字对齐、一张图片关联它的描述文字——这些都是多模态配对。它们是训练当今最先进 AI 系统的基础：语音识别引擎、视频理解大模型、视觉语言模型，以及需要同时"看、听、行动"的具身智能体。决定模型跨模态推理能力的，不只是数据的原始规模，更是各模态之间对齐的质量。
