For the complete documentation index, see llms.txt. This page is also available as Markdown.

💡什么是多模态数据集?

多模态数据集是指将两种或两种以上数据类型(如文本、图片、音频、视频)组合在一起、且各模态之间保持对齐关系的结构化数据集合,用于训练能够同时理解多种输入格式的 AI 模型。

与单模态数据集不同,多模态数据集还原了信息在真实世界中的呈现方式。一段视频配上它的字幕转写、一条音频与其文本逐字对齐、一张图片关联它的描述文字——这些都是多模态配对。它们是训练当今最先进 AI 系统的基础:语音识别引擎、视频理解大模型、视觉语言模型,以及需要同时"看、听、行动"的具身智能体。决定模型跨模态推理能力的,不只是数据的原始规模,更是各模态之间对齐的质量。

Last updated