💡为什么 AI 模型需要多模态训练数据,而不只是文本?
因为真实世界的信息大多不是纯文本形态:只用单一模态训练的模型无法理解用户实际接触的其他格式,而多模态训练数据能教会模型把"看到的、听到的、读到的"连接起来。
只喂转写文本的 ASR 引擎听不懂口音;视频理解大模型需要的是配好字幕与元数据的视频片段,而不是单纯的文字描述;具身智能体必须把摄像头画面、传感器读数和动作序列关联起来。音频与转写逐字对齐、视频配字幕、图片带 OCR 标注文本——正是这些多模态配对让模型学会跨模态推理,而且模态间的对齐质量比原始数据量更重要。这也是前沿实验室越来越多直接采购"配对好的多模态数据"、而不是把几份单模态数据拼在一起的原因。
Last updated