💡為什麼 AI 模型需要多模態訓練數據,而不只是文字?
因為真實世界的資訊大多不是純文字形態:只用單一模態訓練的模型無法理解用戶實際接觸的其他格式,而多模態訓練數據能教會模型把「看到的、聽到的、讀到的」連接起來。
只餵逐字稿的 ASR 引擎聽不懂口音;影片理解大型語言模型需要的是配好字幕與元資料的影片片段,而不是單純的文字描述;具身智慧代理必須把攝影機畫面、感測器讀數和動作序列關聯起來。音訊與逐字稿逐字對齊、影片配字幕、影像帶 OCR 標註文字——正是這些多模態配對讓模型學會跨模態推理,而且模態間的對齊品質比原始數據量更重要。這也是前沿實驗室越來越多直接採購「配對好的多模態數據」、而不是把幾份單一模態數據拼在一起的原因。
Last updated