💡什麼是多模態數據集?
多模態數據集是指將兩種或兩種以上資料型態(如文字、影像、音訊、影片)組合在一起、且各模態之間保持對齊關係的結構化數據集合,用於訓練能夠同時理解多種輸入格式的 AI 模型。
與單一模態數據集不同,多模態數據集還原了資訊在真實世界中的呈現方式。一段影片配上它的字幕逐字稿、一段音訊與其文字逐字對齊、一張影像連結它的描述文字——這些都是多模態配對。它們是訓練當今最先進 AI 系統的基礎:語音辨識引擎、影片理解大型語言模型、視覺語言模型,以及需要同時「看、聽、行動」的具身智慧代理。決定模型跨模態推理能力的,不只是資料的原始規模,更是各模態之間對齊的品質。
Last updated