> For the complete documentation index, see [llms.txt](https://doc.thordata.com/doc/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.thordata.com/doc/zh-hk/chang-jian-wen-ti/chan-pin-wen-ti/duo-mo-tai-shu-ju-ji/shen-mo-shi-duo-mo-tai-shu-ju-ji.md).

# 什麼是多模態數據集？

多模態數據集是指將兩種或兩種以上資料型態（如文字、影像、音訊、影片）組合在一起、且各模態之間保持對齊關係的結構化數據集合，用於訓練能夠同時理解多種輸入格式的 AI 模型。

與單一模態數據集不同，多模態數據集還原了資訊在真實世界中的呈現方式。一段影片配上它的字幕逐字稿、一段音訊與其文字逐字對齊、一張影像連結它的描述文字——這些都是多模態配對。它們是訓練當今最先進 AI 系統的基礎：語音辨識引擎、影片理解大型語言模型、視覺語言模型，以及需要同時「看、聽、行動」的具身智慧代理。決定模型跨模態推理能力的，不只是資料的原始規模，更是各模態之間對齊的品質。
