资源库
Multimodal Datasets
面向图文、视频等多模态学习的公开数据集。
Conceptual Captions
Google 发布的大规模图文配对数据集,用于图像描述与视觉语言预训练。
image-textcaptioning
Multimodal
Ego4D
Ego4D Consortium
大规模第一人称视频数据集,覆盖日常活动理解与具身感知。
egocentric-videovideo-understanding
Multimodal
Flickr30k
University of Illinois
为图像配有多条英文描述的经典图文数据集。
captioningimage-text
Multimodal
MSR-VTT
Microsoft Research
面向视频描述与检索的经典视频文本数据集。
video-textretrieval
Multimodal
OK-VQA
Allen Institute for AI
需要外部知识才能回答的视觉问答基准数据集。
visual-qaknowledge
Multimodal
ScienceQA
UCLA / Allen AI 等
覆盖多学科科学问题的多模态问答数据集,含图文讲解。
visual-qareasoningeducation
Multimodal
TextVQA
Facebook AI Research
需要读取图像中文字才能回答问题的视觉问答数据集。
visual-qaocr
Multimodal
VQA v2
VisualQA
面向视觉问答的标准基准,要求模型结合图像回答自然语言问题。
visual-qabenchmark
Multimodal
WebVid
University of Oxford / others
大规模视频-文本配对数据集,用于视频语言预训练。
video-textpretraining
Multimodal