资源库
Datasets
精选用于 AI 与机器学习训练、评测和研究的公开数据集。
ADE20K
MIT CSAIL
面向场景解析与语义分割的大规模标注图像数据集。
Alpaca
Stanford
斯坦福发布的指令跟随数据生成项目,常用于轻量指令微调实验。
AlphaFold Protein Structure Database
DeepMind / EMBL-EBI
DeepMind 与 EMBL-EBI 提供的大规模蛋白质结构预测数据库。
Amazon Product Reviews
UCSD / Julian McAuley
亚马逊商品评论与元数据集合,常用于推荐与文本分析。
APPS
UC Berkeley
覆盖入门到竞赛难度的 Python 编程题代码生成数据集。
ARC
Allen Institute for AI
面向科学问答的 AI2 Reasoning Challenge 数据集。
AudioSet
Google 发布的大规模声音事件标注数据集。
BBH
Google / Stanford 等
从 BIG-bench 中筛选出的高难度子集,用于挑战性推理评测。
BEIR
UKP Lab / BEIR
异构信息检索基准套件,覆盖多种检索任务与领域。
BIG-bench
由社区贡献的大规模语言模型能力评测任务集合。
BridgeData V2
UC Berkeley RAIL
面向真实机器人操作学习的多任务演示数据集。
C4
基于 Common Crawl 清洗得到的大规模英文网页文本语料,常用于语言模型预训练。
CC100
Facebook AI / statmt
覆盖上百种语言的 Common Crawl 单语语料集合。
ChEMBL
EMBL-EBI
人工整理的生物活性分子数据库,用于药物发现研究。
CIFAR-10
University of Toronto
包含 10 类小尺寸彩色图像的经典图像分类数据集。
CIFAR-100
University of Toronto
包含 100 类小尺寸彩色图像的经典图像分类数据集。
Cityscapes
Cityscapes
面向自动驾驶场景理解的城市街景语义分割数据集。
CLUE
CLUE Benchmark
中文语言理解评测基准,覆盖分类、推理与阅读理解等任务。
CMRC 2018
HIT / iFLYTEK 等
中文抽取式阅读理解数据集。
COCO
COCO Consortium
面向目标检测、分割与图像描述的大规模视觉数据集。
CodeSearchNet
GitHub
面向代码检索与注释对齐的多语言代码数据集。
Common Voice
Mozilla
Mozilla 发起的多语言众包语音数据集,用于语音识别研究。
CommonsenseQA
Tel Aviv University / Allen AI
基于 ConceptNet 构建的常识问答数据集。
Conceptual Captions
Google 发布的大规模图文配对数据集,用于图像描述与视觉语言预训练。
Criteo 1TB Click Logs
Criteo
面向点击率预估研究的大规模广告点击日志数据集。
Dolma
Allen Institute for AI
Allen Institute 发布的大规模开放文本语料,用于语言模型预训练。
DROID
DROID Collaboration
大规模分布式真实机器人操作数据集。
DROP
Allen Institute for AI
需要离散推理与数值运算的阅读理解数据集。
DS-1000
University of Hong Kong / others
面向数据科学库使用的 Python 代码生成基准。
DuReader
Baidu
百度发布的大规模中文开放域问答与阅读理解数据集。
Ego4D
Ego4D Consortium
大规模第一人称视频数据集,覆盖日常活动理解与具身感知。
ESC-50
Karol J. Piczak
包含 50 类环境声音的音频分类基准数据集。
Fashion-MNIST
Zalando Research
以服饰图像替代手写数字的图像分类基准数据集。
FineWeb
Hugging Face
经过清洗与去重的大规模网页文本数据集,用于语言模型预训练与研究。
Flickr30k
University of Illinois
为图像配有多条英文描述的经典图文数据集。
FLORES
Meta AI
面向低资源机器翻译评测的多语言平行语料基准。
GigaSpeech
SpeechColab
面向大规模英语语音识别训练的多领域语音语料。
GLUE
GLUE
经典英语自然语言理解任务合集基准。
GPQA
NYU / Anthropic 等
面向研究生级别科学问题的高难度问答基准。
GSM8K
OpenAI
面向小学数学应用题的语言模型推理基准。
HellaSwag
Allen Institute for AI / UW
测试常识推理与情境补全能力的对抗性基准。
HELM
Stanford CRFM
斯坦福 CRFM 提出的语言模型全面评测框架与场景集合。
HotpotQA
Carnegie Mellon University 等
需要多文档推理的多跳问答基准。
HumanEval
OpenAI
用于评估代码生成模型 Python 编程能力的测试数据集。
ImageNet
ImageNet
大规模图像分类基准数据集,广泛用于视觉模型训练与评测。
LAION-5B
LAION
包含数十亿图文对的开放数据集,广泛用于多模态与视觉表示学习。
Libri-Light
Meta AI
面向半监督与无监督语音表示学习的大规模英语语音语料。
LibriSpeech
OpenSLR
基于公开有声读物构建的英语语音识别数据集。
LiveCodeBench
LiveCodeBench
持续更新的代码生成污染感知评测基准。
LVIS
Facebook AI Research
面向长尾类别目标检测与实例分割的大规模视觉数据集。
ManiSkill
UC San Diego 等
面向机器人操作技能学习的仿真基准与数据平台。
Materials Project
Lawrence Berkeley National Laboratory
开放材料性质数据库,用于材料科学与机器学习研究。
MATH
UC Berkeley
覆盖竞赛级数学题的语言模型推理评测数据集。
MBPP
Google Research
面向 Python 基础编程题的代码生成基准数据集。
mC4
C4 的多语言扩展,用于多语言语言模型预训练。
MIRACL
University of Waterloo 等
多语言信息检索基准,覆盖多种语言的检索评测。
MMLU
UC Berkeley
覆盖多学科知识问答的大规模语言模型评测基准。
MMLU-Pro
TIGER-Lab
在 MMLU 基础上提高难度与选项质量的增强版知识评测基准。
MNIST
NYU / Yann LeCun
手写数字识别的经典基准数据集。
MovieLens
GroupLens / University of Minnesota
经典电影评分数据集,广泛用于推荐系统研究。
MS MARCO
Microsoft
面向检索与阅读理解的大规模真实搜索问答数据集。
MSR-VTT
Microsoft Research
面向视频描述与检索的经典视频文本数据集。
MT-Bench
LMSYS
面向多轮对话能力的指令模型评测基准。
Multilingual LibriSpeech
OpenSLR / Facebook AI
基于有声读物构建的多语言语音识别数据集。
Natural Questions
来自真实 Google 搜索查询的开放域问答数据集。
OK-VQA
Allen Institute for AI
需要外部知识才能回答的视觉问答基准数据集。
Open Images
Google 发布的大规模带标注图像数据集,覆盖检测、分割与关系标注。
Open X-Embodiment
Open X-Embodiment Collaboration
汇集多机构机器人操作轨迹的开放具身数据集。
OpenOrca
Open-Orca
面向指令微调的大规模问答与推理对话数据集。
OpenWebText
OpenWebText Project
通过公开网页抓取复现 WebText 思路的开源文本语料。
OSCAR
OSCAR Project
基于 Common Crawl 构建的大规模多语言网页文本语料。
PASCAL VOC
University of Oxford
面向目标检测与语义分割的经典视觉挑战数据集。
PubMed
NIH / NLM
生物医学文献索引库,常作为科学 NLP 与检索语料来源。
QM9
Quantum Machine
包含小分子量子化学性质的经典分子机器学习数据集。
RedPajama
Together AI
复现 LLaMA 训练数据配方的开源文本数据项目,用于预训练研究。
RefinedWeb
Technology Innovation Institute
TII 发布的高质量网页文本语料,曾用于 Falcon 模型训练研究。
ScienceQA
UCLA / Allen AI 等
覆盖多学科科学问题的多模态问答数据集,含图文讲解。
SlimPajama
Cerebras
对 RedPajama 进行去重与质量过滤后的大规模文本语料。
Speech Commands
面向关键词识别的短语音指令数据集。
SQuAD
Stanford
基于 Wikipedia 段落的抽取式阅读理解基准。
StrategyQA
Allen Institute for AI
需要隐式多跳推理策略才能回答的是非问答数据集。
SuperGLUE
SuperGLUE
比 GLUE 更难的英语自然语言理解评测基准。
SWE-bench
Princeton / SWE-bench
基于真实 GitHub issue 评估软件工程修复能力的基准。
TextVQA
Facebook AI Research
需要读取图像中文字才能回答问题的视觉问答数据集。
The Pile
EleutherAI
面向大规模语言模型训练的多源英文文本合集,覆盖网页、书籍、代码与学术内容。
The Stack
BigCode
BigCode 发布的大规模多语言源代码数据集,用于代码模型预训练。
The Stack v2
BigCode
The Stack 的升级版本,提供更大规模与更高质量的代码预训练语料。
TinyStories
Microsoft Research
由简单词汇生成的短篇故事数据集,用于研究小模型语言能力。
TriviaQA
University of Washington
结合网页与 Wikipedia 证据的开放域问答数据集。
TruthfulQA
Oxford / OpenAI 等
用于评估模型回答真实性与抗误导能力的问答基准。
Visual Genome
University of Washington
带有物体、属性和关系标注的视觉场景理解数据集。
VoxCeleb
University of Oxford
面向说话人识别与验证的大规模名人语音数据集。
VQA v2
VisualQA
面向视觉问答的标准基准,要求模型结合图像回答自然语言问题。
WebVid
University of Oxford / others
大规模视频-文本配对数据集,用于视频语言预训练。
WikiMatrix
Meta AI
从 Wikipedia 挖掘得到的大规模多语言平行句对语料。
WikiText
Salesforce
基于 Wikipedia 优质文章构建的长文本语言建模数据集。
WinoGrande
Allen Institute for AI
大规模 Winograd 风格常识推理基准。
XTREME
Google Research
跨语言理解与生成任务的多语言评测基准。
Yelp Open Dataset
Yelp
包含商户、评论与用户互动的公开推荐与文本分析数据集。