TodayAI

资源库

Datasets

精选用于 AI 与机器学习训练、评测和研究的公开数据集。

ADE20K

MIT CSAIL

面向场景解析与语义分割的大规模标注图像数据集。

segmentationscene-parsing
Vision

Alpaca

Stanford

斯坦福发布的指令跟随数据生成项目,常用于轻量指令微调实验。

fine-tuninginstruction
Language & Text

AlphaFold Protein Structure Database

DeepMind / EMBL-EBI

DeepMind 与 EMBL-EBI 提供的大规模蛋白质结构预测数据库。

protein-structurebiology
Science

Amazon Product Reviews

UCSD / Julian McAuley

亚马逊商品评论与元数据集合,常用于推荐与文本分析。

reviewsrecommendation
Recommendation

APPS

UC Berkeley

覆盖入门到竞赛难度的 Python 编程题代码生成数据集。

code-generationbenchmark
Code

ARC

Allen Institute for AI

面向科学问答的 AI2 Reasoning Challenge 数据集。

reasoningqabenchmark
Reasoning & Math

AudioSet

Google

Google 发布的大规模声音事件标注数据集。

audio-classificationsound-events
Audio & Speech

BBH

Google / Stanford 等

从 BIG-bench 中筛选出的高难度子集,用于挑战性推理评测。

benchmarkreasoning
Benchmarks

BEIR

UKP Lab / BEIR

异构信息检索基准套件,覆盖多种检索任务与领域。

retrievalbenchmark
Search & Retrieval

BIG-bench

Google

由社区贡献的大规模语言模型能力评测任务集合。

benchmarkevaluation
Benchmarks

BridgeData V2

UC Berkeley RAIL

面向真实机器人操作学习的多任务演示数据集。

manipulationimitation-learning
Robotics

C4

Google

基于 Common Crawl 清洗得到的大规模英文网页文本语料,常用于语言模型预训练。

pretrainingweb-text
Language & Text

CC100

Facebook AI / statmt

覆盖上百种语言的 Common Crawl 单语语料集合。

multilingualpretraining
Chinese & Multilingual

ChEMBL

EMBL-EBI

人工整理的生物活性分子数据库,用于药物发现研究。

drug-discoverychemistry
Science

CIFAR-10

University of Toronto

包含 10 类小尺寸彩色图像的经典图像分类数据集。

classificationbenchmark
Vision

CIFAR-100

University of Toronto

包含 100 类小尺寸彩色图像的经典图像分类数据集。

classificationbenchmark
Vision

Cityscapes

Cityscapes

面向自动驾驶场景理解的城市街景语义分割数据集。

segmentationautonomous-driving
Vision

CLUE

CLUE Benchmark

中文语言理解评测基准,覆盖分类、推理与阅读理解等任务。

chinesebenchmarknlu
Chinese & Multilingual

CMRC 2018

HIT / iFLYTEK 等

中文抽取式阅读理解数据集。

chinesereading-comprehension
Chinese & Multilingual

COCO

COCO Consortium

面向目标检测、分割与图像描述的大规模视觉数据集。

object-detectionsegmentationcaptioning
Vision

CodeSearchNet

GitHub

面向代码检索与注释对齐的多语言代码数据集。

code-retrievaldocumentation
Code

Common Voice

Mozilla

Mozilla 发起的多语言众包语音数据集,用于语音识别研究。

speech-recognitionmultilingual
Audio & SpeechCC0

CommonsenseQA

Tel Aviv University / Allen AI

基于 ConceptNet 构建的常识问答数据集。

commonsenseqa
Reasoning & Math

Conceptual Captions

Google

Google 发布的大规模图文配对数据集,用于图像描述与视觉语言预训练。

image-textcaptioning
Multimodal

Criteo 1TB Click Logs

Criteo

面向点击率预估研究的大规模广告点击日志数据集。

ctrads
Recommendation

Dolma

Allen Institute for AI

Allen Institute 发布的大规模开放文本语料,用于语言模型预训练。

pretrainingweb-text
Language & Text

DROID

DROID Collaboration

大规模分布式真实机器人操作数据集。

manipulationrobot-learning
Robotics

DROP

Allen Institute for AI

需要离散推理与数值运算的阅读理解数据集。

reading-comprehensionnumerical-reasoning
Reasoning & Math

DS-1000

University of Hong Kong / others

面向数据科学库使用的 Python 代码生成基准。

code-generationdata-science
Code

DuReader

Baidu

百度发布的大规模中文开放域问答与阅读理解数据集。

chineseqareading-comprehension
Chinese & Multilingual

Ego4D

Ego4D Consortium

大规模第一人称视频数据集,覆盖日常活动理解与具身感知。

egocentric-videovideo-understanding
Multimodal

ESC-50

Karol J. Piczak

包含 50 类环境声音的音频分类基准数据集。

audio-classificationbenchmark
Audio & Speech

Fashion-MNIST

Zalando Research

以服饰图像替代手写数字的图像分类基准数据集。

classificationbenchmark
Vision

FineWeb

Hugging Face

经过清洗与去重的大规模网页文本数据集,用于语言模型预训练与研究。

pretrainingweb-textcleaning
Language & TextODC-By

Flickr30k

University of Illinois

为图像配有多条英文描述的经典图文数据集。

captioningimage-text
Multimodal

FLORES

Meta AI

面向低资源机器翻译评测的多语言平行语料基准。

machine-translationmultilingualbenchmark
Chinese & Multilingual

GigaSpeech

SpeechColab

面向大规模英语语音识别训练的多领域语音语料。

speech-recognitionasr
Audio & Speech

GLUE

GLUE

经典英语自然语言理解任务合集基准。

benchmarknlu
Benchmarks

GPQA

NYU / Anthropic 等

面向研究生级别科学问题的高难度问答基准。

science-qabenchmark
Reasoning & Math

GSM8K

OpenAI

面向小学数学应用题的语言模型推理基准。

mathreasoningbenchmark
Reasoning & Math

HellaSwag

Allen Institute for AI / UW

测试常识推理与情境补全能力的对抗性基准。

commonsensebenchmark
Reasoning & Math

HELM

Stanford CRFM

斯坦福 CRFM 提出的语言模型全面评测框架与场景集合。

benchmarkevaluation
Benchmarks

HotpotQA

Carnegie Mellon University 等

需要多文档推理的多跳问答基准。

multi-hopqabenchmark
Search & Retrieval

HumanEval

OpenAI

用于评估代码生成模型 Python 编程能力的测试数据集。

code-generationbenchmark
CodeMIT

ImageNet

ImageNet

大规模图像分类基准数据集,广泛用于视觉模型训练与评测。

classificationbenchmark
Vision

LAION-5B

LAION

包含数十亿图文对的开放数据集,广泛用于多模态与视觉表示学习。

image-textpretraining
Vision

Libri-Light

Meta AI

面向半监督与无监督语音表示学习的大规模英语语音语料。

speech-recognitionself-supervised
Audio & Speech

LibriSpeech

OpenSLR

基于公开有声读物构建的英语语音识别数据集。

speech-recognitionasr
Audio & Speech

LiveCodeBench

LiveCodeBench

持续更新的代码生成污染感知评测基准。

benchmarkcode-generation
Benchmarks

LVIS

Facebook AI Research

面向长尾类别目标检测与实例分割的大规模视觉数据集。

object-detectioninstance-segmentation
Vision

ManiSkill

UC San Diego 等

面向机器人操作技能学习的仿真基准与数据平台。

simulationmanipulation
Robotics

Materials Project

Lawrence Berkeley National Laboratory

开放材料性质数据库,用于材料科学与机器学习研究。

materialsscience
Science

MATH

UC Berkeley

覆盖竞赛级数学题的语言模型推理评测数据集。

mathreasoningbenchmark
Reasoning & Math

MBPP

Google Research

面向 Python 基础编程题的代码生成基准数据集。

code-generationbenchmark
Code

mC4

Google

C4 的多语言扩展,用于多语言语言模型预训练。

multilingualpretraining
Chinese & Multilingual

MIRACL

University of Waterloo 等

多语言信息检索基准,覆盖多种语言的检索评测。

retrievalmultilingual
Search & Retrieval

MMLU

UC Berkeley

覆盖多学科知识问答的大规模语言模型评测基准。

benchmarkknowledgeqa
Benchmarks

MMLU-Pro

TIGER-Lab

在 MMLU 基础上提高难度与选项质量的增强版知识评测基准。

benchmarkknowledgereasoning
Benchmarks

MNIST

NYU / Yann LeCun

手写数字识别的经典基准数据集。

classificationbenchmark
Vision

MovieLens

GroupLens / University of Minnesota

经典电影评分数据集,广泛用于推荐系统研究。

collaborative-filteringratings
Recommendation

MS MARCO

Microsoft

面向检索与阅读理解的大规模真实搜索问答数据集。

retrievalqaranking
Search & Retrieval

MSR-VTT

Microsoft Research

面向视频描述与检索的经典视频文本数据集。

video-textretrieval
Multimodal

MT-Bench

LMSYS

面向多轮对话能力的指令模型评测基准。

benchmarkchatevaluation
Benchmarks

Multilingual LibriSpeech

OpenSLR / Facebook AI

基于有声读物构建的多语言语音识别数据集。

speech-recognitionmultilingual
Audio & Speech

Natural Questions

Google

来自真实 Google 搜索查询的开放域问答数据集。

open-domain-qaretrieval
Search & Retrieval

OK-VQA

Allen Institute for AI

需要外部知识才能回答的视觉问答基准数据集。

visual-qaknowledge
Multimodal

Open Images

Google

Google 发布的大规模带标注图像数据集,覆盖检测、分割与关系标注。

object-detectionsegmentation
Vision

Open X-Embodiment

Open X-Embodiment Collaboration

汇集多机构机器人操作轨迹的开放具身数据集。

robot-learningmanipulation
Robotics

OpenOrca

Open-Orca

面向指令微调的大规模问答与推理对话数据集。

fine-tuninginstruction
Language & Text

OpenWebText

OpenWebText Project

通过公开网页抓取复现 WebText 思路的开源文本语料。

pretrainingweb-text
Language & Text

OSCAR

OSCAR Project

基于 Common Crawl 构建的大规模多语言网页文本语料。

multilingualpretrainingweb-text
Chinese & Multilingual

PASCAL VOC

University of Oxford

面向目标检测与语义分割的经典视觉挑战数据集。

object-detectionsegmentation
Vision

PubMed

NIH / NLM

生物医学文献索引库,常作为科学 NLP 与检索语料来源。

biomedicalliterature
Science

QM9

Quantum Machine

包含小分子量子化学性质的经典分子机器学习数据集。

moleculeschemistry
Science

RedPajama

Together AI

复现 LLaMA 训练数据配方的开源文本数据项目,用于预训练研究。

pretrainingopen-data
Language & Text

RefinedWeb

Technology Innovation Institute

TII 发布的高质量网页文本语料,曾用于 Falcon 模型训练研究。

pretrainingweb-text
Language & Text

ScienceQA

UCLA / Allen AI 等

覆盖多学科科学问题的多模态问答数据集,含图文讲解。

visual-qareasoningeducation
Multimodal

SlimPajama

Cerebras

对 RedPajama 进行去重与质量过滤后的大规模文本语料。

pretrainingdeduplication
Language & Text

Speech Commands

Google

面向关键词识别的短语音指令数据集。

keyword-spottingclassification
Audio & Speech

SQuAD

Stanford

基于 Wikipedia 段落的抽取式阅读理解基准。

reading-comprehensionqabenchmark
Search & Retrieval

StrategyQA

Allen Institute for AI

需要隐式多跳推理策略才能回答的是非问答数据集。

multi-hopreasoning
Reasoning & Math

SuperGLUE

SuperGLUE

比 GLUE 更难的英语自然语言理解评测基准。

benchmarknlu
Benchmarks

SWE-bench

Princeton / SWE-bench

基于真实 GitHub issue 评估软件工程修复能力的基准。

software-engineeringbenchmark
Code

TextVQA

Facebook AI Research

需要读取图像中文字才能回答问题的视觉问答数据集。

visual-qaocr
Multimodal

The Pile

EleutherAI

面向大规模语言模型训练的多源英文文本合集,覆盖网页、书籍、代码与学术内容。

pretrainingmixture
Language & Text

The Stack

BigCode

BigCode 发布的大规模多语言源代码数据集,用于代码模型预训练。

pretrainingsource-code
Codeother

The Stack v2

BigCode

The Stack 的升级版本,提供更大规模与更高质量的代码预训练语料。

pretrainingsource-code
Code

TinyStories

Microsoft Research

由简单词汇生成的短篇故事数据集,用于研究小模型语言能力。

language-modelingsynthetic
Language & Text

TriviaQA

University of Washington

结合网页与 Wikipedia 证据的开放域问答数据集。

open-domain-qaretrieval
Search & Retrieval

TruthfulQA

Oxford / OpenAI 等

用于评估模型回答真实性与抗误导能力的问答基准。

benchmarktruthfulnessqa
Benchmarks

Visual Genome

University of Washington

带有物体、属性和关系标注的视觉场景理解数据集。

scene-graphvisual-reasoning
Vision

VoxCeleb

University of Oxford

面向说话人识别与验证的大规模名人语音数据集。

speaker-recognitionverification
Audio & Speech

VQA v2

VisualQA

面向视觉问答的标准基准,要求模型结合图像回答自然语言问题。

visual-qabenchmark
Multimodal

WebVid

University of Oxford / others

大规模视频-文本配对数据集,用于视频语言预训练。

video-textpretraining
Multimodal

WikiMatrix

Meta AI

从 Wikipedia 挖掘得到的大规模多语言平行句对语料。

machine-translationparallel-corpora
Chinese & Multilingual

WikiText

Salesforce

基于 Wikipedia 优质文章构建的长文本语言建模数据集。

language-modelingwikipedia
Language & Text

WinoGrande

Allen Institute for AI

大规模 Winograd 风格常识推理基准。

commonsensebenchmark
Reasoning & Math

XTREME

Google Research

跨语言理解与生成任务的多语言评测基准。

multilingualbenchmarknlu
Chinese & Multilingual

Yelp Open Dataset

Yelp

包含商户、评论与用户互动的公开推荐与文本分析数据集。

reviewsrecommendation
Recommendation