TodayAI

资源库

Language & Text Datasets

面向语言模型预训练、微调与文本理解的公开数据集。

Alpaca

Stanford

斯坦福发布的指令跟随数据生成项目,常用于轻量指令微调实验。

fine-tuninginstruction
Language & Text

C4

Google

基于 Common Crawl 清洗得到的大规模英文网页文本语料,常用于语言模型预训练。

pretrainingweb-text
Language & Text

Dolma

Allen Institute for AI

Allen Institute 发布的大规模开放文本语料,用于语言模型预训练。

pretrainingweb-text
Language & Text

FineWeb

Hugging Face

经过清洗与去重的大规模网页文本数据集,用于语言模型预训练与研究。

pretrainingweb-textcleaning
Language & TextODC-By

OpenOrca

Open-Orca

面向指令微调的大规模问答与推理对话数据集。

fine-tuninginstruction
Language & Text

OpenWebText

OpenWebText Project

通过公开网页抓取复现 WebText 思路的开源文本语料。

pretrainingweb-text
Language & Text

RedPajama

Together AI

复现 LLaMA 训练数据配方的开源文本数据项目,用于预训练研究。

pretrainingopen-data
Language & Text

RefinedWeb

Technology Innovation Institute

TII 发布的高质量网页文本语料,曾用于 Falcon 模型训练研究。

pretrainingweb-text
Language & Text

SlimPajama

Cerebras

对 RedPajama 进行去重与质量过滤后的大规模文本语料。

pretrainingdeduplication
Language & Text

The Pile

EleutherAI

面向大规模语言模型训练的多源英文文本合集,覆盖网页、书籍、代码与学术内容。

pretrainingmixture
Language & Text

TinyStories

Microsoft Research

由简单词汇生成的短篇故事数据集,用于研究小模型语言能力。

language-modelingsynthetic
Language & Text

WikiText

Salesforce

基于 Wikipedia 优质文章构建的长文本语言建模数据集。

language-modelingwikipedia
Language & Text