资源库
Language & Text Datasets
面向语言模型预训练、微调与文本理解的公开数据集。
Alpaca
Stanford
斯坦福发布的指令跟随数据生成项目,常用于轻量指令微调实验。
fine-tuninginstruction
Language & Text
C4
基于 Common Crawl 清洗得到的大规模英文网页文本语料,常用于语言模型预训练。
pretrainingweb-text
Language & Text
Dolma
Allen Institute for AI
Allen Institute 发布的大规模开放文本语料,用于语言模型预训练。
pretrainingweb-text
Language & Text
FineWeb
Hugging Face
经过清洗与去重的大规模网页文本数据集,用于语言模型预训练与研究。
pretrainingweb-textcleaning
Language & TextODC-By
OpenOrca
Open-Orca
面向指令微调的大规模问答与推理对话数据集。
fine-tuninginstruction
Language & Text
OpenWebText
OpenWebText Project
通过公开网页抓取复现 WebText 思路的开源文本语料。
pretrainingweb-text
Language & Text
RedPajama
Together AI
复现 LLaMA 训练数据配方的开源文本数据项目,用于预训练研究。
pretrainingopen-data
Language & Text
RefinedWeb
Technology Innovation Institute
TII 发布的高质量网页文本语料,曾用于 Falcon 模型训练研究。
pretrainingweb-text
Language & Text
SlimPajama
Cerebras
对 RedPajama 进行去重与质量过滤后的大规模文本语料。
pretrainingdeduplication
Language & Text
The Pile
EleutherAI
面向大规模语言模型训练的多源英文文本合集,覆盖网页、书籍、代码与学术内容。
pretrainingmixture
Language & Text
TinyStories
Microsoft Research
由简单词汇生成的短篇故事数据集,用于研究小模型语言能力。
language-modelingsynthetic
Language & Text
WikiText
Salesforce
基于 Wikipedia 优质文章构建的长文本语言建模数据集。
language-modelingwikipedia
Language & Text