资源库
Chinese & Multilingual Datasets
面向中文与多语言场景的公开数据集。
CC100
Facebook AI / statmt
覆盖上百种语言的 Common Crawl 单语语料集合。
multilingualpretraining
Chinese & Multilingual
CLUE
CLUE Benchmark
中文语言理解评测基准,覆盖分类、推理与阅读理解等任务。
chinesebenchmarknlu
Chinese & Multilingual
CMRC 2018
HIT / iFLYTEK 等
中文抽取式阅读理解数据集。
chinesereading-comprehension
Chinese & Multilingual
DuReader
Baidu
百度发布的大规模中文开放域问答与阅读理解数据集。
chineseqareading-comprehension
Chinese & Multilingual
FLORES
Meta AI
面向低资源机器翻译评测的多语言平行语料基准。
machine-translationmultilingualbenchmark
Chinese & Multilingual
mC4
C4 的多语言扩展,用于多语言语言模型预训练。
multilingualpretraining
Chinese & Multilingual
OSCAR
OSCAR Project
基于 Common Crawl 构建的大规模多语言网页文本语料。
multilingualpretrainingweb-text
Chinese & Multilingual
WikiMatrix
Meta AI
从 Wikipedia 挖掘得到的大规模多语言平行句对语料。
machine-translationparallel-corpora
Chinese & Multilingual
XTREME
Google Research
跨语言理解与生成任务的多语言评测基准。
multilingualbenchmarknlu
Chinese & Multilingual