资源库
Benchmark Datasets
面向模型能力评测的公开基准数据集。
BBH
Google / Stanford 等
从 BIG-bench 中筛选出的高难度子集,用于挑战性推理评测。
benchmarkreasoning
Benchmarks
BIG-bench
由社区贡献的大规模语言模型能力评测任务集合。
benchmarkevaluation
Benchmarks
GLUE
GLUE
经典英语自然语言理解任务合集基准。
benchmarknlu
Benchmarks
HELM
Stanford CRFM
斯坦福 CRFM 提出的语言模型全面评测框架与场景集合。
benchmarkevaluation
Benchmarks
LiveCodeBench
LiveCodeBench
持续更新的代码生成污染感知评测基准。
benchmarkcode-generation
Benchmarks
MMLU
UC Berkeley
覆盖多学科知识问答的大规模语言模型评测基准。
benchmarkknowledgeqa
Benchmarks
MMLU-Pro
TIGER-Lab
在 MMLU 基础上提高难度与选项质量的增强版知识评测基准。
benchmarkknowledgereasoning
Benchmarks
MT-Bench
LMSYS
面向多轮对话能力的指令模型评测基准。
benchmarkchatevaluation
Benchmarks
SuperGLUE
SuperGLUE
比 GLUE 更难的英语自然语言理解评测基准。
benchmarknlu
Benchmarks
TruthfulQA
Oxford / OpenAI 等
用于评估模型回答真实性与抗误导能力的问答基准。
benchmarktruthfulnessqa
Benchmarks