资源库
Evaluation
用于评估 LLM、RAG 与 Agent 质量的评测框架与工具。
Braintrust Eval
Braintrust
Braintrust 官方评测文档,覆盖 LLM 应用评估工作流。
DeepEval
Confident AI
面向 LLM 应用的单元测试式评测框架。
EvalPlus
EvalPlus
增强代码生成评测的开源工具,扩展 HumanEval / MBPP 测试覆盖。
Giskard
Giskard
面向机器学习与 LLM 应用的开源测试与质量保障框架。
HELM
Stanford CRFM
斯坦福 CRFM 开源的全面语言模型评测框架。
Inspect AI
UK AISI
UK AISI 开源的 LLM 评测框架,支持大规模实验编排。
LangSmith Evaluation
LangChain
LangSmith 官方评测文档,用于数据集、实验与评分流程。
LightEval
Hugging Face
Hugging Face 开源的轻量 LLM 评测库。
lm-evaluation-harness
EleutherAI
EleutherAI 开源的通用语言模型评测工具箱。
MT-Bench Framework
LMSYS
LMSYS FastChat 仓库,包含 MT-Bench 等对话模型评测能力。
OpenAI Evals
OpenAI
OpenAI 开源的模型评测框架,用于定义与运行评估任务。
OpenCompass
OpenCompass
面向大模型的开源评测平台,覆盖多任务基准与工具链。
Phoenix Evals
Arize
Arize Phoenix 官方 LLM 评测文档与评估能力说明。
Promptfoo
Promptfoo
用于提示词测试、回归与红队评估的开源工具。
Ragas
Exploding Gradients
用于评估 RAG 系统质量的开源评测框架。
TruLens
TruEra
用于评估与追踪 LLM 应用的开源框架。