资源库
评测 Open Source
面向模型与 Agent 能力评测、基准与实验管理的开源项目。
AlpacaEval
tatsu-lab/alpaca_eval
面向指令模型自动评测的开源工具。
BigCode Evaluation Harness
bigcode-project/bigcode-evaluation-harness
面向代码生成模型的基准评测工具。
DeepEval
confident-ai/deepeval
面向 LLM 应用单元测试与评测的开源框架。
Giskard
Giskard-AI/giskard
面向 ML/LLM 质量测试与风险扫描的开源平台。
HELM
stanford-crfm/helm
Stanford CRFM 的整体语言模型评测框架。
Inspect AI
UKGovernmentBEIS/inspect_ai
面向 LLM 评测与实验管理的开源框架。
LightEval
huggingface/lighteval
Hugging Face 轻量级模型评测库。
lm-evaluation-harness
EleutherAI/lm-evaluation-harness
广泛使用的语言模型基准评测工具包。
LMSys Arena Hard Auto
lmarena/arena-hard-auto
基于 Arena 风格的自动化模型评测流水线。
OpenAI Evals
openai/evals
OpenAI 开源的模型评测框架。
OpenCompass
open-compass/opencompass
面向大模型能力评测的开源平台。
Promptfoo
promptfoo/promptfoo
用于提示与模型回归测试的开源评测工具。
RAGAS
explodinggradients/ragas
面向 RAG 流水线质量评测的开源框架。
TruLens
truera/trulens
用于 LLM 应用反馈评估与追踪的开源库。