TodayAI

资源库

评测 Open Source

面向模型与 Agent 能力评测、基准与实验管理的开源项目。

AlpacaEval

tatsu-lab/alpaca_eval

面向指令模型自动评测的开源工具。

evaluationbenchmarkllm
评测PythonApache-2.0

BigCode Evaluation Harness

bigcode-project/bigcode-evaluation-harness

面向代码生成模型的基准评测工具。

evaluationcodebenchmark
评测PythonApache-2.0

DeepEval

confident-ai/deepeval

面向 LLM 应用单元测试与评测的开源框架。

evaluationtestingllm
评测PythonApache-2.0

Giskard

Giskard-AI/giskard

面向 ML/LLM 质量测试与风险扫描的开源平台。

evaluationtestingml
评测PythonApache-2.0

HELM

stanford-crfm/helm

Stanford CRFM 的整体语言模型评测框架。

evaluationbenchmarkllm
评测PythonApache-2.0

Inspect AI

UKGovernmentBEIS/inspect_ai

面向 LLM 评测与实验管理的开源框架。

evaluationllmsecurity
评测PythonMIT

LightEval

huggingface/lighteval

Hugging Face 轻量级模型评测库。

evaluationbenchmarkllm
评测PythonMIT

lm-evaluation-harness

EleutherAI/lm-evaluation-harness

广泛使用的语言模型基准评测工具包。

evaluationbenchmarkllm
评测PythonMIT

LMSys Arena Hard Auto

lmarena/arena-hard-auto

基于 Arena 风格的自动化模型评测流水线。

evaluationbenchmarkllm
评测PythonApache-2.0

OpenAI Evals

openai/evals

OpenAI 开源的模型评测框架。

evaluationbenchmarkopenai
评测PythonMIT

OpenCompass

open-compass/opencompass

面向大模型能力评测的开源平台。

evaluationbenchmarkllm
评测PythonApache-2.0

Promptfoo

promptfoo/promptfoo

用于提示与模型回归测试的开源评测工具。

evaluationpromptingtesting
评测TypeScriptMIT

RAGAS

explodinggradients/ragas

面向 RAG 流水线质量评测的开源框架。

evaluationragllm
评测PythonApache-2.0

TruLens

truera/trulens

用于 LLM 应用反馈评估与追踪的开源库。

evaluationobservabilityrag
评测PythonMIT