TodayAI

资源库

Evaluation

用于评估 LLM、RAG 与 Agent 质量的评测框架与工具。

Braintrust Eval

Braintrust

Braintrust 官方评测文档,覆盖 LLM 应用评估工作流。

evaluationdocs
Evaluation

DeepEval

Confident AI

面向 LLM 应用的单元测试式评测框架。

evaluationtestingllm
Evaluation

EvalPlus

EvalPlus

增强代码生成评测的开源工具,扩展 HumanEval / MBPP 测试覆盖。

evaluationcodebenchmark
Evaluation

Giskard

Giskard

面向机器学习与 LLM 应用的开源测试与质量保障框架。

evaluationtestingllm
Evaluation

HELM

Stanford CRFM

斯坦福 CRFM 开源的全面语言模型评测框架。

evaluationbenchmarkllm
Evaluation

Inspect AI

UK AISI

UK AISI 开源的 LLM 评测框架,支持大规模实验编排。

evaluationframeworkllm
Evaluation

LangSmith Evaluation

LangChain

LangSmith 官方评测文档,用于数据集、实验与评分流程。

evaluationdocslangchain
Evaluation

LightEval

Hugging Face

Hugging Face 开源的轻量 LLM 评测库。

evaluationllm
Evaluation

lm-evaluation-harness

EleutherAI

EleutherAI 开源的通用语言模型评测工具箱。

evaluationbenchmarkllm
Evaluation

MT-Bench Framework

LMSYS

LMSYS FastChat 仓库,包含 MT-Bench 等对话模型评测能力。

evaluationchatbenchmark
Evaluation

OpenAI Evals

OpenAI

OpenAI 开源的模型评测框架,用于定义与运行评估任务。

evaluationframeworkllm
Evaluation

OpenCompass

OpenCompass

面向大模型的开源评测平台,覆盖多任务基准与工具链。

evaluationbenchmarkllm
Evaluation

Phoenix Evals

Arize

Arize Phoenix 官方 LLM 评测文档与评估能力说明。

evaluationobservability
Evaluation

Promptfoo

Promptfoo

用于提示词测试、回归与红队评估的开源工具。

evaluationprompttesting
Evaluation

Ragas

Exploding Gradients

用于评估 RAG 系统质量的开源评测框架。

evaluationrag
Evaluation

TruLens

TruEra

用于评估与追踪 LLM 应用的开源框架。

evaluationobservabilityllm
Evaluation