TodayAI

资源库

评测与安全 Papers

面向评测基准、幻觉、安全与可解释性的研究论文。

Arena-Hard-Auto: An Automatic LLM Evaluation Pipeline for Instruction-tuned Models

Tianle Li, Wei-Lin Chiang 等 · 2024

提出自动化高难度指令模型评测流水线 Arena-Hard-Auto。

arena-hardbenchmarkevaluation
评测与安全arXiv

HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Mantas Mazeika, Long Phan 等 · 2024

提出标准化自动红队与拒答鲁棒性评测框架 HarmBench。

harmbenchred-teamingrefusal
评测与安全arXiv

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Naman Jain, King Han 等 · 2024

提出持续更新的代码评测基准,降低数据污染风险。

livecodebenchcodecontamination
评测与安全arXiv

MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

Yubo Wang, Xueguang Ma 等 · 2024

提出更具挑战性的多任务语言理解基准 MMLU-Pro。

mmlu-probenchmarkevaluation
评测与安全arXiv

SimpleQA: Measuring short-form factuality in large language models

Jason Wei, Nguyen Karina 等 · 2024

提出面向短答案事实性的评测基准 SimpleQA。

simpleqafactualityevaluation
评测与安全arXiv

TrustLLM: Trustworthiness in Large Language Models

Lichao Sun, Yue Huang 等 · 2024

系统梳理并评测大模型可信度相关维度与基准。

trustllmtrustworthinesssurvey
评测与安全arXiv

Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Chaoyou Fu, Yuhan Dai 等 · 2024

提出面向视频分析的多模态大模型综合评测基准 Video-MME。

video-mmemultimodalbenchmark
评测与安全arXiv

WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild

Bill Yuchen Lin, Yuntian Deng 等 · 2024

用真实用户困难任务评测大模型实际使用表现。

wildbenchbenchmarkreal-user
评测与安全arXiv

FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation

Sewon Min, Kalpesh Krishna 等 · 2023 · EMNLP 2023

将长文本拆成原子事实进行细粒度事实性评估。

factscorefactualityevaluation
评测与安全arXiv

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

David Rein, Betty Li Hou 等 · 2023

提出研究生级别且难以简单检索作答的问答基准 GPQA。

gpqabenchmarkhard
评测与安全arXiv

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang 等 · 2023

提出 MT-Bench 与 Chatbot Arena,并研究用 LLM 做裁判的可靠性。

mt-bencharenallm-as-judge
评测与安全arXiv

Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Hakan Inan, Kartikeya Upasani 等 · 2023

提出基于 LLM 的输入输出安全护栏模型 Llama Guard。

llama-guardsafetymoderation
评测与安全arXiv

MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark

Xiang Yue, Yuansheng Ni 等 · 2023

提出覆盖多学科的大规模多模态理解与推理基准 MMMU。

mmmumultimodalbenchmark
评测与安全arXiv

RAGAS: Automated Evaluation of Retrieval Augmented Generation

Shahul Es, Jithin James 等 · 2023

提出 RAGAS,自动评测检索增强生成流水线质量。

ragasragevaluation
评测与安全arXiv

Safe RLHF: Safe Reinforcement Learning from Human Feedback

Josef Dai, Xuehai Pan 等 · 2023

提出将帮助性与无害性目标分离的 Safe RLHF 对齐方法。

safe-rlhfsafetyalignment
评测与安全arXiv

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang 等 · 2023 · ICLR 2024

用真实 GitHub issue 评测语言模型解决软件工程问题的能力。

swe-benchcodeevaluation
评测与安全arXiv

Universal and Transferable Adversarial Attacks on Aligned Language Models

Andy Zou, Zifan Wang 等 · 2023

提出可迁移的通用对抗后缀攻击,用于测试对齐模型鲁棒性。

jailbreakadversarialsafety
评测与安全arXiv

VBench: Comprehensive Benchmark Suite for Video Generative Models

Ziqi Huang, Yinan He 等 · 2023

提出面向视频生成模型的综合评测套件 VBench。

vbenchvideobenchmark
评测与安全arXiv

Evaluating Large Language Models Trained on Code

Mark Chen, Jerry Tworek 等 · 2021

提出 HumanEval 等代码生成评测,衡量模型程序合成能力。

humanevalcodeevaluation
评测与安全arXiv

Measuring Massive Multitask Language Understanding

Dan Hendrycks, Collin Burns 等 · 2020 · ICLR 2021

提出覆盖多学科知识的大规模多任务理解基准 MMLU。

mmlubenchmarkevaluation
评测与安全arXiv