资源库
评测与安全 Papers
面向评测基准、幻觉、安全与可解释性的研究论文。
Arena-Hard-Auto: An Automatic LLM Evaluation Pipeline for Instruction-tuned Models
Tianle Li, Wei-Lin Chiang 等 · 2024
提出自动化高难度指令模型评测流水线 Arena-Hard-Auto。
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
Mantas Mazeika, Long Phan 等 · 2024
提出标准化自动红队与拒答鲁棒性评测框架 HarmBench。
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Naman Jain, King Han 等 · 2024
提出持续更新的代码评测基准,降低数据污染风险。
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Yubo Wang, Xueguang Ma 等 · 2024
提出更具挑战性的多任务语言理解基准 MMLU-Pro。
SimpleQA: Measuring short-form factuality in large language models
Jason Wei, Nguyen Karina 等 · 2024
提出面向短答案事实性的评测基准 SimpleQA。
TrustLLM: Trustworthiness in Large Language Models
Lichao Sun, Yue Huang 等 · 2024
系统梳理并评测大模型可信度相关维度与基准。
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Chaoyou Fu, Yuhan Dai 等 · 2024
提出面向视频分析的多模态大模型综合评测基准 Video-MME。
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
Bill Yuchen Lin, Yuntian Deng 等 · 2024
用真实用户困难任务评测大模型实际使用表现。
FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation
Sewon Min, Kalpesh Krishna 等 · 2023 · EMNLP 2023
将长文本拆成原子事实进行细粒度事实性评估。
GPQA: A Graduate-Level Google-Proof Q&A Benchmark
David Rein, Betty Li Hou 等 · 2023
提出研究生级别且难以简单检索作答的问答基准 GPQA。
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
Lianmin Zheng, Wei-Lin Chiang 等 · 2023
提出 MT-Bench 与 Chatbot Arena,并研究用 LLM 做裁判的可靠性。
Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
Hakan Inan, Kartikeya Upasani 等 · 2023
提出基于 LLM 的输入输出安全护栏模型 Llama Guard。
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark
Xiang Yue, Yuansheng Ni 等 · 2023
提出覆盖多学科的大规模多模态理解与推理基准 MMMU。
RAGAS: Automated Evaluation of Retrieval Augmented Generation
Shahul Es, Jithin James 等 · 2023
提出 RAGAS,自动评测检索增强生成流水线质量。
Safe RLHF: Safe Reinforcement Learning from Human Feedback
Josef Dai, Xuehai Pan 等 · 2023
提出将帮助性与无害性目标分离的 Safe RLHF 对齐方法。
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
Carlos E. Jimenez, John Yang 等 · 2023 · ICLR 2024
用真实 GitHub issue 评测语言模型解决软件工程问题的能力。
Universal and Transferable Adversarial Attacks on Aligned Language Models
Andy Zou, Zifan Wang 等 · 2023
提出可迁移的通用对抗后缀攻击,用于测试对齐模型鲁棒性。
VBench: Comprehensive Benchmark Suite for Video Generative Models
Ziqi Huang, Yinan He 等 · 2023
提出面向视频生成模型的综合评测套件 VBench。
Evaluating Large Language Models Trained on Code
Mark Chen, Jerry Tworek 等 · 2021
提出 HumanEval 等代码生成评测,衡量模型程序合成能力。
Measuring Massive Multitask Language Understanding
Dan Hendrycks, Collin Burns 等 · 2020 · ICLR 2021
提出覆盖多学科知识的大规模多任务理解基准 MMLU。