资源库
训练与对齐 Papers
面向训练效率、对齐、偏好优化与后训练的研究论文。
DataComp-LM: In search of the next generation of training sets for language models
Jeffrey Li, Alex Fang 等 · 2024
提出 DataComp-LM,系统探索下一代语言模型训练数据配方。
KTO: Model Alignment as Prospect Theoretic Optimization
Kawin Ethayarajh, Winnie Xu 等 · 2024
用前景理论框架做模型对齐,可不依赖成对偏好。
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
Zhangchen Xu, Feng Jiang 等 · 2024
通过提示已对齐模型自发生成高质量对齐数据。
ORPO: Monolithic Preference Optimization without Reference Model
Jiwoo Hong, Noah Lee, James Thorne · 2024
提出无需参考模型的一体式偏好优化方法 ORPO。
RLHF Workflow: From Reward Modeling to Online RLHF
Hanze Dong, Wei Xiong 等 · 2024
系统梳理从奖励建模到在线 RLHF 的后训练工作流。
SimPO: Simple Preference Optimization with a Reference-Free Reward
Yu Meng, Mengzhou Xia, Danqi Chen · 2024
提出无需参考模型的简单偏好优化方法 SimPO。
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
Xin Lai, Zhuotao Tian 等 · 2024
将偏好优化细化到推理步骤,提升长链推理对齐。
Tulu 3: Pushing Frontiers in Open Language Model Post-Training
Nathan Lambert, Jacob Morrison 等 · 2024
系统报告开放语言模型后训练配方 Tulu 3。
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Rafael Rafailov, Archit Sharma 等 · 2023 · NeurIPS 2023
提出 DPO,直接用偏好数据优化策略,简化 RLHF 流程。
QLoRA: Efficient Finetuning of Quantized Language Models
Tim Dettmers, Artidoro Pagnoni 等 · 2023
结合 4-bit 量化与 LoRA,在有限显存下高效微调大模型。
UltraFeedback: Boosting Language Models with Scaled AI Feedback
Ganqu Cui, Lifan Yuan 等 · 2023
构建大规模高质量偏好反馈数据以提升模型对齐。
WizardLM: Empowering Large Language Models to Follow Complex Instructions
Can Xu, Qingfeng Sun 等 · 2023
用 Evol-Instruct 进化复杂指令,提升模型指令跟随能力。
Constitutional AI: Harmlessness from AI Feedback
Yuntao Bai, Saurav Kadavath 等 · 2022
用 AI 反馈与宪法原则训练更无害的助手模型。
Self-Instruct: Aligning Language Models with Self-Generated Instructions
Yizhong Wang, Yeganeh Kordi 等 · 2022 · ACL 2023
用模型自生成指令数据实现指令跟随对齐。
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu 等 · 2022 · NeurIPS 2022
提出 InstructGPT,用人类反馈强化学习让模型更好遵循指令。
LoRA: Low-Rank Adaptation of Large Language Models
Edward J. Hu, Yelong Shen 等 · 2021 · ICLR 2022
提出低秩适配方法,以极少可训练参数高效微调大模型。
Learning to summarize from human feedback
Nisan Stiennon, Long Ouyang 等 · 2020 · NeurIPS 2020
用人类偏好反馈训练摘要模型,是 RLHF 的重要早期实践。
Deep reinforcement learning from human preferences
Paul F. Christiano, Jan Leike 等 · 2017 · NeurIPS 2017
提出从人类偏好进行深度强化学习的基本方法。
Adam: A Method for Stochastic Optimization
Diederik P. Kingma, Jimmy Ba · 2014 · ICLR 2015
提出 Adam 优化器,成为深度学习训练的标准自适应优化方法。
Improving neural networks by preventing co-adaptation of feature detectors
Geoffrey E. Hinton, Nitish Srivastava 等 · 2012 · JMLR
提出通过随机失活特征检测器减少共适应,是 Dropout 的重要早期工作。