TodayAI

资源库

训练与对齐 Papers

面向训练效率、对齐、偏好优化与后训练的研究论文。

DataComp-LM: In search of the next generation of training sets for language models

Jeffrey Li, Alex Fang 等 · 2024

提出 DataComp-LM,系统探索下一代语言模型训练数据配方。

datacompdatasetpretraining
训练与对齐arXiv

KTO: Model Alignment as Prospect Theoretic Optimization

Kawin Ethayarajh, Winnie Xu 等 · 2024

用前景理论框架做模型对齐,可不依赖成对偏好。

ktopreferencealignment
训练与对齐arXiv

Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing

Zhangchen Xu, Feng Jiang 等 · 2024

通过提示已对齐模型自发生成高质量对齐数据。

magpiesynthetic-dataalignment
训练与对齐arXiv

ORPO: Monolithic Preference Optimization without Reference Model

Jiwoo Hong, Noah Lee, James Thorne · 2024

提出无需参考模型的一体式偏好优化方法 ORPO。

orpopreferencealignment
训练与对齐arXiv

RLHF Workflow: From Reward Modeling to Online RLHF

Hanze Dong, Wei Xiong 等 · 2024

系统梳理从奖励建模到在线 RLHF 的后训练工作流。

rlhfreward-modelpost-training
训练与对齐arXiv

SimPO: Simple Preference Optimization with a Reference-Free Reward

Yu Meng, Mengzhou Xia, Danqi Chen · 2024

提出无需参考模型的简单偏好优化方法 SimPO。

simpopreferencealignment
训练与对齐arXiv

Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs

Xin Lai, Zhuotao Tian 等 · 2024

将偏好优化细化到推理步骤,提升长链推理对齐。

step-dporeasoningalignment
训练与对齐arXiv

Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Nathan Lambert, Jacob Morrison 等 · 2024

系统报告开放语言模型后训练配方 Tulu 3。

tulupost-trainingopen-model
训练与对齐arXiv

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Rafael Rafailov, Archit Sharma 等 · 2023 · NeurIPS 2023

提出 DPO,直接用偏好数据优化策略,简化 RLHF 流程。

dpopreferencealignment
训练与对齐arXiv

QLoRA: Efficient Finetuning of Quantized Language Models

Tim Dettmers, Artidoro Pagnoni 等 · 2023

结合 4-bit 量化与 LoRA,在有限显存下高效微调大模型。

qloraquantizationfine-tuning
训练与对齐arXiv

UltraFeedback: Boosting Language Models with Scaled AI Feedback

Ganqu Cui, Lifan Yuan 等 · 2023

构建大规模高质量偏好反馈数据以提升模型对齐。

ultrafeedbackpreference-dataalignment
训练与对齐arXiv

WizardLM: Empowering Large Language Models to Follow Complex Instructions

Can Xu, Qingfeng Sun 等 · 2023

用 Evol-Instruct 进化复杂指令,提升模型指令跟随能力。

wizardlminstruction-tuningevol-instruct
训练与对齐arXiv

Constitutional AI: Harmlessness from AI Feedback

Yuntao Bai, Saurav Kadavath 等 · 2022

用 AI 反馈与宪法原则训练更无害的助手模型。

constitutional-aialignmentrlai
训练与对齐arXiv

Self-Instruct: Aligning Language Models with Self-Generated Instructions

Yizhong Wang, Yeganeh Kordi 等 · 2022 · ACL 2023

用模型自生成指令数据实现指令跟随对齐。

self-instructinstruction-tuningalignment
训练与对齐arXiv

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu 等 · 2022 · NeurIPS 2022

提出 InstructGPT,用人类反馈强化学习让模型更好遵循指令。

instructgptrlhfalignment
训练与对齐arXiv

LoRA: Low-Rank Adaptation of Large Language Models

Edward J. Hu, Yelong Shen 等 · 2021 · ICLR 2022

提出低秩适配方法,以极少可训练参数高效微调大模型。

lorapeftfine-tuning
训练与对齐arXiv

Learning to summarize from human feedback

Nisan Stiennon, Long Ouyang 等 · 2020 · NeurIPS 2020

用人类偏好反馈训练摘要模型,是 RLHF 的重要早期实践。

rlhfsummarizationpreference
训练与对齐arXiv

Deep reinforcement learning from human preferences

Paul F. Christiano, Jan Leike 等 · 2017 · NeurIPS 2017

提出从人类偏好进行深度强化学习的基本方法。

rlhfpreferencesreinforcement-learning
训练与对齐arXiv

Adam: A Method for Stochastic Optimization

Diederik P. Kingma, Jimmy Ba · 2014 · ICLR 2015

提出 Adam 优化器,成为深度学习训练的标准自适应优化方法。

adamoptimizertraining
训练与对齐arXiv

Improving neural networks by preventing co-adaptation of feature detectors

Geoffrey E. Hinton, Nitish Srivastava 等 · 2012 · JMLR

提出通过随机失活特征检测器减少共适应,是 Dropout 的重要早期工作。

dropoutregularizationneural-networks
训练与对齐arXiv