直接偏好优化
Direct Preference OptimizationDPO进阶不训练奖励模型、不跑强化学习,直接用「好/坏」成对样本对齐模型的方法。
DPO 由斯坦福 Rafailov、Finn 等人在 2023 年提出。传统 RLHF(基于人类反馈的强化学习)要先用偏好数据训练奖励模型,再用 PPO 等算法做强化学习,流程长、不稳定。DPO 证明带 KL 约束的奖励最大化问题的最优策略有闭式解,于是问题变成一个分类式损失:提高被偏好样本相对参考模型的概率,压低被拒绝样本的概率,训练中无需从模型采样。它最早用于大语言模型对齐,在具身领域被借来做 VLA 后训练:把成功轨迹和失败轨迹配成偏好对,直接优化策略。
例子GRAPE(2024)在 OpenVLA 上把 DPO 从单步推广到整条轨迹(称为 TPO):把成功与失败的操作轨迹配成偏好对来微调,并以逐步做 DPO 的 OpenVLA-DPO 作为对比基线。
- 也叫
- DPO 损失、偏好优化
- 相关
- 基于人类反馈的强化学习、奖励模型、KL 正则化、GRAPE、后训练、组相对策略优化
- 来源
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model (arXiv:2305.18290)
GRAPE: Generalizing Robot Policy via Preference Alignment (arXiv:2411.19309)