3 个章节·按类别展开/折叠
知识
RLHF 三步流程
- SFT:在标注数据上微调
- RM:训练奖励模型(人类偏好打分)
- PPO:用强化学习(RL)让 LLM 最大化奖励
痛点:需要 4 个模型同时加载(Actor / Critic / Ref / RM),显存爆;训练不稳定;实现复杂。
知识
DPO 创新
Stanford 2023 提出:把 RLHF 的 PPO 步骤去掉,直接用偏好对 (chosen, rejected) 做监督学习。公式推导证明 DPO 等价于 RLHF 的最优策略。
Loss:Loss_DPO = -log_sigmoid(β * (log π(chosen)/π_ref(chosen) - log π(rejected)/π_ref(rejected)))
数据格式:每个样本一条 chosen + 一条 rejected。
效果:DPO 在大多数任务上达到甚至超过 PPO 训练效果,但显存只要 1/3,训练只要 1/10 时间。
对比
DPO vs PPO 对比
对比
用表格对比两者差异