返回学习地图
trainingPhase D · 第 28

D3.3 DPO 直接偏好优化

RLHF 的简化版,效果等同或更优

3 个章节·按类别展开/折叠
知识

RLHF 三步流程

  1. SFT:在标注数据上微调
  2. RM:训练奖励模型(人类偏好打分)
  3. PPO:用强化学习(RL)让 LLM 最大化奖励

痛点:需要 4 个模型同时加载(Actor / Critic / Ref / RM),显存爆;训练不稳定;实现复杂。

知识

DPO 创新

Stanford 2023 提出:把 RLHF 的 PPO 步骤去掉,直接用偏好对 (chosen, rejected) 做监督学习。公式推导证明 DPO 等价于 RLHF 的最优策略。

Loss:Loss_DPO = -log_sigmoid(β * (log π(chosen)/π_ref(chosen) - log π(rejected)/π_ref(rejected)))

数据格式:每个样本一条 chosen + 一条 rejected。

效果:DPO 在大多数任务上达到甚至超过 PPO 训练效果,但显存只要 1/3,训练只要 1/10 时间。

对比

DPO vs PPO 对比

对比
用表格对比两者差异