DPO 直接偏好优化(大模型对齐)

绕过显式奖励模型,用偏好对 (chosen, rejected) 直接微调策略。本页为原理动态演示,不训练真实大模型

10
0.10
0.10
2x
偏好对 0 / 10 DPO 损失 0.00 chosen 概率 0.50 rejected 概率 0.50 准确率 0%
偏好对训练(chosen ↑ / rejected ↓)
DPO 损失曲线(越低越好)
chosen vs rejected 概率(Bradley-Terry)
DPO 损失(实时代入)
点击「开始演示」后显示损失计算过程
当前步骤说明

点击「开始演示」查看 DPO 对偏好对的处理

算法说明

核心损失:LDPO = −log σ( β·[ log(πθ(yw|x)/πref(yw|x) ) − log(πθ(yl|x)/πref(yl|x) ) ] )

隐式奖励:DPO 等价于先学一个隐式奖励 r̂(x,y) = β·log(πθ(y|x)/πref(y|x)),再用 Bradley-Terry 概率 σ(r̂w − r̂l) 拟合偏好

无需奖励模型:跳过 RLHF 中显式训练 RM 与 PPO 在线采样,端到端用偏好数据微调,训练更稳定、成本更低

β 的作用:正则系数,控制策略偏离参考模型 πref(通常是 SFT 模型)的程度;β 越大越保守

核心代码