PPO 近端策略优化(大模型对齐)

Actor-Critic 架构 + 裁剪替代目标,RLHF 阶段最常用的策略优化算法。本页为原理动态演示,不训练真实大模型

20
0.2
0.10
2x
迭代 0 / 20 策略收益 0.00 价值损失 0.00 策略熵 0.00
训练流程示意(Actor ↔ Critic ↔ 奖励模型)
策略收益曲线(越高越好)
价值损失曲线(越低越好)
裁剪替代目标 LCLIP 随比率 r 的变化
当前步骤说明

点击「开始演示」查看 PPO 一轮迭代的各阶段

算法说明

核心目标:最大化裁剪替代目标 LCLIP(θ) = Et[ min(rt(θ)·At, clip(rt(θ), 1−ε, 1+ε)·At) ],其中 rt(θ)=πθ(a|s)/πθ_old(a|s)

Actor-Critic:策略网络 πθ 输出 token 概率,价值网络 Vφ 估计状态价值,广义优势估计 GAE 计算优势 At

裁剪机制:限制策略更新幅度在 [1−ε, 1+ε] 内,避免一轮迭代破坏已学好的策略;ε 通常取 0.2

RLHF 应用:在 SFT 之后,PPO 对奖励模型打分进行策略优化,是 ChatGPT 等对齐阶段最经典的方法

核心代码