GRPO 群组相对策略优化(大模型对齐)
同一 prompt 采样 G 个响应,用组内奖励归一化作为优势,省去 Critic。DeepSeek 推出的高效 RL 方法。本页为原理动态演示
6
10
0.2
2x
迭代 0 / 10 组大小 G=6 组均奖励 0.00 策略损失 0.00 KL 散度 0.00
同一 prompt 采样 G 个响应(按奖励排序,颜色 = 优势)
组均奖励曲线(越高越好)
KL 散度(策略 vs 参考模型,越低越稳定)
优势计算(实时代入)
点击「开始演示」后显示组内优势归一化过程
当前步骤说明
点击「开始演示」查看 GRPO 组内相对优势的计算
算法说明
核心创新:对每个 prompt 采样 G 个响应 {o1,...,oG},用组内奖励的均值 μ 与标准差 σ 归一化得到优势 Ai = (ri − μ) / (σ + ε),省去 Critic 网络
策略损失:LGRPO = −E[ min(r̂i,t·Ai, clip(r̂i,t, 1−ε, 1+ε)·Ai) ] − β·DKL(πθ ‖ πref)
对比 PPO:GRPO 用组内相对奖励代替价值网络估计的优势,显存占用更低,适合长思维链(如数学推理)的训练
DeepSeek 应用:GRPO 是 DeepSeek-R1 等推理大模型训练的核心方法,特别适合带验证器(规则判分)的强化学习场景