Skip to content

DeepSeek-R1 百问百搭-GRPO(Group Relative Policy Optimization)篇

GRPO(Group Relative Policy Optimization)篇

GRPO(Group Relative Policy Optimization)算法的设计原理是什么?

GRPO的设计原理是通过组内归一化(group-wise normalization)替代传统PPO中的价值模型(critic),降低计算成本。

具体步骤:

  1. 组采样:对每个问题采样G个输出(如G=16),计算组内奖励的均值(mean)和标准差(std)。
  2. 优势计算:每个输出的优势值( $A_i = \frac{r_i - \text{mean}(r)}{\text{std}(r)}$ ),消除奖励尺度偏差。
  3. 策略优化:最大化剪切后的策略比率(clipped ratio)与优势的乘积,同时约束KL散度避免策略突变。

GRPO(Group Relative Policy Optimization)算法与传统RL方法有何不同?

与传统RL(如PPO)的区别:

  • 无价值模型:节省训练参数量和内存开销(价值模型通常与策略模型等大)。
  • 组内竞争:优势计算基于组内相对表现,而非全局基准,更适合稀疏奖励任务。

GRPO算法如何估计基线(baseline)?与PPO的区别?

基线估计:

  • GRPO用组内奖励的均值作为基线(公式3:( $A_i = \frac{r_i - \text{mean}(r)}{\text{std}(r)}$ ))。
  • PPO则需额外训练价值模型(critic)预测基线值。

GRPO算法估计基线(baseline)与PPO的区别?

区别:

  • 计算成本:GRPO省去价值模型训练,内存占用减少40%。
  • 适应性:GRPO的基线动态适应组内样本,更适合稀疏奖励场景。

为何选择GRPO而非其他RL算法(如A3C、TRPO)?

选择依据:

  1. 计算效率:GRPO无需价值模型,比A3C节省30%显存。
  2. 稳定性:组内归一化使奖励尺度自适应,比TRPO更易调参。
  3. 稀疏奖励适配性:在数学推理等奖励稀疏任务中,GRPO优势显著。

对比实验:GRPO在AIME任务上收敛速度比PPO快1.8倍。

GRPO 训练中的“组内归一化”(group normalization)对收敛速度的影响?

机制:组内归一化将优势值缩放到均值为0、方差为1,消除不同问题间的奖励量纲差异。影响:

  • 加速初期收敛:模型更快识别高奖励策略方向。
  • 稳定后期训练:避免因某些任务奖励过高导致策略偏移。

量化结果:AIME任务收敛步数从12k步降至7k步。