DeepSeek-R1 百问百搭-GRPO(Group Relative Policy Optimization)篇
- DeepSeek-R1 百问百搭
- GRPO(Group Relative Policy Optimization)篇
- DeepSeek-R1-Zero 篇
- DeepSeek-R1-Zero 的基础模型是什么?
- DeepSeek-R1-Zero 如何通过纯强化学习(RL)实现推理能力的突破?
- DeepSeek-R1-Zero 如何使用 GRPO?
- DeepSeek-R1-Zero 采用纯RL训练 优势?
- 为何强调“无监督微调”(SFT)的RL训练?
- DeepSeek-R1-Zero “无监督微调”(SFT)的RL训练的理论依据是什么?
- DeepSeek-R1-Zero 模型在自我进化过程中是否会出现“局部最优”?
- DeepSeek-R1-Zero 模型在自我进化过程中如何避免“局部最优”?
- DeepSeek-R1-Zero的“自我进化”(self-evolution)过程如何通过RL实现?
- DeepSeek-R1-Zero的“自我进化”(self-evolution)过程如何实现 RL 有哪些技术支持?
- 如何验证RL训练过程中模型的“进化”是全局而非局部优化?
- 训练模板中与标签的设计目标是什么?
- 模型的可解释性(interpretability)如何提升?
- 训练模板中与标签的技术实现是什么?
- 奖励模型中“格式奖励”与“准确性奖励”如何进行 权重分配?
- 奖励模型中“格式奖励”与“准确性奖励”出现冲突时,如何处理?
- 模型在RL训练中的探索(exploration)与利用(exploitation)策略如何设计?
- 多任务数据(如写作、事实问答)如何整合到训练中?
- 模型如何处理不确定性问题(如模糊查询)?
- DeepSeek-R1-Zero在RL训练过程中,AIME分数从15.6%提升到71%的关键因素是什么?
- DeepSeek-R1 篇
- 冷启动数据(cold-start data)篇
- 如何将长思维链(CoT)能力扩展到非STEM领域(如法律、艺术)?
- 蒸馏技术篇
- 推理导向的强化学习阶段篇
- 论文提到“语言混合”(language mixing)问题,具体表现和解决思路是什么?
- 训练数据中的多语言样本如何处理?
- 模型在低资源语言中的表现是否受限?
- 模型在多语言混合输入下的表现如何?
- 模型在多语言混合输入下的优化措施?
- 语言混合问题的根本原因是否与多语言训练数据相关?
- 语言混合问题的未来优化方向是什么?
- 多语言对齐的技术难点何在?
- 为何在DeepSeek-R1中引入“语言一致性奖励”?
- DeepSeek-R1引入“语言一致性奖励”数学实现方式是什么?
- DeepSeek-R1引入“语言一致性奖励” 效果 怎么样?
- 什么是 “奖励破解”(reward hacking)问题?
- 模型如何避免生成重复或无意义内容?
- 如何解决RL训练中的“奖励破解”(reward hacking)问题?
- 为何在第二阶段RL中引入“多样性提示分布”?
- 如何在第二阶段RL中引入“多样性提示分布”?
- 在第二阶段RL中引入“多样性提示分布” 效果怎么样?
- DeepSeek-R1 模型如何通过“反思”(reflection)行为优化推理路径?
- DeepSeek-R1 模型“反思”(reflection)行为优化推理路径技术支持?
- 语言混合问题如何通过奖励信号抑制?
- 如何通过RL引导模型生成结构化输出(如代码块)?
- 过程奖励模型(PRM)为何在实验中失败?其局限性是什么?
- 蒙特卡洛树搜索(MCTS)在语言模型中的挑战是什么?与AlphaGo的区别何在?
- 如何避免模型在RL训练中过度拟合评测任务?
- 拒绝采样和监督微调阶段篇
- 全场景强化学习阶段
- 论文细节篇
- DeepSeek-R1 评测篇
- DeepSeek-R1在中文任务中的表现为何低于英文?
- 如何 优化 DeepSeek-R1 在中文任务中的表现为何低于英文问题?
- DeepSeek-R1 模型在长文本生成中的优势如何量化?
- 长上下文任务中 DeepSeek-R1 模型的注意力机制如何优化?
- 为何选择AIME 2024作为核心评测任务?
- AIME 2024和MATH-500的评测指标如何定义?为何选择这些任务?
- 为何选择 AIME 2024和MATH-500 作为评测指标?
- 在知识类任务(如MMLU、GPQA)中,DeepSeek-R1如何超越基模型DeepSeek-V3?
- 长上下文理解任务(如FRAMES)的评测结果揭示了模型的哪些能力?
- 评测中的“Pass@1”与“Cons@64”指标有何区别?
- 模型在代码竞赛(Codeforces)中的评分如何转化为“击败人类百分比”?
- 为何在AlpacaEval 2.0中控制生成长度?如何避免长度偏差?
- 模型在中文任务(如C-Eval)中的表现是否受语言对齐影响?
- SWE-bench评测中的“Resolved”指标如何定义?
- 模型在开放式生成任务(如创意写作)中的评测方法是什么?
- 为何DeepSeek-R1在软件工程任务中提升有限?
- 软件工程任务(如SWE-bench)的RL训练效率问题如何改进?
- 评测中使用的“零样本”(zero-shot)与“少样本”(few-shot)设置差异?
- 评测中是否考虑模型的计算效率(如推理延迟)?
- 评测中是否考虑模型的计算效率(如推理延迟)?
- 模型在对抗性测试(adversarial testing)中的鲁棒性如何?
- 模型针对在对抗性测试(adversarial testing)中的鲁棒性的改进策略?
- 评测中的“预期评分”(Elo rating)如何计算?
- DeepSeek-R1 模型在逻辑推理任务中的失败案例分析?
- DeepSeek-R1 模型在逻辑推理任务中的失败案例如何改进?
- 评测数据的时间范围(如LiveCodeBench 2024-2025)是否影响结果?
- DeepSeek-R1 推理部署篇
- DeepSeek-R1 其他问题篇
- 对比篇
- 参考
GRPO(Group Relative Policy Optimization)篇
GRPO(Group Relative Policy Optimization)算法的设计原理是什么?
GRPO的设计原理是通过组内归一化(group-wise normalization)替代传统PPO中的价值模型(critic),降低计算成本。
具体步骤:
- 组采样:对每个问题采样G个输出(如G=16),计算组内奖励的均值(mean)和标准差(std)。
- 优势计算:每个输出的优势值( $A_i = \frac{r_i - \text{mean}(r)}{\text{std}(r)}$ ),消除奖励尺度偏差。
- 策略优化:最大化剪切后的策略比率(clipped ratio)与优势的乘积,同时约束KL散度避免策略突变。
GRPO(Group Relative Policy Optimization)算法与传统RL方法有何不同?
与传统RL(如PPO)的区别:
- 无价值模型:节省训练参数量和内存开销(价值模型通常与策略模型等大)。
- 组内竞争:优势计算基于组内相对表现,而非全局基准,更适合稀疏奖励任务。
GRPO算法如何估计基线(baseline)?与PPO的区别?
基线估计:
- GRPO用组内奖励的均值作为基线(公式3:( $A_i = \frac{r_i - \text{mean}(r)}{\text{std}(r)}$ ))。
- PPO则需额外训练价值模型(critic)预测基线值。
GRPO算法估计基线(baseline)与PPO的区别?
区别:
- 计算成本:GRPO省去价值模型训练,内存占用减少40%。
- 适应性:GRPO的基线动态适应组内样本,更适合稀疏奖励场景。
为何选择GRPO而非其他RL算法(如A3C、TRPO)?
选择依据:
- 计算效率:GRPO无需价值模型,比A3C节省30%显存。
- 稳定性:组内归一化使奖励尺度自适应,比TRPO更易调参。
- 稀疏奖励适配性:在数学推理等奖励稀疏任务中,GRPO优势显著。
对比实验:GRPO在AIME任务上收敛速度比PPO快1.8倍。
GRPO 训练中的“组内归一化”(group normalization)对收敛速度的影响?
机制:组内归一化将优势值缩放到均值为0、方差为1,消除不同问题间的奖励量纲差异。影响:
- 加速初期收敛:模型更快识别高奖励策略方向。
- 稳定后期训练:避免因某些任务奖励过高导致策略偏移。
量化结果:AIME任务收敛步数从12k步降至7k步。