GRPO

GRPO 对同一 prompt 采样一组回答,用组内 reward 的相对关系构造 advantage,再更新策略。

心智模型

1
2
3
prompt → sample group → score each completion
→ normalize/compare rewards within group
→ policy update with reference/KL constraints

注意

源仓库伪代码省略了 token-level mask、旧策略 logprob、长度归一、有效样本、KL 估计和多轮更新约束,只能作为流程草图。不同框架实现细节需要重新核验。

组内相对优势

对同一 prompt 的奖励 r_1...r_G,常见做法是用组内均值和标准差构造相对 advantage,例如 A_i=(r_i-mean(r))/ (std(r)+ε)。于是学习信号来自“同一问题的哪个答案更好”,而不是绝对 reward 的跨任务尺度。

1
2
3
4
5
同 prompt 多次采样
→ verifier/reward 得到组内排序
→ 相对 advantage
→ policy/KL 更新
→ 新策略改变下一组的难度与方差

这带来两个边界:组内奖励没有差异时梯度接近零;采样成本和 reward 方差会直接影响有效 batch。还要单独检查长度偏置、全错/全对分组、token mask、reference KL 与 clipping。GRPO 省去独立 critic,不等于省去 rollout、奖励和评测。

相关节点:Reasoning RLPPOReward Model

组大小决定信号的统计性质

组内标准化的前提是同一个 prompt 的多个样本能产生有区分度的 reward。若 G 太小,均值和标准差噪声很大;若 verifier 对一组答案全判对或全判错,std≈0,所有 advantage 接近零,rollout 预算就没有转化成梯度。应记录每组 reward 的方差、全同组比例、有效 token 数和生成长度,而不是只记录全局平均 reward。

GRPO 省掉独立 critic,但并没有消除信用分配。一个长 reasoning 轨迹最终答对时,outcome reward 可能把相同信号广播给全部 token;如果模型发现“写更长更容易碰到关键词”,就会产生长度投机。长度归一、过程 verifier、截断惩罚和格式约束必须作为独立实验变量,不能混成“GRPO 调参”。

与 PPO 的实际差别

PPO 依赖 value/advantage 估计,GRPO 用同 prompt 的相对 reward 作为 baseline;前者的 critic 训练和估计偏差是额外成本,后者的采样组方差是主要成本。对于题目难度差异大的数据,组内相对信号避免了跨题 reward 尺度不一致;但它也无法告诉模型“这一组全错时应该朝什么方向走”。混入 curriculum、可验证难例和少量绝对约束,通常比盲目增加组大小更能提高有效信号。