GRPO
GRPO
GRPO 对同一 prompt 采样一组回答,用组内 reward 的相对关系构造 advantage,再更新策略。
心智模型
1 | prompt → sample group → score each completion |
注意
源仓库伪代码省略了 token-level mask、旧策略 logprob、长度归一、有效样本、KL 估计和多轮更新约束,只能作为流程草图。不同框架实现细节需要重新核验。
组内相对优势
对同一 prompt 的奖励 r_1...r_G,常见做法是用组内均值和标准差构造相对 advantage,例如 A_i=(r_i-mean(r))/ (std(r)+ε)。于是学习信号来自“同一问题的哪个答案更好”,而不是绝对 reward 的跨任务尺度。
1 | 同 prompt 多次采样 |
这带来两个边界:组内奖励没有差异时梯度接近零;采样成本和 reward 方差会直接影响有效 batch。还要单独检查长度偏置、全错/全对分组、token mask、reference KL 与 clipping。GRPO 省去独立 critic,不等于省去 rollout、奖励和评测。
相关节点:Reasoning RL、PPO、Reward Model。
组大小决定信号的统计性质
组内标准化的前提是同一个 prompt 的多个样本能产生有区分度的 reward。若 G 太小,均值和标准差噪声很大;若 verifier 对一组答案全判对或全判错,std≈0,所有 advantage 接近零,rollout 预算就没有转化成梯度。应记录每组 reward 的方差、全同组比例、有效 token 数和生成长度,而不是只记录全局平均 reward。
GRPO 省掉独立 critic,但并没有消除信用分配。一个长 reasoning 轨迹最终答对时,outcome reward 可能把相同信号广播给全部 token;如果模型发现“写更长更容易碰到关键词”,就会产生长度投机。长度归一、过程 verifier、截断惩罚和格式约束必须作为独立实验变量,不能混成“GRPO 调参”。
与 PPO 的实际差别
PPO 依赖 value/advantage 估计,GRPO 用同 prompt 的相对 reward 作为 baseline;前者的 critic 训练和估计偏差是额外成本,后者的采样组方差是主要成本。对于题目难度差异大的数据,组内相对信号避免了跨题 reward 尺度不一致;但它也无法告诉模型“这一组全错时应该朝什么方向走”。混入 curriculum、可验证难例和少量绝对约束,通常比盲目增加组大小更能提高有效信号。