Reasoning RL
Reasoning RL
Reasoning RL 用奖励、偏好或 verifier 优化模型在数学、代码等任务中的生成策略,尤其适合结果可以自动验证的场景。
与 SFT 的差别
- Supervised Fine-Tuning 模仿给定目标序列。
- RL 优化期望奖励,模型可以探索不同生成轨迹。
常见对象
- policy / reference model
- rollout samples
- scalar or token-level rewards
- advantage estimate
- KL regularization
- verifier 或 reward model
一条可执行的训练链
1 | SFT policy |
稀疏结果奖励会让长轨迹的信用分配困难,过程奖励虽改善密度却引入标注偏差。探索太少会只复制已有套路,探索太多会产生无效长答案;因此必须同时监控正确率、平均长度、格式合规、奖励与真实成功率的相关性。达到单题正确不等于具备工具交互或长期规划能力,那是 Agentic RL 的另一层问题。
边界
Reasoning RL 常针对单题或有限任务;Agentic RL 还包含多步环境交互、工具调用、轨迹信用分配和系统闭环。
结果奖励、过程奖励与探索
对于一道数学题,结果 verifier 只能在最终答案处给 0/1;policy 需要在很长的 reasoning 中探索,早期错误步骤的梯度信号很弱。过程奖励把“是否完成代数变形、是否调用正确工具”等中间事件纳入训练,信用更密集,但每个步骤的正确性标注会成为新的偏差来源。两者都不是越多越好:过程评分器若奖励格式而不是逻辑,会把模型推向更长、更像推理的伪轨迹。
探索强度也有清晰的边界。温度太低,rollout 只重复 SFT 已有套路,verifier 看不到新策略;温度太高,样本多数无效,组内 reward 方差和训练成本上升。应按题目难度、生成长度和采样温度分桶记录有效轨迹率,再决定用 GRPO 的组相对优势还是 PPO 的 value/GAE。
一条可复现的验收路径
先用几十道可验证题做过拟合 sanity check,确认 verifier、EOS、token mask 和 reward 版本都能产生梯度;再把题目按新旧、短长、可验证难度分层。每个 checkpoint 同时报告正确率、平均 reasoning 长度、截断率、格式合规、reward-success 相关性和通用回归。若正确率上升但长度/截断率同步上升,先查长度投机;若训练 reward 上升而独立 verifier 不升,查 reward model 或数据泄漏。
Reasoning RL 的成功还不等于可用的 agent:单题 verifier 不会覆盖工具失败、外部状态变化和长期信用分配。只有把环境交互和多步任务纳入 trajectory,才进入 Agentic RL 的问题域。