Reasoning RL

Reasoning RL 用奖励、偏好或 verifier 优化模型在数学、代码等任务中的生成策略,尤其适合结果可以自动验证的场景。

与 SFT 的差别

  • Supervised Fine-Tuning 模仿给定目标序列。
  • RL 优化期望奖励,模型可以探索不同生成轨迹。

常见对象

  • policy / reference model
  • rollout samples
  • scalar or token-level rewards
  • advantage estimate
  • KL regularization
  • verifier 或 reward model

一条可执行的训练链

1
2
3
4
5
6
SFT policy
→ 对题目采样多条 reasoning trajectory
→ verifier / reward model 打分
→ outcome 或 process advantage
→ PPO/GRPO 等更新并施加 KL 约束
→ 在新题、旧能力和长度分层集上回归

稀疏结果奖励会让长轨迹的信用分配困难,过程奖励虽改善密度却引入标注偏差。探索太少会只复制已有套路,探索太多会产生无效长答案;因此必须同时监控正确率、平均长度、格式合规、奖励与真实成功率的相关性。达到单题正确不等于具备工具交互或长期规划能力,那是 Agentic RL 的另一层问题。

边界

Reasoning RL 常针对单题或有限任务;Agentic RL 还包含多步环境交互、工具调用、轨迹信用分配和系统闭环。

结果奖励、过程奖励与探索

对于一道数学题,结果 verifier 只能在最终答案处给 0/1;policy 需要在很长的 reasoning 中探索,早期错误步骤的梯度信号很弱。过程奖励把“是否完成代数变形、是否调用正确工具”等中间事件纳入训练,信用更密集,但每个步骤的正确性标注会成为新的偏差来源。两者都不是越多越好:过程评分器若奖励格式而不是逻辑,会把模型推向更长、更像推理的伪轨迹。

探索强度也有清晰的边界。温度太低,rollout 只重复 SFT 已有套路,verifier 看不到新策略;温度太高,样本多数无效,组内 reward 方差和训练成本上升。应按题目难度、生成长度和采样温度分桶记录有效轨迹率,再决定用 GRPO 的组相对优势还是 PPO 的 value/GAE。

一条可复现的验收路径

先用几十道可验证题做过拟合 sanity check,确认 verifier、EOS、token mask 和 reward 版本都能产生梯度;再把题目按新旧、短长、可验证难度分层。每个 checkpoint 同时报告正确率、平均 reasoning 长度、截断率、格式合规、reward-success 相关性和通用回归。若正确率上升但长度/截断率同步上升,先查长度投机;若训练 reward 上升而独立 verifier 不升,查 reward model 或数据泄漏。

Reasoning RL 的成功还不等于可用的 agent:单题 verifier 不会覆盖工具失败、外部状态变化和长期信用分配。只有把环境交互和多步任务纳入 trajectory,才进入 Agentic RL 的问题域。