Agentic RL Training¶
长时程 Agent 的 rollout、off-policy correction、advantage estimation 与训练系统协同设计。
已读论文¶
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning¶
定位。 SAO 解决长时程 Agent 异步 RL 中的两个联立问题:策略滞后使 rollout 过期,而 GRPO 的 group-wise sampling 又强制轨迹到齐,加重等待和 off-policy。
方法。 每个 prompt 只生成一条 rollout 就可进入训练队列;这指 group size 为 1,不是梯度 batch size 为 1(实验 batch size 仍为 128)。SAO 使用当前 policy 与 rollout log-prob 的 token 级 ratio,将双侧阈值外 token 的梯度硬遮罩。去掉 GRPO group baseline 后,SAO 使用 critic 降低 single-rollout 方差,每个 actor update 执行两次 critic update,并冻结 critic attention。对 action/observation 交错轨迹,Skip-Observation GAE 在相邻 model action 之间跨过环境 token。

实验。 相对同样使用 DIS 的 GRPO,SAO 在 AIME2025、BeyondAIME、HMMT Nov 2025、IMOAnswerBench 上分别提升 3.8、4.0、4.3、4.0 个绝对点;SWE-Bench Verified 从 27.0 提升到 29.8。Vanilla GRPO 约 160 步崩溃,DIS 使 GRPO 可稳定训练,完整 SAO 则在约 400 步后逐渐拉开。(Table 1–2, Figure 3, pp.5–6)
局限。 论文未报告 wall-clock speedup 或 GPU utilization,因此对异步“效率”的证据弱于对“稳定性和效果”的证据。实验主要限于 Qwen3-30B-A3B;Skip-Observation GAE 没有单独干净消融;GLM-5.2 部署是论文声明,未附对照实验。
关系。 PPO 依赖 critic + GAE;GRPO 用组内 baseline 去掉 critic;SAO 为了去掉 group 的同步屏障,又将 critic 引回,并围绕异步 policy lag 和 Agent 轨迹结构重新设计其训练方式。