跳转至

Agentic RL Training

长时程 Agent 的 rollout、off-policy correction、advantage estimation 与训练系统协同设计。

已读论文

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

  • ID: arXiv:2607.07508v1
  • 作者: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong,2026
  • 本地材料: PDF源码解析单篇精读

定位。 SAO 解决长时程 Agent 异步 RL 中的两个联立问题:策略滞后使 rollout 过期,而 GRPO 的 group-wise sampling 又强制轨迹到齐,加重等待和 off-policy。

方法。 每个 prompt 只生成一条 rollout 就可进入训练队列;这指 group size 为 1,不是梯度 batch size 为 1(实验 batch size 仍为 128)。SAO 使用当前 policy 与 rollout log-prob 的 token 级 ratio,将双侧阈值外 token 的梯度硬遮罩。去掉 GRPO group baseline 后,SAO 使用 critic 降低 single-rollout 方差,每个 actor update 执行两次 critic update,并冻结 critic attention。对 action/observation 交错轨迹,Skip-Observation GAE 在相邻 model action 之间跨过环境 token。

GRPO 的 group waiting 与 SAO 的 single-rollout

实验。 相对同样使用 DIS 的 GRPO,SAO 在 AIME2025、BeyondAIME、HMMT Nov 2025、IMOAnswerBench 上分别提升 3.8、4.0、4.3、4.0 个绝对点;SWE-Bench Verified 从 27.0 提升到 29.8。Vanilla GRPO 约 160 步崩溃,DIS 使 GRPO 可稳定训练,完整 SAO 则在约 400 步后逐渐拉开。(Table 1–2, Figure 3, pp.5–6)

局限。 论文未报告 wall-clock speedup 或 GPU utilization,因此对异步“效率”的证据弱于对“稳定性和效果”的证据。实验主要限于 Qwen3-30B-A3B;Skip-Observation GAE 没有单独干净消融;GLM-5.2 部署是论文声明,未附对照实验。

关系。 PPO 依赖 critic + GAE;GRPO 用组内 baseline 去掉 critic;SAO 为了去掉 group 的同步屏障,又将 critic 引回,并围绕异步 policy lag 和 Agent 轨迹结构重新设计其训练方式。