title: 中文译文 · Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification paper_id: 'ACL Anthology `2026.findings-acl.1243' year: '2026'
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification¶
中文结构化译文第一版,基于同目录
note.md整理;原文 PDF、解析文本和笔记均在本目录。 作者与组织见下方“元信息”;若原笔记未记录组织,后续精修时继续补齐。
元信息¶
- ID: ACL Anthology
2026.findings-acl.1243 - 年份: 2026
- 作者: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu
- 本地 PDF:
paper.pdf - 解析文本:
main_en.md - 页数: 14
- 主题: deep research agent, rubric-guided verifier, failure taxonomy, reflection, test-time scaling
摘要翻译¶
论文提出 DeepVerifier,一个用于 Deep Research Agents 的 rubric-guided outcome verifier。与主要通过 post-training 提升 agent policy 的路线不同,作者让 agent 在测试时用 verifier 反复评估自身输出,根据 rubric 生成反馈并改进回答。rubric 来自自动构建的 DRA Failure Taxonomy,覆盖五大类、十三个子类失败模式。DeepVerifier 在 meta-evaluation F1 上比 vanilla agent-as-judge 和 LLM judge baseline 高 12% 到 48%,并在 GAIA、XBench-DeepResearch 等任务上带来 8% 到 11% 的 accuracy gain。论文还发布 DeepVerifier-4K,包含 4,646 条高质量 agent verification SFT 样本。
定位¶
这篇把 verifier 放在 agent workflow 中,不只是选答案,而是生成可执行反馈,让 agent 在 inference time 自我修正。它的 verifier 更像 rubric-based reviewer,面向开放式深度研究任务。
动机¶
Deep Research Agent 的失败常发生在长链路中:找错来源、遗漏证据、误解问题、过早下结论或工具执行失败。让 LLM judge 整体重做一遍任务成本高且会犯同类错误。论文认为应利用 verification asymmetry,把复杂答案验证拆成小的证据检查问题。
方法¶
论文先构建 DRA Failure Taxonomy:
- 使用 Cognitive Kernel-Pro + Claude-3.7-Sonnet 在 WebAggregatorQA 上收集 90 个任务、2,997 个 agent actions。
- 对错误轨迹做人工错误点标注,得到 555 个 error points。
- 归纳为五大类、十三个子类失败模式,其中 Finding Sources 和 Reasoning 是主要失败来源。
- 五大 rubric 类别为:Finding Sources、Reasoning、Problem Understanding and Decomposition、Action Execution、Trajectory Efficiency。
DeepVerifier 三模块:
- Decomposition agent:先把超长轨迹压缩成 step-indexed synopsis,记录每一步访问的 source、检索到的事实/数字/引用;再根据 taxonomy 找潜在错误点,并生成 follow-up verification questions。
- Verification agent:用搜索、截图、代码执行等工具回答 follow-up questions。
- Judge agent:基于原回答、轨迹摘要、潜在错误、follow-up 问答给出 1 到 4 分;分数小于等于 2 视为错误。
Decomposition 的关键不是完整重做任务,而是将检查收窄到少量高价值问题。论文实验讨论中强调通常不超过 3 个 targeted follow-up questions,从而在成本上区别于重新执行整个 deep research task。
用于 self-evolution 时,agent 完成任务后调用 DeepVerifier 生成反馈,按反馈重试,直到 verifier 判为正确或达到轮数上限。反馈要求短、明确、可执行;如果 follow-up answers 已能确定正确答案,也可以直接给出修正方向。
DeepVerifier-4K 构造¶
DeepVerifier-4K 不是简单保存所有 verification 轨迹:
- 先从 WebAggregatorQA 收集 400 个 agent answers 和对应 trajectories。
- 用 Claude-3.7-Sonnet 版 DeepVerifier 验证这些答案和轨迹。
- 只保留 true positive 和 true negative 轨迹,即正确拒绝错误答案、正确接受正确答案的 verification。
- 平衡后转成 prompt-response pair,得到 4,646 条高质量 SFT 样本。
实验¶
关键结果:
- GAIA-Web ablation 中,DeepVerifier rejection F1 为 73.17;去掉 verification 只有 25.00;去掉 decomposition 为 61.54。
- GAIA Full 上,Claude-3.7 backbone 从 52.22 提升到反馈 4 轮时的 60.12,最终第 10 轮为 58.93,Best Gain 为 7.90。
- GAIA Web 上,Claude-3.7 从 51.11 提升到最高 63.33,Best Gain 为 12.22。
- XBench-DeepSearch 从 41.0 提升到最高 47.0,BrowseComp 从 5.0 提升到最高 10.0。
- DeepVerifier-4K 训练的 DeepVerifier-8B 在 GAIA Full 上从 26.73 提升到 32.21,gain 为 5.48。
ablation 的含义:
- Verification是 decomposition-only / LLM judge baseline,能抓明显错误,但缺少外部查证,容易漏掉 secondary-source dependence、overconfident claims 和 hallucinated facts。- Decomposition是 agent-as-judge baseline。它仍能访问外部来源,但没有 taxonomy-guided vulnerability localization,容易退化成重新完整解题,从而犯和原 agent 类似的推理错误。
多轮 feedback 的峰值现象来自两种转移的权衡:早期 incorrect-to-correct 转移强,很多错误答案被修正;但 correct-to-incorrect 也持续存在,即 verifier 或反馈噪声会让部分原本正确的答案被改坏。论文 Table 5 显示前者衰减更快,后者较弱但持续,因此整体收益通常在第 3 到 4 轮附近达到高点。
泛化实验中,XBench-DeepSearch 是中文 search/tool-use benchmark,BrowseComp 测极难检索和信息纠缠场景,说明 DeepVerifier 的收益不只来自 GAIA-Web 分布。
局限¶
论文自述 DeepVerifier 依赖底层模型严格遵循 rubric、执行 cross-check、输出结构化反馈的能力;弱模型或工具使用能力不足时,反馈质量会下降。测试时多轮 verification 也带来额外延迟和成本。
ORM/Verifier 启发¶
- 主观/开放 agent 任务中的 verifier 不一定输出单个分数,rubric + follow-up evidence check 更有用。
- Verifier 可以把“整体重做任务”拆成“定位风险点并查证”,降低 silent failure。
- Failure taxonomy 是构建 hard negative 和 rubric 的核心资产。
- 多轮反馈收益会在 3 到 4 轮左右达到高点,后续可能出现收益递减或 correct-to-incorrect regression。
- DeepVerifier 的关键流程应理解为“长轨迹摘要 -> taxonomy-guided 风险定位 -> 少量证据问题查证 -> rubric judge -> 可执行反馈”,而不是普通 LLM judge prompt。
- 对 agent verifier 来说,source quality、trajectory efficiency 和 tool/action correctness 都是 reward/verifier 需要显式建模的对象,不只是最终答案语义正确性。
与其他论文关系¶
DeepVerifier 把 verifier 从 math/code selection 扩展到 deep research agent 的长轨迹验证。与 Agentic Verifier 相似,它都把 verifier 设计为可调用工具的 agent;不同点是 DeepVerifier 用 rubric 和证据查证,Agentic Verifier 用程序执行反例。