DAGent提出增量规划框架,深度研究任务性能超开源基线

论文AI 评分 78/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对深度研究智能体现有DAG系统“先规划后修补”策略在证据薄弱时过早提交计算、后期修正浪费资源的问题,DAGent框架引入“评估再生长”增量规划机制。编排器依据已完成节点的置信度与不确定性信号逐批扩展任务图,并配合层级上下文层传播精简查询文档。其配套强化学习算法DAGRPO在执行器上注入拓扑条件信用与结构合规正则化。在BrowseComp-Plus等三个基准上,Qwen3-235B-A22B规模下较最强开源基线高出5.3/5.8/2.0个点,优势跨骨干网及GPT-5复现。Qwen3-8B规模下,DAGRPO较同预算仅看结果基线平均Pass@1提升3.0点。同架构对比显示,证据条件规划以更低token与工具调用足迹实现更高准确率。该论文已被NeurIPS 2026接收。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

增量规划替代先规划后修补

现有基于有向无环图(DAG)的多智能体系统在处理深度研究任务时,通常在执行前实例化任务级规划,仅在观察到失败或缺失证据后才修补图谱。这种策略在系统证据最弱时做出最强承诺,后续修正会浪费本不该规划分支的计算资源。DAGent框架提出“评估再生长”增量规划,编排器每次依据已完成节点发出的置信度与不确定性信号,逐批扩展任务图,避免过早提交不可靠的计算分支。

层级上下文与结构强化学习

为控制上下文开销,DAGent引入层级上下文层,默认传播精简的QueryDocs,同时保留完整执行轨迹供按需召回。此外,DAG拓扑可提供仅看结果的方法无法定义的结构强化学习信号。DAGRPO作为GRPO的适配变体,在执行器展开上注入拓扑条件信用,并在编排器计划上施加结构合规正则化,从而利用图结构优化规划与执行。

评测表现与资源开销对比

在BrowseComp-Plus、GAIA和xbench-DeepSearch三个基准上,Qwen3-235B-A22B规模的DAGent较最强开源基线分别提升5.3、5.8和2.0个点。该领先优势在四个开源骨干网及327K上下文的GPT-5上均得到复现。在Qwen3-8B规模下,DAGRPO较同预算仅看结果的GRPO基线平均Pass@1提升3.0点。同架构对比表明,证据条件规划在单任务token、工具调用和步骤足迹更低的情况下,达到了比先规划后修补策略更高的准确率。

为什么值得看

解决多智能体深度研究过早规划导致算力浪费痛点,以增量生长与结构RL显著提升准确率并降低调用开销。

GPTQwen智能体强化学习基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源DAGent: Evaluate-then-Grow Planning for Deep Research Agents

关键事实

  • DAGent框架采用评估再生长增量规划,编排器依据已完成节点的置信度与不确定性逐批扩展任务图[1]

  • DAGRPO算法在执行器上注入拓扑条件信用,并在编排器计划上施加结构合规正则化[1]

  • 在三个基准测试中,Qwen3-235B-A22B规模下较最强开源基线分别高出5.3、5.8和2.0个点[1]

  • Qwen3-8B规模下,DAGRPO较同预算仅看结果的GRPO基线平均Pass@1提升3.0点[1]

  • 该论文已被NeurIPS 2026接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。