DAGent提出增量规划框架,深度研究任务性能超开源基线
论文AI 评分 78/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对深度研究智能体现有DAG系统“先规划后修补”策略在证据薄弱时过早提交计算、后期修正浪费资源的问题,DAGent框架引入“评估再生长”增量规划机制。编排器依据已完成节点的置信度与不确定性信号逐批扩展任务图,并配合层级上下文层传播精简查询文档。其配套强化学习算法DAGRPO在执行器上注入拓扑条件信用与结构合规正则化。在BrowseComp-Plus等三个基准上,Qwen3-235B-A22B规模下较最强开源基线高出5.3/5.8/2.0个点,优势跨骨干网及GPT-5复现。Qwen3-8B规模下,DAGRPO较同预算仅看结果基线平均Pass@1提升3.0点。同架构对比显示,证据条件规划以更低token与工具调用足迹实现更高准确率。该论文已被NeurIPS 2026接收。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载增量规划替代先规划后修补
现有基于有向无环图(DAG)的多智能体系统在处理深度研究任务时,通常在执行前实例化任务级规划,仅在观察到失败或缺失证据后才修补图谱。这种策略在系统证据最弱时做出最强承诺,后续修正会浪费本不该规划分支的计算资源。DAGent框架提出“评估再生长”增量规划,编排器每次依据已完成节点发出的置信度与不确定性信号,逐批扩展任务图,避免过早提交不可靠的计算分支。
层级上下文与结构强化学习
为控制上下文开销,DAGent引入层级上下文层,默认传播精简的QueryDocs,同时保留完整执行轨迹供按需召回。此外,DAG拓扑可提供仅看结果的方法无法定义的结构强化学习信号。DAGRPO作为GRPO的适配变体,在执行器展开上注入拓扑条件信用,并在编排器计划上施加结构合规正则化,从而利用图结构优化规划与执行。
评测表现与资源开销对比
在BrowseComp-Plus、GAIA和xbench-DeepSearch三个基准上,Qwen3-235B-A22B规模的DAGent较最强开源基线分别提升5.3、5.8和2.0个点。该领先优势在四个开源骨干网及327K上下文的GPT-5上均得到复现。在Qwen3-8B规模下,DAGRPO较同预算仅看结果的GRPO基线平均Pass@1提升3.0点。同架构对比表明,证据条件规划在单任务token、工具调用和步骤足迹更低的情况下,达到了比先规划后修补策略更高的准确率。
为什么值得看
解决多智能体深度研究过早规划导致算力浪费痛点,以增量生长与结构RL显著提升准确率并降低调用开销。
GPTQwen智能体强化学习基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
