ScholarEvolve框架利用前沿文献驱动智能体架构终身进化

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对语言智能体持续改进需求,ScholarEvolve框架提出在固定底层大模型的前提下,通过自动引入前沿研究文献来指导智能体架构(即管理工具、记忆与任务执行的软件)的进化。该框架将进化方向划分为功能模块,运用主题建模为各模块识别改进策略,实施并组合评估以提升任务表现,且能随时间纳入新论文实现主动终身进化。实验显示,在AppWorld Challenge上,Qwen3.5-27B任务完成率从49.6%升至63.6%;在Tau2-Bench Telecom上,GPT-5.4-mini的pass@1从72.7%升至81.9%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

架构进化的动机与局限

随着语言智能体面临任务复杂度攀升,持续改进成为刚需。一种可行路径是在底层语言模型不变的情况下,进化智能体架构——即负责工具调用、记忆管理与任务执行的软件。现有自动化方法多依赖元编码智能体依据执行反馈修改架构,但这受限于该智能体既有知识与已观测失败,导致探索受限且适应呈被动反应式。

文献驱动的进化机制

受人类专家从研究文献获取新方案的启发,ScholarEvolve框架自动抽取前沿论文来引导架构进化。它把架构进化方向拆解为多个功能模块,借助主题建模为各模块锁定差异化改进策略,随后落地实施并评估策略组合效果。该机制能随时间推移不断吸纳新发表论文,促使研究进展驱动智能体进行主动的终身进化。

基准测试提升效果

在AppWorld与Tau2-Bench两个基准上的实验验证了该框架有效性。具体而言,针对AppWorld Challenge,Qwen3.5-27B的任务目标完成率由49.6%跃升至63.6%;针对Tau2-Bench Telecom,GPT-5.4-mini的pass@1指标由72.7%增长至81.9%。这表明引入学术文献能显著增强智能体在复杂任务上的表现。

为什么值得看

突破仅依赖执行反馈的被动适应局限,实现用学术文献驱动智能体架构主动进化,显著提升复杂任务完成率。

GPTQwen大模型智能体论文

信源1 家

  1. [1]arXiv cs.AI一手信源Learning from Research: Toward Lifelong Agent Harness Evolution

关键事实

  • ScholarEvolve框架通过自动引入前沿研究文献指导智能体架构进化,底层大模型保持固定。[1]

  • 该框架将进化方向划分为功能模块,用主题建模识别改进策略,并评估策略组合以提升性能。[1]

  • 在AppWorld Challenge上,Qwen3.5-27B任务完成率从49.6%提升至63.6%。[1]

  • 在Tau2-Bench Telecom上,GPT-5.4-mini的pass@1从72.7%提升至81.9%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。