DAEDALUS方法让智能体通过自生成任务构建记忆

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型智能体在新环境中因缺乏历史记忆而重复犯错的问题,DAEDALUS提出无需人工任务或验证器即可构建可复用记忆的方法。该方法配对探索者与求解者双智能体:前者生成具挑战性且可解的任务,后者尝试求解。求解失败时提取启发式规则,仅当该规则在上下文中被反复验证成功后才采纳,并反馈给探索者调整后续任务难度。最终采纳的规则汇入记忆库供测试使用。在AppWorld等三个基准上,相比无记忆基线,平均成功率最高提升15.9个百分点,pass^5最高提升2.2倍,且推理成本低于多数基线。少量探索预算即可见效,所得启发式规则也能惠及其他模型家族的智能体。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

双智能体协作构建记忆

大模型智能体进入陌生环境时常因缺乏操作知识而重复出错,现有方案多依赖人工指南或需验证器的训练任务。DAEDALUS摒弃了这些先验知识,通过探索者与求解者双智能体闭环自举记忆。探索者与环境交互,产出难度适中且可解的练习任务;求解者则去执行这些任务。若求解失败,系统会从失败中提取启发式规则,但该规则不会直接入库,必须等待求解者在带有该规则的上下文中反复成功验证后才被正式采纳。同时,求解成败会作为信号反馈给探索者,以动态调整后续生成任务的难度,确保练习既具挑战性又不至于无解。

性能提升与成本优势

在AppWorld、τ²-bench和AutomationBench三项测试中,DAEDALUS构建的记忆带来了显著收益。对比无记忆基线,其平均成功率最高增加15.9个百分点,pass^5指标最高达2.2倍。即便与依赖训练任务的方法相比,它也具备竞争力,且推理开销更低。消融实验表明,仅需较小的探索预算即可显现性能增益,且对早期发现进行因式分解能让探索更具成本效益。此外,求解者的执行轨迹是推导有效启发式规则的关键信息源。

跨模型泛化与评测代理

DAEDALUS生成的记忆具备良好的通用性,为某一模型家族提取的启发式规则,同样能提升其他模型家族智能体的表现,打破了记忆与特定模型强绑定的局限。除了构建记忆本身,研究还发现该系统自生成的任务集可作为基准测试的代理:依据模型在这些任务上的表现进行排序,其结果与标准基准排序高度一致。这为缺乏标准评测集的新环境提供了一种自动构建评测指标的途径。代码及相关产物已开源。

为什么值得看

无需人工先验知识即可自动构建智能体记忆,显著提升新环境下的任务成功率并降低推理成本。

大模型智能体

信源1 家

  1. [1]arXiv cs.AI一手信源DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks

关键事实

  • DAEDALUS通过双智能体协作(探索者生成任务、求解者尝试任务)从自生成实践中构建可复用的智能体记忆。[1]

  • 在AppWorld、τ²-bench和AutomationBench上,相比无记忆基线,平均成功率最高提升15.9个百分点,pass^5最高提升2.2倍。[1]

  • 该方法无需人工编写指南、训练任务或验证器,且推理成本低于多数使用训练任务的基线方法。[1]

  • 生成的启发式规则可跨模型家族迁移,且自生成的任务可作为代理基准用于模型性能排名。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。