DAEDALUS方法让智能体通过自生成任务构建记忆
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载双智能体协作构建记忆
大模型智能体进入陌生环境时常因缺乏操作知识而重复出错,现有方案多依赖人工指南或需验证器的训练任务。DAEDALUS摒弃了这些先验知识,通过探索者与求解者双智能体闭环自举记忆。探索者与环境交互,产出难度适中且可解的练习任务;求解者则去执行这些任务。若求解失败,系统会从失败中提取启发式规则,但该规则不会直接入库,必须等待求解者在带有该规则的上下文中反复成功验证后才被正式采纳。同时,求解成败会作为信号反馈给探索者,以动态调整后续生成任务的难度,确保练习既具挑战性又不至于无解。
性能提升与成本优势
在AppWorld、τ²-bench和AutomationBench三项测试中,DAEDALUS构建的记忆带来了显著收益。对比无记忆基线,其平均成功率最高增加15.9个百分点,pass^5指标最高达2.2倍。即便与依赖训练任务的方法相比,它也具备竞争力,且推理开销更低。消融实验表明,仅需较小的探索预算即可显现性能增益,且对早期发现进行因式分解能让探索更具成本效益。此外,求解者的执行轨迹是推导有效启发式规则的关键信息源。
跨模型泛化与评测代理
DAEDALUS生成的记忆具备良好的通用性,为某一模型家族提取的启发式规则,同样能提升其他模型家族智能体的表现,打破了记忆与特定模型强绑定的局限。除了构建记忆本身,研究还发现该系统自生成的任务集可作为基准测试的代理:依据模型在这些任务上的表现进行排序,其结果与标准基准排序高度一致。这为缺乏标准评测集的新环境提供了一种自动构建评测指标的途径。代码及相关产物已开源。
为什么值得看
无需人工先验知识即可自动构建智能体记忆,显著提升新环境下的任务成功率并降低推理成本。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
