AI 圈大事记

研究为双过程语言智能体引入记忆与反思模块

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究针对语言智能体在交互环境中的脆弱性,扩展了 SwiftSage 智能体。新增的自适应记忆模块(AMM)基于显著性进行存储,自我反思模块(SRM)用于执行时验证与纠错。在 ScienceWorld 的测试中,完整系统平均得分 64.62,成功率 43.17%,成功步骤效率为 19.33 步,优于其他配置。结果显示执行时控制是主要瓶颈,而记忆在运行循环稳定后作用显著。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

双过程智能体扩展

语言智能体在需要长跨度状态跟踪、有效动作执行以及从失败步骤中恢复的交互环境中表现脆弱。该研究扩展了 SwiftSage,这是一种结合了快速动作提议器和较慢规划器的双过程智能体。研究人员通过两个模块化的认知扩展来增强其能力:自适应记忆模块(AMM)和自我反思模块(SRM)。这两个模块均作为同一执行基底上的特性标志扩展实现,从而能够在 ScienceWorld 环境中进行受控的消融实验。

模块功能与机制

自适应记忆模块(AMM)负责基于显著性的情景存储和触发驱动的检索,旨在帮助智能体更好地利用历史信息。自我反思模块(SRM)则专注于有界执行时间的验证和纠正性干预,用于在动作执行过程中进行实时检查和修正。这种设计允许研究人员分别测试记忆和反思功能对智能体整体性能的影响,从而识别出不同组件在解决复杂任务时的具体贡献。

实验结果与发现

实验对比了基线、基线加 AMM、基线加 SRM 以及完整系统四种配置。结果显示,完整系统在平均最终得分、成功率和成功步骤效率方面均表现最佳,具体数值分别为 64.62、43.17% 和 19.33 步。其中,SRM 被证明是最强的独立贡献者。这一结果暗示,在该设定下,执行时控制是主导瓶颈,而情景记忆则在运行循环稳定后才能发挥最大效用。

为什么值得看

验证了记忆与反思机制对提升智能体长程任务性能的具体贡献。

智能体

信源1

  1. [1]arXiv cs.AI一手信源Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments

关键事实

  • 完整系统在 ScienceWorld 测试中平均得分 64.62,成功率 43.17%。[1]

  • 新增模块包括自适应记忆模块(AMM)和自我反思模块(SRM)。[1]

  • 研究指出执行时控制是主要瓶颈,记忆在运行稳定后最有用。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。