AI 圈大事记

新系统Env-Rethink让LLM智能体在复杂环境中表现提升超15%

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现实任务中,LLM智能体常因环境信息碎片化、有效证据与误导信息混杂、以及环境随时间演变产生新噪声,导致性能大幅下降(如从83.9%降至57.6%)。为此,研究提出Env-Rethink系统,其内置27B后训练模型,通过构建集合图与事件日志补充上下文、利用离线轨迹学习识别噪声、并基于虚拟事件历史演化环境来增加挑战,实现智能体递归自我改进。实验表明,该系统在30项任务上使9个模型的评分通过率提升超15.1%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

智能体环境交互痛点

在办公流程或科学实验等现实场景中,大语言模型智能体需与环境反复交互以执行依赖上下文的操作。然而现有环境往往对智能体并不友好:一是信息散落且呈现碎片化;二是有效证据常与误导性内容及冲突版本交织;三是环境会随时间推移而演变,持续引入新噪声与更棘手的任务。这三重挑战致使当前最先进的AI智能体性能出现显著滑坡,例如准确率从83.9%急剧跌至57.6%。

Env-Rethink核心机制

为应对上述难题,研究团队提出Env-Rethink系统,其核心为一个27B参数的后训练模型。该系统具备三项关键能力:首先,能自适应构建集合图以组织关联文件,并生成事件日志来明确跨数据关系,从而补全必要上下文;其次,借助离线轨迹学习微调后的模型,精准定位环境中潜藏的噪声问题;最后,通过虚拟事件历史推动环境演化,改变其状态与证据关联,生成更具难度的环境以促进智能体递归式自我改进。

实验效果与验证

实验验证了Env-Rethink对下游任务表现的提升作用。在涵盖30项任务的测试集中,9个不同模型应用该系统后,评分通过率均获得超15.1%的增幅。这表明通过重塑和演化智能体运行环境,能有效克服环境噪声与信息碎片化带来的性能衰减,为提升智能体在复杂动态现实场景中的鲁棒性提供了可行方案。

为什么值得看

解决LLM智能体因环境不友好导致性能骤降的痛点,提供通过环境演化实现智能体自我改进的新路径。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Breaking the Environment Wall: Evolving LLM Agent Environments for Recursive Self-Improvement

关键事实

  • 环境信息碎片化、证据混杂误导及环境演变会使顶级AI智能体性能从83.9%降至57.6%[1]

  • Env-Rethink系统包含一个27B参数的后训练模型[1]

  • 该系统通过构建集合图与事件日志补充上下文,识别环境噪声,并演化环境产生更难任务[1]

  • 实验显示Env-Rethink在30个任务上让9个模型的评分通过率提升超15.1%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。