研究提出EffectMatch运行时,阻断智能体未授权持久影响
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
大语言模型智能体在操作软件系统时,已授权动作可能产生未授权的持久副作用(如更新数据库后触发未授权通知),现有防护仅记录事后影响而不校验,导致错误结果被后续步骤采纳。为此,研究提出EffectMatch运行时机制,在受控执行边界内收集持久变更,并与应用当前状态授权内容比对,依比对结果决定提交与后续执行。在206项公开业务任务评测中,该机制保留了所有正常执行并阻止了全部错误提交,消融实验与拓扑测试也验证了其各模块不可或缺,能有效阻断与授权不符的持久影响向下传播。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载智能体持久副作用隐患
大语言模型智能体正越来越多地直接操作软件系统,执行修改数据库或在线服务等动作,而不再局限于生成文本。然而,即便一个数据库更新动作已获授权,其执行过程仍可能产生超出预期变更范围的持久影响,例如留下未授权的通知。当前的安全防护机制通常只能批准动作或记录其事后影响,却无法在智能体继续执行前校验这些持久结果。这导致未授权的结果可能被误判为成功,并传播至后续工作流步骤中,引发安全隐患。
EffectMatch校验机制原理
为解决上述问题,研究提出了EffectMatch运行时机制。该机制在受控的执行边界内收集执行所产生的持久变更,并将其与应用程序针对当前状态和执行所授权的内容进行比对。这种比对结果直接控制变更的提交以及依赖于此的后续执行步骤。通过这种方式,EffectMatch确保了只有与授权一致的持久变更才会被提交和传递,从而在运行时阻断了未授权影响的扩散。
实验评测与消融分析
在针对206项公开业务任务的对比评测中,EffectMatch保留了所有原本干净的执行,并成功阻止了所有测试中的错误提交。此外,六组各20次的消融实验揭示了移除任何单一机制都会导致失败,证明了各组件的不可或缺性。同时,80项任务拓扑测试案例表明,该机制能够保持有效步骤间的真实交接,并阻断无效的继续执行。这些结果共同表明,EffectMatch能够有效阻断与应用授权不一致的持久影响被静默接受和向下游传播。
为什么值得看
解决LLM智能体执行动作产生未授权持久副作用并被后续放大的安全隐患,对构建安全可靠的智能体工作流至关重要。
智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
