PACE:针对工具调用LLM代理的溯源感知能力执行框架
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
工具调用LLM代理易受投毒元数据或记忆等影响,仅准入前审查无法解决安全与可用冲突。PACE框架在每次工具执行前进行拦截:通过路径限制裁剪影响路径,结合能力与效果验证比对授权。其区分认证执行契约与评估配置,支持阻断后恢复授权或执行修复。在8项安全基准与3个模型族测试中,该配置在79个攻击列的62个中取得严格最低攻击成功率,14个打平;原生效用最多仅降3分。消融实验显示安全增益主要源于效果验证,自适应搜索在30个越权目标上突破率为零。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载工具调用代理的安全困境
使用工具的LLM代理会将生成文本转化为真实副作用,因此投毒的工具元数据、检索页面、记忆或可复用技能均可操纵后续调用。仅在使用前审查工件无法解决此问题,因为安全与泄露变体可产生相同的准入证据,导致严格的网关无法为任一变体放宽限制。PACE框架将此条件精确化,明确部署仍可作用的最后边界,提出溯源感知能力执行机制,在每次工具调用执行前进行即时中介拦截。
PACE核心机制与验证
PACE框架包含三大核心机制:路径限制提出可执行裁剪以切断已表征的影响路径;能力与效果验证将模式定义的效果与从认证请求编译的权限进行核对;框架区分认证执行契约与评估配置,后者可在提议阻断后恢复授权调用或应用声明的修复。限制条件要求最终动作必须保留认证裁剪。在8个可执行代理安全基准与3个目标模型族的评估中,评估配置在79个合格攻击列的62个中给出严格最低攻击成功率,14个打平;全基准原生效用相较无防御代理最多损失3分。
安全增益归因与抗自适应攻击
针对1167对配对案例的完整消融实验表明,大部分安全增益归因于效果验证,而拒绝控制则归因于边界适应。在抗自适应攻击方面,缩小规模的自适应搜索针对防御在30个越权目标上的成功率为0/30,证明该框架对越权调用具备极强的阻断能力,且对代理正常效用的影响极小。
为什么值得看
为工具调用LLM代理提供近乎无损效用的强安全防护,解决投毒环境下准入审查的固有缺陷。
安全
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
