POLAR框架通过双层本体评估动作可逆性以防范智能体调用风险
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型智能体调用工具的操作风险,现有安全机制多属事后反应,已有前置方法缺乏可审计的结构化判定。POLAR框架面向小型工具调用智能体,利用双层本体结构评估动作可逆性,为动作分配分级可逆分数并推导候选逆序列,未达阈值的调用在执行前被剪枝。在τ²-bench上对六个智能体模型的评测显示,四个模型在航空领域的平均任务奖励提升0.11至0.18分,但十八个模型-领域组合中仅八个整体改善,零售及较强模型常出现退化。该框架提供可审计的结构化检查并刻画任务效用权衡,奖励并非防范损害的直接度量。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载前置护栏的结构化判定
大模型工具调用智能体在动态环境中面临操作风险,多数安全机制仅在错误发生后才做出反应。现有的前置防范方法通常通过对思维链进行微调,或将自然语言护栏编译为运行时检查来实现,但这些方式均未暴露出结构化且可审计的判定结果。POLAR框架针对小型工具调用智能体,提出一种护栏机制,通过构建双层本体结构来评估动作的可逆性,从而在执行前进行风险干预。
可逆性评分与执行前剪枝
POLAR框架的核心机制是为每个动作分配分级的可逆性分数。该分数通过推导候选逆序列来得出,若动作的可逆性分数未能达到设定阈值,该调用将在执行前被直接剪枝拦截。这种基于本体引导的结构化检查,使得智能体在调用工具前能够获得可审计的判定结果,从而提前规避不可逆的高风险操作。
任务效用与安全防范的权衡
在τ²-bench上的评测覆盖了六个智能体模型。结果显示,六个模型中有四个在航空领域的平均任务奖励提升了0.11至0.18分。然而,在全部十八个模型与领域的组合中,仅有八个实现了整体改善。在零售领域以及表现较强的模型上,引入该护栏常导致性能退化。这表明POLAR虽提供了可审计的结构化检查,但也揭示了任务效用与风险防范之间的权衡,且任务奖励并不能直接度量实际防范的损害程度。
为什么值得看
为工具调用智能体提供前置、可审计的结构化安全护栏,揭示可逆性评估与任务奖励间的实际权衡。
大模型智能体安全论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
