PASTABench发布:评估智能体多步轨迹安全与主动干预时机
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对LLM智能体多步操作风险累积与事后评估无法及时干预的问题,PASTABench基准被提出。它包含1139条多轮轨迹,覆盖5类风险及13子类,并引入最优干预窗口量化干预及时性。对16个LLM的评测显示,主动干预问题远未解决,表现最佳模型的最优时机干预率仅40.74%。细粒度诊断揭示小模型高分源于对危险词元的过敏反应而非真正理解风险,当危险词汇被中和后其主动干预能力大幅崩溃。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载智能体安全评估新基准
随着大语言模型向能改变现实状态的自主智能体演进,多步工作流中的操作安全成为关键挑战。现有评估存在局限:步骤级方法孤立看待动作而忽略风险累积,轨迹级评估属于事后性质无法提供及时干预机会。为此,研究者形式化解耦主动安全监控,从是否干预、何时干预及风险是什么三个维度进行界定,并推出PASTABench基准。该基准包含1139条多轮轨迹,横跨5个风险大类与13个子类,旨在填补多步操作中主动风险干预的评估空白。
干预时机量化与模型评测
为衡量干预的及时性,研究提出了最优干预窗口,该窗口由标注的最早信号轮与触发轮锚定。基于此对16个大语言模型进行评测,结果表明主动干预问题远未解决,最优模型在最优时机干预率上仅达40.74%。这意味着现有模型在多步执行流程中精准捕捉风险并适时介入的能力依然薄弱,难以满足真实应用场景对安全性的严苛要求。
小模型安全能力虚高假象
细粒度诊断揭露了普遍存在的词汇过拟合现象。部分体积较小的模型在安全评分上表现出竞争力,但这实际上掩盖了它们对危险关键词的过度敏感,而非具备对风险的真正理解。一旦 hazardous 词汇被中和处理,这些小模型的主动干预能力便大幅崩溃,暴露出其安全防御机制的脆弱性与表面性,这也为依赖小模型部署智能体敲响了警钟。
为什么值得看
揭示当前智能体安全干预能力严重不足及小模型安全评分虚高假象,为多步智能体安全评测提供新范式。
智能体量化安全
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
