AI 圈大事记

AgentXploit:针对AI智能体的白盒红队审计系统

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究提出AgentXploit,一种面向AI智能体部署前白盒审计的双角色系统,将代码层攻击路径发现与运行时利用分离。Analyzer追踪输入到敏感操作的路径,Exploiter将其转化为具体攻击并用运行反馈修正。同步推出含12个开源智能体系统、72个可复现漏洞的AgentXploit-Bench。三次运行中,该系统端到端攻击成功率达59.3%,Codex为38.4%(token预算对齐后为46.3%)。在给定注入点的AgentDojo上,Exploiter成功率79.2%,AgentVigil为52.7%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

双角色智能体审计机制

AI智能体结合大语言模型与外部工具,易受对抗内容干扰或软件漏洞影响。AgentXploit针对授权白盒部署前审计场景,提出双角色系统。Analyzer角色负责在代码库中追踪攻击者可控输入至敏感操作的流向,记录有代码支撑的候选攻击路径;Exploiter角色则负责将这些路径转化为具体攻击,并依据运行时反馈进行修正。该设计将代码层面的路径发现与运行时的漏洞利用视为两个独立挑战。

评测基准与核心数据对比

为评估该系统,研究引入AgentXploit-Bench基准,涵盖12个开源AI智能体系统及框架中的72个可复现安全漏洞。在三次端到端运行中,AgentXploit取得59.3%的攻击成功率,而Codex仅为38.4%;在token预算对齐的对比下,Codex成功率升至46.3%,仍显著落后。在提供注入点的AgentDojo环境里,仅使用Exploiter角色的攻击成功率达到79.2%,对比方案AgentVigil为52.7%。数据表明代码发现与运行利用分离的策略在端到端审计中优势明显。

为什么值得看

揭示代码层路径发现与运行时利用是智能体安全审计的独立挑战,并提供高效自动化红队工具与基准。

智能体对齐

信源1 家

  1. [1]arXiv cs.AI一手信源AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents

关键事实

  • AgentXploit将代码层攻击路径发现与运行时利用分离,由Analyzer和Exploiter两个角色完成。[1]

  • 发布AgentXploit-Bench,包含12个开源AI智能体系统中的72个可复现漏洞。[1]

  • 端到端测试中AgentXploit攻击成功率达59.3%,Codex为38.4%,token对齐后Codex为46.3%。[1]

  • 在AgentDojo上Exploiter攻击成功率79.2%,AgentVigil为52.7%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。