新方法SBW提升LLM智能体水印抗改写与防伪造能力

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对LLM智能体现有行为水印在动作重命名或观测改写后失效(比特恢复率降至16.8%)且缺乏防伪造机制的缺陷,新提出的语义行为水印(SBW)基于语义动作聚类与密钥抗碰撞分桶机制进行嵌入。在5个模型(3B-14B)与3种编码器的测试中,面对改写攻击,聚类级检测率在ToolBench达0.49-0.66,ALFWorld达0.92-0.97,远超精确符号匹配的0.05-0.17与0.00-0.01。密钥分桶将自适应伪造率从100%降至误报底限。代价是每步水印容量损失约一半,且对链式重放攻击防御仍为开放问题。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

现有水印方案的两大缺陷

此前针对大模型智能体的行为水印存在两方面不足。第一,已有方案将水印与精确的动作符号绑定,一旦工具被重命名,即便观测未变也会导致解码失步;在AgentMark的鲁棒性测试中,仅对观测进行改写就会让比特恢复率暴跌至16.8%。第二,以往研究仅关注水印被移除的风险,忽略了对手伪造一条能验证为他人所有的轨迹的可能性,而文本水印领域已证实此类伪造可行。

SBW的语义聚类与密钥分桶机制

语义行为水印(SBW)通过在历史条件下的语义动作聚类进行水印嵌入,取代了脆弱的精确符号匹配。同时,方案将公开聚类分桶替换为基于密钥的抗碰撞分桶,其新桶分配在随机预言机模型下被证明是不可预测的。该设计使自适应伪造成功率从100%骤降至误报率底限(以bge编码器、r=64为例),有效封堵了伪造漏洞。

多模型评测与性能代价

在涵盖4家供应商、参数量3B至14B的5个智能体模型及3种编码器的评测中,SBW在1%校准误报率下表现稳定。在ToolBench(每模型600条轨迹),聚类级改写检测率达0.49-0.66,远超精确符号级的0.05-0.17,选择一致率为72-83%(逻辑偏置仅22-27%);在ALFWorld(每模型100轮),检测率达0.92-0.97对0.00-0.01。然而,获取抗改写鲁棒性需消耗约一半的单步水印容量。此外,面对对手复制受害者自身步骤的攻击,打乱拼接被有效中和,但链式重放在五模型上仍达0.76-0.98,属未解决的开放问题。

为什么值得看

解决了智能体水印在工具重命名与改写下的脆弱性及伪造漏洞,为LLM智能体溯源提供更可靠方案。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents

关键事实

  • 现有智能体水印在观测被改写时比特恢复率降至16.8%,且未考虑伪造攻击。[1]

  • SBW采用语义动作聚类与密钥抗碰撞分桶,在1%误报率下,改写检测率在ToolBench为0.49-0.66,ALFWorld为0.92-0.97。[1]

  • 密钥分桶机制将自适应伪造成功率从100%降至误报底限。[1]

  • 抗改写鲁棒性使每步水印容量损失约一半,且对链式重放攻击(成功率0.76-0.98)防御仍待解决。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。