新方法SBW提升LLM智能体水印抗改写与防伪造能力
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载现有水印方案的两大缺陷
此前针对大模型智能体的行为水印存在两方面不足。第一,已有方案将水印与精确的动作符号绑定,一旦工具被重命名,即便观测未变也会导致解码失步;在AgentMark的鲁棒性测试中,仅对观测进行改写就会让比特恢复率暴跌至16.8%。第二,以往研究仅关注水印被移除的风险,忽略了对手伪造一条能验证为他人所有的轨迹的可能性,而文本水印领域已证实此类伪造可行。
SBW的语义聚类与密钥分桶机制
语义行为水印(SBW)通过在历史条件下的语义动作聚类进行水印嵌入,取代了脆弱的精确符号匹配。同时,方案将公开聚类分桶替换为基于密钥的抗碰撞分桶,其新桶分配在随机预言机模型下被证明是不可预测的。该设计使自适应伪造成功率从100%骤降至误报率底限(以bge编码器、r=64为例),有效封堵了伪造漏洞。
多模型评测与性能代价
在涵盖4家供应商、参数量3B至14B的5个智能体模型及3种编码器的评测中,SBW在1%校准误报率下表现稳定。在ToolBench(每模型600条轨迹),聚类级改写检测率达0.49-0.66,远超精确符号级的0.05-0.17,选择一致率为72-83%(逻辑偏置仅22-27%);在ALFWorld(每模型100轮),检测率达0.92-0.97对0.00-0.01。然而,获取抗改写鲁棒性需消耗约一半的单步水印容量。此外,面对对手复制受害者自身步骤的攻击,打乱拼接被有效中和,但链式重放在五模型上仍达0.76-0.98,属未解决的开放问题。
为什么值得看
解决了智能体水印在工具重命名与改写下的脆弱性及伪造漏洞,为LLM智能体溯源提供更可靠方案。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
