AI 圈大事记

CIPL框架评估大模型智能体黑盒隐私可恢复泄露

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

当前大模型智能体隐私泄露评估多局限于单一组件,难以区分内部暴露与外部可恢复信息。CIPL框架通过信道反转评估黑盒隐私泄露,将目标表征为从敏感源到提取的六阶段流程,评估敏感单元向攻击者可恢复输出的转化。实验覆盖记忆、检索、工具介导目标及BrowserUse实例,表明存储标签无法单独决定可恢复性:记忆目标近饱和,检索泄露常为部分,工具与实例泄露随观察面、对齐度、检索深度及提供方行为强变化。分层语义审计可识别精确匹配遗漏的有用披露。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

现有评估局限与CIPL提出

大模型智能体的隐私泄露评估通常在记忆、检索或工具使用等单一组件内进行,这种割裂的方式难以区分内部信息暴露与外部观察者实际可恢复的信息。为解决此问题,Tao Huang等人提出CIPL(信道反转隐私泄露)框架,这是一个针对大模型智能体黑盒隐私泄露的信道感知评估框架,旨在统一衡量内部敏感依赖如何转化为外部可恢复的泄露。

框架流程与实验发现

CIPL将目标表征为六个阶段:敏感源、选择、组装、执行、观察和提取,并在共享协议下评估从选定的敏感单元到攻击者可恢复输出的转化。实验覆盖了基于记忆、检索介导和工具介导的目标,以及BrowserUse实时智能体案例。结果显示,仅凭存储标签无法决定可恢复性:记忆目标构成近饱和参考案例,检索介导泄露常为部分,而工具介导与实时智能体泄露则随观察面、提示与信道对齐度、检索深度和提供方行为发生强烈变化。

语义审计与框架价值

研究进一步指出,传统的精确匹配方法会遗漏攻击者可利用的信息披露,而分层语义审计能够有效识别这些披露。因此,CIPL提供了一个通用框架,使得在异构智能体管线中比较内部敏感依赖被实现为外部可恢复泄露的方式成为可能。该论文共58页,包含4幅图及附录,提交于2026年9月18日。

为什么值得看

提供跨异构智能体管线对比内部敏感依赖转化为外部可恢复泄露的统一评估框架。

大模型智能体对齐

信源1

  1. [1]arXiv cs.AI一手信源CIPL: A Channel-Aware Framework for Recoverable Privacy Leakage in LLM Agents

关键事实

  • CIPL是一个用于评估大模型智能体黑盒隐私泄露的信道感知框架。[1]

  • 该框架将目标表征为敏感源、选择、组装、执行、观察和提取六个阶段。[1]

  • 实验表明存储标签无法单独决定可恢复性,记忆目标形成近饱和参考案例。[1]

  • 工具介导与BrowserUse实例的泄露随观察面、提示信道对齐、检索深度及提供方行为强烈变化。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。