研究称强化学习可轻易击破模型蒸馏防御
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对闭源大模型推理能力的蒸馏攻击,现有防御机制通常仅在蒸馏后评估,默认攻击者不再训练。该研究指出,若攻击者后续引入强化学习,原本看似有效的防御会被击穿,降低攻击门槛。仅用API易得数据进行的简单攻击,其窃取推理能力的提升效果,竟等同于提取完整隐藏轨迹的复杂攻击。只要防御仍泄漏足以重建近似推理轨迹的信息,便大概率失效,批级防御或更有效。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载防蒸馏威胁模型错配
现有针对闭源大模型推理能力窃取的防御手段,普遍存在威胁模型设定不当的问题。它们往往假设攻击者在完成模型蒸馏后便会停止训练,并以此为基础进行安全性评估。然而,更贴合现实的威胁模型应当包含攻击者在蒸馏之后继续开展强化学习训练的环节。这种错误假设会带来虚假的安全感,因为部分在蒸馏阶段看似坚固的防御措施,一旦遭遇后续强化学习便会被轻易击穿。
简单攻击效果匹敌复杂攻击
强化学习的引入实质上降低了蒸馏攻击奏效的门槛。研究表明,攻击者仅利用当前API极易获取的数据开展简单攻击,就能有效窃取闭源模型的推理能力。这种简单攻击所带来的推理能力提升幅度,竟然等同于那些设法提取完整隐藏推理轨迹的复杂攻击。这意味着攻击成本被大幅压缩,而防御方面临的挑战显著加剧。
防御失效条件与替代方向
研究结果显示,只要某种蒸馏防御机制仍然泄漏了足以重建近似推理轨迹的信息,该防御就极大概率是无效的。这从根本上否定了许多试图在允许部分信息流通下进行防御的思路。作为应对方向的探讨,文章指出批级蒸馏防御可能具备更高的有效性,为后续构建真正可靠的防蒸馏机制提供了新的切入点。
为什么值得看
揭示现有防蒸馏机制的致命盲区,证明RL可轻易绕过防线,重塑闭源模型安全评估范式。
大模型强化学习蒸馏API
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
