研究揭示大视觉语言模型视觉巨幅激活的脆弱性与干预机制
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
大视觉语言模型从纯文本基座继承了巨幅激活现象,即少数固定隐藏通道出现数值远超常规的尖峰。文本尖峰固定出现在早期层,而视觉尖峰则因模型和图像而异。研究发现部分模型不产生视觉尖峰,产生尖峰的模型多位于更深层,且尖峰token多位于与图像其余部分共享信息最少处。视觉尖峰极其脆弱,常见图像损坏常导致尖峰产生或重定位。基于触发方向的攻击仅需极小预算即可创建或移除尖峰,而预防性干预可在尖峰爆发前移除触发组件,大幅削减尖峰且几乎不影响其他token。研究覆盖25个基于18个基座的适配器模型,参数量从2B到72B。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载视觉尖峰的形成规律
大视觉语言模型从纯文本基座继承了巨幅激活现象,表现为少数固定隐藏通道接收到远超典型量级数千倍的数值。文本尖峰独立于输入内容,系统性地出现在早期层的固定初始位置。相比之下,视觉尖峰在不同图像间存在差异。研究发现,并非所有模型都会形成视觉尖峰,而在产生尖峰的模型中,尖峰通常出现在更深层。研究识别出模型权重中的触发方向以及可解释的位置规则:在语言模型解码器运行前,最终的尖峰token主要局限于那些与图像其余部分共享信息最少的token。
视觉尖峰的脆弱性与攻击
视觉尖峰表现出惊人的脆弱性。常见的图像损坏频繁导致尖峰的产生和重定位,较少情况下会移除尖峰,从而整体上增加了尖峰的发生率。基于触发方向的尖峰攻击能够在极小的无穷范数预算下,故意创建或移除尖峰。在十个产生尖峰的模型中,有九个模型仅需1/255的预算就足以实施这种攻击。这表明视觉尖峰极易受到微小扰动的影响,模型的视觉处理过程存在显著的不稳定性。
预防干预与实验规模
针对视觉尖峰的脆弱性,研究提出了一种预防性干预方法。该方法在尖峰爆发前仅移除触发组件,能够在干净和扰动图像上消除或大幅减少尖峰,同时使其他图像token几乎保持不变。整个研究涵盖了广泛的模型范围,包括25个基于适配器的大视觉语言模型,这些模型构建在18个已发布的纯文本基座之上,来自10个模型家族,参数规模从2B到72B不等,验证了所发现规律和干预方法的普适性。
为什么值得看
揭示了大视觉语言模型中视觉尖峰的脆弱性及可干预性,对提升模型鲁棒性具有重要参考价值。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
