新梯度归因框架实现大模型注意力头大规模因果分析
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Paweł Mąka等人提出基于梯度的注意力头归因策略,将Token级Max-Margin损失反向传播至注意力图,使LLM注意力头的大规模因果分析成为可能。在上下文感知机器翻译消歧任务中,对4个模型及4个语言方向的50种现象进行评估。实验证实该方法与提升特定token关系注意力分数的效果一致,并揭示存在提升模型表现的“通用”注意力头,且头对关系的平均注意力与性能无关,表明模型训练中产生了头功能冗余。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载梯度归因框架设计
为解决大语言模型注意力头分析的可扩展性问题,研究者引入了一种基于梯度的头归因策略。该框架的核心做法是将Token级别的Max-Margin损失进行反向传播,直至传导到注意力图上。这种基于梯度的归因方式使得对注意力头进行大规模的因果分析成为可能,从而克服了以往方法难以直接应用于LLM的局限,为深入探究模型内部工作机制提供了可行路径。
实验验证与现象评估
研究在上下文感知机器翻译的消歧任务上对所提方法进行了验证。评估范围覆盖了4种不同的模型以及4个语言方向,共涉及50种消歧现象。为了确保该归因方法的鲁棒性,研究者在3个模型和2个语言方向上,实证检验了该方法与提升特定token间关系注意力分数所产生效果的对齐程度,结果证实了该分析框架的稳健性与可靠性。
模型内部机制发现
通过大规模分析,研究揭示了模型内部注意力头的运作规律。一方面,模型中存在所谓的“通用”注意力头,当这些头关注不同关系时,能够有效提升模型的整体表现。另一方面,一个注意力头分配给某种关系的平均注意力大小,并不必然与模型的最终性能相关联。这一发现表明,模型在训练过程中针对头的功能发展出了冗余机制,并非所有注意力分配都直接决定输出质量。
为什么值得看
提供适用于LLM的注意力头因果分析框架,揭示模型内部头功能冗余,为理解与优化大模型机制提供新工具。
大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
