研究揭示混合语言模型过度依赖注意力机制,提出辅助损失优化记忆协调
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
循环注意力混合语言模型虽结合了注意力精确召回与循环层长上下文信息整合的优势,但实际严重偏向注意力路径,循环层利用率受限。常规微调仅加剧该依赖,未改善双路径协调。为此,研究者引入辅助损失:限制注意力访问早期上下文,让循环状态贯穿全序列,迫使模型同时利用循环路径。该方法显著提升整体性能,在长上下文及需信息聚合的任务上增益尤为突出。该失衡现象与辅助损失的改善效果在多种混合模型、问答及智能体任务,乃至结合不同记忆形式的注意力模型中均具泛化性,表明多路径需定向监督方能有效协同。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载混合模型记忆路径失衡
循环注意力混合语言模型旨在融合两类机制的优势:注意力层支持从早期词元精确召回记忆,循环层则擅长在长上下文中整合分散信息。然而,研究观察到,仅提供两种路径并未让模型有效利用它们。模型实际运行时严重偏向注意力路径,对循环状态传递的信息使用十分有限。常规的标准监督微调虽能提升整体表现,却无法改善两种记忆路径的协调方式,反而使模型进一步加深对注意力层传播信息的依赖,循环层的信息利用依然受限。
辅助损失强制路径协同
为促进双路径更好协调,研究提出添加辅助损失函数。该机制在循环状态沿完整序列传播时,限制注意力层对早期上下文的访问。此目标迫使模型在注意力之外,必须通过循环路径保留并使用信息。实验表明,该方法提升了整体性能,在涉及长上下文或需要信息聚合的任务上增益尤为显著,这与循环层在分析中展现的特长相符。
失衡现象与解法的泛化性
该研究的核心发现是,仅提供多种记忆路径无法确保其被有效使用,需针对性监督来协调。这种记忆路径失衡及辅助损失的改善效果具备泛化能力:不仅适用于多种循环注意力混合模型在问答与智能体任务中的表现,同样适用于结合了不同记忆形式的纯注意力模型。这表明该问题与解法是混合架构中具有普遍性的底层规律。
为什么值得看
揭示混合模型记忆路径失衡的普遍问题并提供即插即用的辅助损失解法,对长上下文与智能体任务开发有直接参考价值。
智能体微调
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
