MS-GLA提出多时间分辨率分解,突破GLA表征瓶颈
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
门控线性注意力(GLA)因所有头以单一时间分辨率处理token,难以兼顾局部句法与长程语义,产生表征瓶颈。MS-GLA将注意力头分配至多时间分辨率:粗分辨率池化长token跨度专攻长程依赖,细分辨率保留局部句法敏感度。引入可学习的输入依赖融合层动态重组各组输出,在不增加单头状态大小下扩充有效记忆容量。同等参数量下,MS-GLA在语言建模平均困惑度降低9.5%,召回密集型任务准确率提升达18.9%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载GLA单一分辨率的瓶颈
门控线性注意力Transformer通过数据依赖门控推进线性循环模型,但存在核心局限:其固定容量的记忆矩阵在所有注意力头中均以单一时间分辨率运作。每个token被单独处理,迫使模型必须同时编码局部句法模式与长程语义结构,从而产生表征瓶颈,仅靠门控机制无法解决该问题。
多时间分辨率头分配
MS-GLA借鉴多尺度状态空间模型原理,将注意力头分配至多个时间分辨率以化解上述瓶颈。较粗的分辨率自然地池化更长的token跨度,专门用于捕捉长程依赖关系;较细的头组则保持对局部句法结构的敏感度。此外,模型引入可学习且依赖输入的融合层,在每个时间步动态重组各头组输出,在不增加单头状态大小的前提下扩充了有效记忆容量。
实验表现与提升幅度
研究在语言建模、召回密集型任务及长上下文泛化上评估了MS-GLA。在匹配参数量的条件下,MS-GLA在所有设置中均比GLA取得更高准确率与更低困惑度。具体而言,召回密集型任务准确率最高提升18.9%,语言建模基准平均困惑度降低9.5%,验证了多时间分辨率分解是对门控线性注意力的一种有效扩展。
为什么值得看
在不增单头状态大小下大幅扩充有效记忆容量,为长上下文与召回密集型任务提供新架构思路。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
