AI 圈大事记

MS-GLA提出多时间分辨率分解,突破GLA表征瓶颈

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

门控线性注意力(GLA)因所有头以单一时间分辨率处理token,难以兼顾局部句法与长程语义,产生表征瓶颈。MS-GLA将注意力头分配至多时间分辨率:粗分辨率池化长token跨度专攻长程依赖,细分辨率保留局部句法敏感度。引入可学习的输入依赖融合层动态重组各组输出,在不增加单头状态大小下扩充有效记忆容量。同等参数量下,MS-GLA在语言建模平均困惑度降低9.5%,召回密集型任务准确率提升达18.9%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

GLA单一分辨率的瓶颈

门控线性注意力Transformer通过数据依赖门控推进线性循环模型,但存在核心局限:其固定容量的记忆矩阵在所有注意力头中均以单一时间分辨率运作。每个token被单独处理,迫使模型必须同时编码局部句法模式与长程语义结构,从而产生表征瓶颈,仅靠门控机制无法解决该问题。

多时间分辨率头分配

MS-GLA借鉴多尺度状态空间模型原理,将注意力头分配至多个时间分辨率以化解上述瓶颈。较粗的分辨率自然地池化更长的token跨度,专门用于捕捉长程依赖关系;较细的头组则保持对局部句法结构的敏感度。此外,模型引入可学习且依赖输入的融合层,在每个时间步动态重组各头组输出,在不增加单头状态大小的前提下扩充了有效记忆容量。

实验表现与提升幅度

研究在语言建模、召回密集型任务及长上下文泛化上评估了MS-GLA。在匹配参数量的条件下,MS-GLA在所有设置中均比GLA取得更高准确率与更低困惑度。具体而言,召回密集型任务准确率最高提升18.9%,语言建模基准平均困惑度降低9.5%,验证了多时间分辨率分解是对门控线性注意力的一种有效扩展。

为什么值得看

在不增单头状态大小下大幅扩充有效记忆容量,为长上下文与召回密集型任务提供新架构思路。

信源1 家

  1. [1]arXiv cs.AI一手信源MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution

关键事实

  • GLA因固定容量记忆矩阵以单一时间分辨率处理token,产生表征瓶颈。[1]

  • MS-GLA将注意力头分配至多时间分辨率,粗分辨率专攻长程依赖,细分辨率保留局部句法敏感度。[1]

  • 引入可学习且输入依赖的融合层动态重组头组输出,不增单头状态大小下扩充有效记忆容量。[1]

  • 同等参数量下,MS-GLA语言建模平均困惑度降9.5%,召回密集型任务准确率提升达18.9%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。