SQD系统优化次二次注意力推理
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究提出SQD异构解耦方案,针对次二次注意力大模型的算力与内存特性进行细粒度拆分。在模拟的8xB200异构系统中,GLM 5.2、Nemotron 3 Ultra和Gemma 4 31B的能效分别提升53%、31%和56%。在Rubin加LPX系统模型中,该方案在固定功耗下将吞吐量提升最高3.6倍。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载次二次注意力解耦方案
现有系统通常围绕密集注意力进行解耦服务决策,而该研究提出的SQD方案则围绕次二次注意力大模型独特的算力强度和内存占用进行异构解耦。这种细粒度的解耦机制将解码过程按二次和次二次注意力进行拆分,而非传统的算子类型拆分,适用于多种次二次注意力变体。
针对不同模型的拆分策略
对于稀疏注意力大模型,SQD将解码拆分为必须索引完整KV的top-k选择,以及具有静态内存占用的top-k注意力和前馈网络。对于线性注意力和滑动窗口注意力大模型,方案则将其拆分为密集注意力层,以及次二次注意力层加前馈网络。这种策略旨在匹配不同硬件架构的特性。
能效与吞吐量实测数据
实验在调整后的8xB200异构系统代理中进行,结果显示,相比最强仅GPU基线,GLM 5.2的平均tokens/J提升53%,Nemotron 3 Ultra提升31%,Gemma 4 31B提升56%。在基于Rubin加LPX系统的分析模型中,固定功耗预算下,该方案实现了1.2倍至1.5倍更紧凑的延迟,以及最高3.6倍的吞吐量提升。
为什么值得看
显著提升次二次注意力模型的推理能效与吞吐量,优化异构硬件利用率。
大模型算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
