SPECTRA架构实现推测解码自适应执行,FPGA实测最高加速2.61倍
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
边缘设备大模型推理受限于算力与内存。推测解码的验证阶段算术强度随推测长度与接受率变化,导致其处于访存密集与计算密集的中间态,固定硬件难以高效处理。SPECTRA提出运行时可重构分片架构,片内计算引擎在脉动与向量执行间切换,片间动态调整并行度、核划分与通信模式,逐核重配置。在20分片FPGA原型上基于Pythia等模型评估,片内重配带来最高2.09倍加速,片间自适应再增1.25倍提升。该成果被ICCAD 2026接收。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载推测解码的硬件利用率瓶颈
大模型在边缘侧推理时,自回归解码受限于算力与访存。推测解码用小模型起草词元并以目标模型批量验证来缓解此问题。然而,验证阶段的算术强度并非固定,它会随推测长度与接受率动态变化,使其处于访存密集的通用矩阵向量乘(GEMV)与计算密集的通用矩阵乘(GEMM)之间的中间态,导致传统固定硬件设计难以维持高利用率。
片内与片间双层动态重配置
SPECTRA架构通过双层可重构机制应对上述动态性。在片内层面,计算引擎能在处理GEMM的脉动执行与处理GEMV的向量通道执行之间切换。在片间层面,架构通过动态选择分片数量、核划分方式及通信模式来调整计算并行度。片内与片间的重配置均以逐核方式运行,确保在推测解码的多种计算模式下均能高效执行。
FPGA原型评估与加速效果
研究在20分片的FPGA原型上对SPECTRA进行评估,测试覆盖了Pythia、SmolLM2及GPT-2模型家族。结果显示,相较于固定设计,片内重配置最高带来2.09倍的加速,而片间自适应能力进一步带来1.25倍的性能提升。该论文已被IEEE/ACM计算机辅助设计国际会议(ICCAD 2026)接收。
为什么值得看
解决推测解码验证阶段算术强度动态变化的硬件利用率瓶颈,为边缘端大模型高效推理提供新架构。
大模型算力论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
