AI 圈大事记

SPECTRA架构实现推测解码自适应执行,FPGA实测最高加速2.61倍

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

边缘设备大模型推理受限于算力与内存。推测解码的验证阶段算术强度随推测长度与接受率变化,导致其处于访存密集与计算密集的中间态,固定硬件难以高效处理。SPECTRA提出运行时可重构分片架构,片内计算引擎在脉动与向量执行间切换,片间动态调整并行度、核划分与通信模式,逐核重配置。在20分片FPGA原型上基于Pythia等模型评估,片内重配带来最高2.09倍加速,片间自适应再增1.25倍提升。该成果被ICCAD 2026接收。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

推测解码的硬件利用率瓶颈

大模型在边缘侧推理时,自回归解码受限于算力与访存。推测解码用小模型起草词元并以目标模型批量验证来缓解此问题。然而,验证阶段的算术强度并非固定,它会随推测长度与接受率动态变化,使其处于访存密集的通用矩阵向量乘(GEMV)与计算密集的通用矩阵乘(GEMM)之间的中间态,导致传统固定硬件设计难以维持高利用率。

片内与片间双层动态重配置

SPECTRA架构通过双层可重构机制应对上述动态性。在片内层面,计算引擎能在处理GEMM的脉动执行与处理GEMV的向量通道执行之间切换。在片间层面,架构通过动态选择分片数量、核划分方式及通信模式来调整计算并行度。片内与片间的重配置均以逐核方式运行,确保在推测解码的多种计算模式下均能高效执行。

FPGA原型评估与加速效果

研究在20分片的FPGA原型上对SPECTRA进行评估,测试覆盖了Pythia、SmolLM2及GPT-2模型家族。结果显示,相较于固定设计,片内重配置最高带来2.09倍的加速,而片间自适应能力进一步带来1.25倍的性能提升。该论文已被IEEE/ACM计算机辅助设计国际会议(ICCAD 2026)接收。

为什么值得看

解决推测解码验证阶段算术强度动态变化的硬件利用率瓶颈,为边缘端大模型高效推理提供新架构。

大模型算力论文

信源1

  1. [1]arXiv cs.AI一手信源SPECTRA: Adaptive Execution of Speculative Decoding on a Runtime-Reconfigurable Tiled Architecture

关键事实

  • SPECTRA是运行时可重构分片架构,用于自适应执行推测解码[1]

  • 片内计算引擎在脉动执行(处理GEMM)与向量通道执行(处理GEMV)间切换[1]

  • 片间通过选择分片数、核划分与通信模式动态调整计算并行度[1]

  • 在20分片FPGA原型上评估,片内重配最高加速2.09倍,片间自适应再增1.25倍[1]

  • 论文被IEEE/ACM ICCAD 2026接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。