GroupMask提出半结构化LLM剪枝新法,支持层自适应稀疏分配
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
半结构化剪枝常采用固定N:M模式,导致层自适应分配效果不佳。GroupMask改用分组稀疏,按组整体保留或剪枝权重,允许各层稀疏率在全局预算下变动。该方法通过轻量超网络生成选择器,结合Gumbel-Sigmoid与直通估计器训练,并采用自蒸馏与稀疏预算正则化,预训练权重保持冻结。在LLaMA-2-7B的50%稀疏率下,相比均匀分配,其WikiText-2困惑度从10.02降至8.30,零样本平均准确率从0.455升至0.496。在五款LLaMA与Qwen模型评测中,该方法取得最优困惑度与最高准确率。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载分组稀疏替代N:M模式
现有半结构化大模型剪枝多依赖N:M稀疏模式,该模式强制各层采用相同的局部稀疏率。虽然层自适应分配在非结构化剪枝中有效,但在N:M稀疏下表现不佳。为探究自适应分配在半结构化剪枝中的潜力,GroupMask引入分组级稀疏机制,将权重矩阵划分为规则组,以组为单位决定保留或剪枝,从而允许各层在全局预算约束下拥有不同稀疏率,突破了细粒度N:M模式的限制。
超网络与自蒸馏训练机制
GroupMask的核心训练机制包含多个组件。首先,利用轻量级超网络为所有层生成组选择器。其次,通过Gumbel-Sigmoid参数化与直通估计器放松离散选择以实现梯度传播。在优化过程中,模型采用稀疏预算正则化确保满足全局稀疏约束,并引入自蒸馏机制维持性能,全程保持预训练权重冻结,仅学习选择器参数。
实验表现与性能提升
在LLaMA-2-7B模型及50%稀疏率设定下,采用1x256组大小,GroupMask的层自适应分配相比均匀层比例分配展现出显著优势:WikiText-2困惑度由10.02降至8.30,零样本平均准确率由0.455提升至0.496。在涵盖五款LLaMA与Qwen模型的广泛评测中,使用Alpaca校准时,GroupMask在所有基线方法中取得了最低的WikiText-2困惑度与最高的零样本平均准确率。
为什么值得看
突破半结构化剪枝中自适应分配效果差的局限,显著提升压缩后大模型的性能表现。
LlamaQwen蒸馏模型评测
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
