AI 圈大事记

GroupMask提出半结构化LLM剪枝新法,支持层自适应稀疏分配

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

半结构化剪枝常采用固定N:M模式,导致层自适应分配效果不佳。GroupMask改用分组稀疏,按组整体保留或剪枝权重,允许各层稀疏率在全局预算下变动。该方法通过轻量超网络生成选择器,结合Gumbel-Sigmoid与直通估计器训练,并采用自蒸馏与稀疏预算正则化,预训练权重保持冻结。在LLaMA-2-7B的50%稀疏率下,相比均匀分配,其WikiText-2困惑度从10.02降至8.30,零样本平均准确率从0.455升至0.496。在五款LLaMA与Qwen模型评测中,该方法取得最优困惑度与最高准确率。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

分组稀疏替代N:M模式

现有半结构化大模型剪枝多依赖N:M稀疏模式,该模式强制各层采用相同的局部稀疏率。虽然层自适应分配在非结构化剪枝中有效,但在N:M稀疏下表现不佳。为探究自适应分配在半结构化剪枝中的潜力,GroupMask引入分组级稀疏机制,将权重矩阵划分为规则组,以组为单位决定保留或剪枝,从而允许各层在全局预算约束下拥有不同稀疏率,突破了细粒度N:M模式的限制。

超网络与自蒸馏训练机制

GroupMask的核心训练机制包含多个组件。首先,利用轻量级超网络为所有层生成组选择器。其次,通过Gumbel-Sigmoid参数化与直通估计器放松离散选择以实现梯度传播。在优化过程中,模型采用稀疏预算正则化确保满足全局稀疏约束,并引入自蒸馏机制维持性能,全程保持预训练权重冻结,仅学习选择器参数。

实验表现与性能提升

在LLaMA-2-7B模型及50%稀疏率设定下,采用1x256组大小,GroupMask的层自适应分配相比均匀层比例分配展现出显著优势:WikiText-2困惑度由10.02降至8.30,零样本平均准确率由0.455提升至0.496。在涵盖五款LLaMA与Qwen模型的广泛评测中,使用Alpaca校准时,GroupMask在所有基线方法中取得了最低的WikiText-2困惑度与最高的零样本平均准确率。

为什么值得看

突破半结构化剪枝中自适应分配效果差的局限,显著提升压缩后大模型的性能表现。

LlamaQwen蒸馏模型评测

信源1 家

  1. [1]arXiv cs.AI一手信源GroupMask: Layer-Adaptive Group-wise Sparsity for Semi-Structured LLM Pruning

关键事实

  • GroupMask采用分组稀疏替代细粒度N:M模式,允许各层稀疏率在全局预算下自适应变动[1]

  • 该方法通过轻量超网络生成选择器,结合Gumbel-Sigmoid与直通估计器,使用自蒸馏与稀疏预算正则化训练,冻结预训练权重[1]

  • 在LLaMA-2-7B的50%稀疏率下,相比均匀分配,WikiText-2困惑度从10.02降至8.30,零样本平均准确率从0.455升至0.496[1]

  • 在五款LLaMA和Qwen模型评测中,GroupMask取得最低WikiText-2困惑度与最高零样本平均准确率[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。