AI 圈大事记

研究提出线性ViT初始化新方法:直接复制MLP并蒸馏注意力

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

线性视觉变换器需从头预训练且常弱于Softmax版。研究发现,跨算子迁移时,直接复制Softmax的注意力权重几乎无效甚至不如随机初始化,而承载表征的MLP权重具有算子无关性,直接复制即可转移大部分预训练收益。在此基础上,配合恰当损失设计对注意力进行蒸馏以恢复路由行为,可使线性ViT弥合甚至超越Softmax版本。该结论在多种线性ViT变体、模型尺寸及数据集上均成立。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

线性ViT的迁移困境

线性视觉变换器采用线性复杂度注意力算子替换Softmax算子,以实现更高效的token路由。然而,此类架构通常需要从零开始预训练,且最终表现往往不及原始的Softmax版本。如何高效且有效地初始化线性ViT一直不明确。尽管现有注意力迁移工作表明注意力是Softmax ViT间可迁移的有效组件,但在Softmax向线性ViT跨算子迁移时情况截然相反:注意力权重具有算子特异性,直接复制几乎无益,有时甚至劣于随机初始化。

复制MLP与蒸馏注意力

与注意力权重不同,MLP权重承载了已学习的表征,具有算子无关性。通过简单的直接复制即可转移MLP权重,这已经包含了预训练权重的大部分收益,为跨算子迁移提供了有效基础。对于存在差异的注意力部分,研究提出通过设计恰当的损失函数进行蒸馏,以恢复其token路由行为。将直接复制MLP与蒸馏注意力相结合,线性ViT最终能够消除与Softmax版本的差距,甚至在性能上实现超越。

实验结论与适用范围

上述发现并非单一场景特例,而是在多种线性ViT变体、不同模型规模以及多样化数据集上均表现出一致性。该研究深化了对跨注意力算子复用预训练权重的理解,提出了“复制相同部分,蒸馏差异部分”的原则,以在Softmax到线性的边界上恢复预训练收益。

为什么值得看

为线性ViT高效复用Softmax预训练权重提供明确范式,避免从头训练,显著降低成本并提升性能。

蒸馏数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Copy the Same, Distill the Difference: Initializing Linear Vision Transformers

关键事实

  • 线性ViT用线性复杂度算子替换Softmax注意力,但需从头预训练且常弱于原版。[1]

  • 跨算子迁移时,直接复制Softmax注意力权重几乎无效,有时不如随机初始化。[1]

  • MLP权重具有算子无关性,直接复制即可转移预训练权重的大部分收益。[1]

  • 配合恰当损失设计蒸馏注意力以恢复路由行为,可使线性ViT弥合甚至超越Softmax版。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。