提出Δ-MOPD蒸馏法,多教师组合效果提升超4分
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
多教师在线策略蒸馏常传递教师端点策略,其中继承自基座的偏好会干扰训练效果。新方法Δ-MOPD改为传递重锚定在学生初始化处的教师减基座对数偏移,消除基座拉力。在组合三教师时,较端点监督在数学和五项基准上分别高出4.11与1.95分;两教师时准确率持平。分阶段路由下平均性能更高,顺序差距从10.50降至6.42分。交错路由时两者表现相当。偏移目标构造现成为独立设计轴。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载端点蒸馏的基座拉力缺陷
多教师在线策略蒸馏包含同域组合与路由域蒸馏两种设定,以往做法通常传递教师的端点策略。然而,端点策略混合了后训练改变的部分与从教师基座继承的偏好。研究揭示了阻碍端点转移的机制:继承的基座拉力可能超出后训练偏移。移除该拉力能够降低教师项范数比率以及目标与学生间的KL散度,从而提升蒸馏效率与效果。
Δ-MOPD偏移转移机制
为解决上述问题,研究引入了Δ-MOPD方法。该方法不再转移端点策略,而是转移每个教师的对数偏移,即教师减去基座的差值,并将其重新锚定在学生的冻结初始化处。实验在保持教师选择固定的条件下,将此偏移目标与端点监督在两种设定下进行对比。结果表明,当教师信号在同一状态组合时,偏移目标尤为有效。目标构造由此成为独立的设计轴,与教师选择互补。
不同路由设定下的性能对比
在具体指标上,组合三个教师时,Δ-MOPD超越端点组合4.11个数学分和1.95个五基准分;组合两个教师时两者准确率匹配。在分阶段路由中,无论何种阶段顺序,Δ-MOPD均获更高平均性能,并将顺序差距从10.50缩至6.42分,表明其益处可延伸至跨训练阶段累积的信号。在每次更新仅涉及单教师的交错路由下,两种目标表现相当。
为什么值得看
解决多教师蒸馏中基座偏好干扰问题,显著提升多教师信号组合效果,为蒸馏目标设计提供新方向。
蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
