研究指合并MoE大模型的路由漂移不等于路由失败
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对MoE大模型合并后常出现的专家路由漂移被视作失败的现象,该研究在DeepSeekMoE等三种模型上验证发现,路由漂移本身不足以证明路由失败。多数专家重分配源于输入偏移而非参数变化,且恢复原路由并未带来可靠的下一token似然增益。研究将路由失败定义为特定干预下可恢复的任务损失,并据此提出选择性路由修复(SRR),发现基于源专家优势的局部修正同样不可靠,强调必须以任务级干预效果来评判修正。已开源分析工具包与SRR代码。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载路由漂移归因分析
模型合并能免于联合重训而组合专用大模型,但会显著改变MoE架构的专家路由,即路由漂移。该现象常被解读为路由失败。研究在DeepSeekMoE、OLMoE和Qwen3-MoE上构建了受控反事实干预与token级分析工具包。通过交叉源模型与合并模型的路由器输入及参数,发现大部分专家重分配现象归因于输入偏移,而非同层参数变化。同时,不同专家选择也能产生方向相似的混合输出,且相对于源模型的路由差异无法有效预测恢复源路由后的下一token似然增益。
路由失败新定义与SRR
研究将路由失败重新定义为:在非路由参数固定时,特定路由干预下可恢复的任务损失。测试表明,故意破坏路由器能检测到可恢复损失,但在评估的合并模型中,恢复源路由并未产生可靠的任务收益。基于此,研究提出选择性路由修复(SRR)作为案例,发现基于源专家token似然优势的方法无法可靠识别有益的局部修正。结论指出,仅凭路由漂移不足以判定路由失败,基于源信息的修正必须通过任务级干预效果来评判。
为什么值得看
纠正对MoE模型合并后路由漂移的误判,为判断路由失败与评估修复策略提供任务级干预新范式。
DeepSeekQwen大模型MoE
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
