SplitMoE打破视频扩散模型均匀性陷阱,入选NeurIPS 2026 Sp…
论文AI 评分 85/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
传统MoE的独立路由与均匀负载正则化导致视频生成出现路由碎片与结构畸变(即均匀性陷阱)。SplitMoE将专家池显式拆分为捕获高层语义的语义专家与保留残差视觉信息的通用专家,结合原型引导路由与推拉正则化,使token按语义属性自然聚类。在同等激活参数预算下,其在收敛速度、路由连贯性及生成质量上均超越传统负载均衡MoE,并涌现出由粗到细的去噪逻辑,为构建大规模视频世界模型提供模态感知扩展路径。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载视觉MoE的均匀性陷阱
混合专家架构虽在大语言模型中成功实现参数扩展,但直接用于视频扩散模型会陷入均匀性陷阱。视频数据具有时空冗余与语义长尾特性,而传统按token独立路由的MoE在同类专家池中运作,并通过正则化强制专家使用率趋均。这种语义组织不足的路由叠加均匀使用约束,会将连贯的图像块打散至不同专家,引发路由碎片化与生成结果的结构畸变,严重制约生成质量。
SplitMoE的拆分架构与路由机制
为应对语义固有的不均衡性,SplitMoE提出拆分角色的稀疏架构,将专家池显式一分为二:语义专家负责捕捉高层语义抽象,通用专家则保留残差视觉信息并提供灵活生成能力。在路由机制上,该架构引入原型引导路由与推拉正则化,使token能够依据自身语义属性自然聚类,摆脱了传统架构中为维持负载均衡而施加的任意约束,从而打破均匀性陷阱对生成能力的束缚。
性能优势与涌现的去噪逻辑
在同等激活参数预算的条件下,SplitMoE在标准基准测试中表现优于传统负载均衡MoE,具体体现在收敛速度更快、路由连贯性更强以及视频生成质量更高。此外,SplitMoE在去噪过程中涌现出由粗到细的逻辑,展现出对视频模态特性的感知能力。这一模态感知扩展路径为社区构建大规模视频世界模型提供了关键参考。该成果已被NeurIPS 2026接收为Spotlight论文。
为什么值得看
解决视觉MoE扩展核心痛点,提供适配视频时空冗余与长尾语义的架构方案,对构建大规模视频世界模型具关键参考价值。
MoE论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
