BRANCH-MoE提出树状路由架构解决MoE负载不均

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对混合专家模型传统扁平路由导致的专家利用率失衡与缺乏拓扑结构问题,BRANCH-MoE将专家置于二叉树叶子节点,在内部节点用指数移动平均估算到达加权均值得分来计算分支概率。该机制无需辅助负载均衡损失即可促进子树均衡利用,在线性节点映射与对数凹到达分布下可防止路由质量坍缩。在Criteo等四个数据集上以16专家、top-4路由对比Switch等方法,结果表明其能保持任务质量与均衡利用,并借树前缀分配专家降低跨设备通信。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

树状路由与均衡机制

传统混合专家模型采用扁平路由,易造成专家利用率失衡且专家索引无拓扑意义。BRANCH-MoE将全部专家放置于二叉决策树的叶子节点,树深为以2为底专家数的对数。在每个内部节点,分支概率以到达该节点流量的加权均值得分为中心,该均值通过指数移动平均进行估算。此设计无需引入辅助负载均衡损失,便能促进两个子树被均衡调用,同时该移动平均估计存在明确的噪声与滞后权衡关系。

理论性质与通信优化

理论层面,在线性节点映射与对数凹到达分布条件下,该机制被证明能够防止路由质量坍缩。当路由器冻结时,专家的执行频率控制其随机梯度收敛速率,且靠近根节点的置信决策能在按树前缀将专家分配给设备时,有效限制跨设备通信量。这表明层级路由在赋予专家拓扑结构、支持局部专家共激活的同时,具备通信开销优化的潜力。

实验评估与对比结果

实验在Criteo点击率预测、Forest Covertype、HIGGS及YearPredictionMSD四个数据集上进行,设置专家数为16、采用top-4路由并使用五个随机种子。基线对比方案包含Switch softmax、DeepSeek-V3动态偏置、Skywork logit归一化及确定性哈希路由。评估结果证实,层级路由在维持任务质量与均衡利用的同时,构建了支持局部共激活与降低通信的拓扑结构。

为什么值得看

无需辅助损失即可实现MoE专家负载均衡,且树状拓扑能降低跨设备通信开销,对大规模MoE工程落地有直接参考价值。

MoE数据集

信源1 家

  1. [1]arXiv cs.AI一手信源BRANCH-MoE: Balance-Aware Tree Routing for Large Embedding Models

关键事实

  • BRANCH-MoE将E个专家置于深度为log2(E)的二叉树叶子节点进行路由[1]

  • 使用指数移动平均估算到达加权均值得分,无需辅助负载均衡损失即可促进子树利用均衡[1]

  • 在线性节点映射与对数凹到达分布下,该机制可防止路由质量坍缩[1]

  • 在Criteo等四个数据集上以16专家、top-4路由评估,对比了Switch softmax等方法[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。