CIPHER-MoE解决万亿参数MoE训练负载失衡,最高加速1.94倍

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对万亿参数MoE大模型训练中token路由不均导致的专家负载失衡与资源浪费问题,CIPHER-MoE提出亲和性感知的专家到token过滤机制并引入显式容量控制。该方法在不改变路由器Top-K选择、不增加硬件与运行时复杂度的前提下,于DeepSeek-V4-Pro等大规模模型上实现Top-1专家负载最高降低64.9个百分点,训练速度提升1.10至1.94倍,且不损失训练质量。代码即将开源。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

万亿MoE训练负载失衡痛点

在当前大型语言模型架构中,混合专家系统被广泛采用。然而,将MoE扩展至万亿参数规模时,非均匀的token路由会导致各专家与设备间出现严重的工作负载失衡。这种失衡使得欠载专家的硬件利用率与训练效率大幅下降,而热点专家又需额外资源应对超量负载,从而极大地推高了训练的资源开销。现有的系统级方案多依赖复杂的并行策略或资源重分配,这会引入额外资源需求与极高的编排复杂度,在算力受限时难以承受。

亲和性过滤与显式容量控制

CIPHER-MoE旨在缓解上述负载失衡问题,其核心在于保持路由器的token侧Top-K选择机制不变。该方法应用了亲和性感知的Expert-to-Token过滤,并结合显式容量控制来削减热点专家的工作量。这种设计直接在路由分配层面进行干预,避免了引入额外硬件资源或复杂的运行时架构,从而在受限计算资源下为万亿参数LLM训练提供了更轻量、低成本的负载均衡方案。

DeepSeek-V4-Pro上的实测…

该方案已在包含DeepSeek-V4-Pro在内的大规模MoE模型上完成评估。实验数据显示,CIPHER-MoE实现了最高64.9个百分点的Top-1专家负载降幅,并取得了1.10倍至1.94倍不等的训练加速。同时,该过程完整保留了原有的训练质量,未因负载调整而引入精度损失。其源代码将于近期公开发布。

为什么值得看

直击万亿MoE训练的负载失衡痛点,无需额外硬件即可实现近2倍加速,对受限算力下的大模型训练极具实用价值。

DeepSeek大模型MoE

信源1 家

  1. [1]arXiv cs.AI一手信源CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training

关键事实

  • CIPHER-MoE通过亲和性感知的Expert-to-Token过滤与显式容量控制缓解MoE负载失衡[1]

  • 该方法在DeepSeek-V4-Pro等大规模模型上使Top-1专家负载最高降低64.9个百分点[1]

  • 该方法带来1.10倍至1.94倍的训练加速,且保持训练质量不变[1]

  • 该方法不改变路由器的token侧Top-K选择,不增加额外硬件资源或复杂运行时设计[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。