CIPHER-MoE解决万亿参数MoE训练负载失衡,最高加速1.94倍
论文AI 评分 75/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对万亿参数MoE大模型训练中token路由不均导致的专家负载失衡与资源浪费问题,CIPHER-MoE提出亲和性感知的专家到token过滤机制并引入显式容量控制。该方法在不改变路由器Top-K选择、不增加硬件与运行时复杂度的前提下,于DeepSeek-V4-Pro等大规模模型上实现Top-1专家负载最高降低64.9个百分点,训练速度提升1.10至1.94倍,且不损失训练质量。代码即将开源。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载万亿MoE训练负载失衡痛点
在当前大型语言模型架构中,混合专家系统被广泛采用。然而,将MoE扩展至万亿参数规模时,非均匀的token路由会导致各专家与设备间出现严重的工作负载失衡。这种失衡使得欠载专家的硬件利用率与训练效率大幅下降,而热点专家又需额外资源应对超量负载,从而极大地推高了训练的资源开销。现有的系统级方案多依赖复杂的并行策略或资源重分配,这会引入额外资源需求与极高的编排复杂度,在算力受限时难以承受。
亲和性过滤与显式容量控制
CIPHER-MoE旨在缓解上述负载失衡问题,其核心在于保持路由器的token侧Top-K选择机制不变。该方法应用了亲和性感知的Expert-to-Token过滤,并结合显式容量控制来削减热点专家的工作量。这种设计直接在路由分配层面进行干预,避免了引入额外硬件资源或复杂的运行时架构,从而在受限计算资源下为万亿参数LLM训练提供了更轻量、低成本的负载均衡方案。
DeepSeek-V4-Pro上的实测…
该方案已在包含DeepSeek-V4-Pro在内的大规模MoE模型上完成评估。实验数据显示,CIPHER-MoE实现了最高64.9个百分点的Top-1专家负载降幅,并取得了1.10倍至1.94倍不等的训练加速。同时,该过程完整保留了原有的训练质量,未因负载调整而引入精度损失。其源代码将于近期公开发布。
为什么值得看
直击万亿MoE训练的负载失衡痛点,无需额外硬件即可实现近2倍加速,对受限算力下的大模型训练极具实用价值。
DeepSeek大模型MoE
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
