研究提出Looped MoE联合扩展定律,算力匹配下媲美两倍大体量模型
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
循环Transformer与混合专家(MoE)分别借递归与稀疏实现高效扩展,现有定律仅孤立建模。本研究提出Loop Scaling Laws,首次将递归、稀疏、模型尺寸及数据量联合建模。其核心为有界且依稀疏条件的递归映射,刻画循环带来的有效参数增益及稀疏对该增益的提升。该定律预测留一损失优于先前方案,并退化涵盖稠密与MoE特例。下游评测显示:稀疏带来约3倍活跃参数效率,递归在推理上带来约2倍总参数效率,联合扩展进一步推进性能前沿。在万亿词元规模,等算力下依定律配置的循环MoE在推理基准匹配约两倍大的非循环MoE,且借递归实现测试时扩展。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载联合扩展定律的提出与核心
循环Transformer通过递归在参数固定时增加计算深度,MoE通过稀疏在活跃算力固定时扩充总容量。以往扩展定律仅孤立探讨递归或稀疏。本研究提出Loop Scaling Laws,首次将递归、稀疏、模型尺寸与数据量联合建模。其核心为有界且依稀疏条件的递归映射,刻画了循环带来的有效参数增益,以及稀疏如何提升该增益。该定律预测留一损失比先前替代方案更准,且能退化涵盖标准稠密与MoE扩展定律作为特例。
效率提升与下游评测表现
下游评测证实了递归与稀疏两轴的互补优势:稀疏带来约3倍活跃参数效率,递归在推理任务上带来约2倍总参数效率,联合扩展进一步推进性能前沿。拟合后的定律为在算力与内存限制下设计循环MoE模型提供了原则性基础。
万亿词元规模的实际验证
研究在万亿词元规模验证了上述增益。在训练算力匹配的条件下,依据定律推导配置递归次数的循环MoE,在推理基准上匹配了约两倍大的非循环MoE的性能。此外,该架构还能借由递归实现测试时扩展,进一步提升推理能力。
为什么值得看
首次为循环MoE提供联合扩展定律,等算力下实现媲美两倍大模型推理性能,指导受限资源下的架构设计。
MoE算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
