AI 圈大事记

论文提出结合联邦学习的分片数据并行算法

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究提出 FL+FSDP 和 FL+HSDP 两种混合算法,将分片数据并行与联邦学习聚合策略结合。该方法将大规模部署解耦为松散耦合的联邦组,减少组间通信量并限制全局批次大小增长。在 512 张 A100 GPU 上预训练 Llama3.1 8B 模型时,新算法在超参数一致的情况下,数据处理速度最高提升 8.04 倍,评估困惑度降低 4.48。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

算法设计原理

基础模型训练通常需要在数千张尖端 GPU 上进行数月,分片数据并行是加速此类计算的主流策略。然而,在多层互连且性能异构的大规模部署中,该策略会产生高昂的通信开销。受联邦学习高效通信原则的启发,这项工作引入了 FL+FSDP 和 FL+HSDP 两种混合算法。这些算法将分片数据并行与 FedAvg 风格的聚合交错进行,将大规模数据并行部署解耦为更小的、松散耦合的联邦组。这种结构在保持全局批次大小受限于联邦组大小的同时,仅需极少的组间通信流量。

实验验证结果

研究通过形式化的通信成本分析和实验验证了该方法的可扩展性与灵活性。实验场景涉及在 512 张 A100 GPU 上进行 Llama3.1 8B 模型的预训练。在超参数设置完全一致的前提下,FL+FSDP 和 FL+HSDP 算法展现出了优越的计算效率和模型质量。具体而言,与对应的方法相比,这两种新算法实现了最高 8.04 倍的数据处理速度提升,并将评估困惑度降低了 4.48。

性能提升归因

性能的改进主要归功于通信开销的显著降低,以及相对于联邦组规模而言,全局批次大小的增长得到了有效控制。这种机制使得在异构网络环境下进行大规模模型训练变得更加高效,同时保证了模型训练的质量。该研究已被 Euro-Par 2026 会议接收,属于分布式、并行和集群计算以及人工智能性能优化领域的研究成果。

为什么值得看

显著降低大规模分布式训练通信开销,提升计算效率与模型质量。

LlamaGPU论文

信源1

  1. [1]arXiv cs.AI一手信源Accelerating Sharded Data Parallelism at Scale with Federated Learning

关键事实

  • 提出 FL+FSDP 和 FL+HSDP 两种混合算法,结合分片数据并行与 FedAvg 风格聚合。[1]

  • 在 512 张 A100 GPU 上预训练 Llama3.1 8B,数据处理速度提升 8.04 倍,困惑度降低 4.48。[1]

  • 该方案将大规模部署解耦为松散联邦组,减少组间通信并限制全局批次大小。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。