Modal发布多节点GPU集群功能,支持6.4Tbps通信按秒计费

工具AI 评分 75/100Modal 官方工程博客(RSS)待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

Modal正式发布Modal Clusters,通过@modal.clustered装饰器提供多节点GPU集群能力。节点间采用InfiniBand通信,带宽达6.4Tbps,自动适配PyTorch与NCCL。集群数秒内启动,按秒计费,并含自动化GPU及RDMA健康检查修复。为支持该功能,Modal重构了调度系统,将原子调度单元从单节点扩展至N节点,采用全局观察、规划与执行循环替代原有贪心调度,实现多节点整体放置。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

集群核心能力与特性

Modal Clusters现已正式可用,开发者仅需添加@modal.clustered装饰器即可定义多节点GPU集群,例如设定size=4并开启rdma=True。该功能与Modal现有组件深度整合,支持将检查点写入Volumes、通过Cloud Bucket Mounts加载数据及用Queues编排任务。节点间通信借助InfiniBand verbs实现高达6.4Tbps的带宽,且自动为PyTorch与NCCL完成配置。集群可在请求后数秒内启动运行,计费精确到秒,同时提供覆盖RDMA状态的自动化GPU健康保障与故障修复。

调度系统重构与演进

引入集群(容器组)作为全新的工作单元促使Modal重构底层各层系统。原调度器采用贪心策略,各节点独立轮询并按单节点视角判断是否领取任务。然而多节点场景下,单节点视角无法满足要求,调度原子单元必须从单节点扩展至N节点。为此,Modal构建了全新调度器,采用显式的观察、规划与执行循环:全局审视整个计算资源池,为每个待处理集群决定放置策略,随后统一执行,确保多节点任务的原子性调度。

为什么值得看

解决多节点GPU训练调度痛点,提供高带宽互联与按秒计费,降低大规模训练门槛。

GPU

信源1 家

  1. [1]Modal 官方工程博客(RSS)线索来自 AIHOTModal Clusters 正式发布,通过 @modal.clustered 提供多节点 GPU 集群

关键事实

  • Modal Clusters正式可用,通过@modal.clustered装饰器配置多节点GPU集群[1]

  • 节点间通过InfiniBand verbs通信,带宽最高6.4Tbps,自动配置PyTorch和NCCL[1]

  • 集群按秒计费,数秒内启动,包含自动化GPU及RDMA健康保障与修复[1]

  • 重构调度系统,从单节点贪心调度改为N节点整体调度的观察、规划与执行循环[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。