AI 圈大事记

小米直播强化学习训练,探索多维度扩展

模型AI 评分 75/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

小米公开直播 MiMo-V2.6 模型的强化学习训练全过程,36 小时花费超 108 万美元。训练采用完全异步流水线,每个 Step 处理约 20 亿 Token,通过多任务混合与增加评分算力来扩展强化学习能力。目前 Pro 与 Flash 模型在评测中分数分别达 62.24 和 60.77。

为什么值得看

首次公开大规模 Agent RL 训练细节,展示强化学习 Scaling 的具体路径。

强化学习算力

信源1

  1. [1]量子位罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元

关键事实

  • 36 小时训练花费超 108 万美元,平均每小时 3 万美元。[1]

  • 每个 Step 处理约 20 亿 Token,配置为 1568 个 Prompt × 每个 Prompt 16 条 Rollout。[1]

  • 系统采用 Fully Async 完全异步执行方式,生成、执行、评分和训练不再严格排队。[1]

  • Pro 和 Flash 模型在 DeepSWE v1.1 评测中分别达到 62.24 和 60.77。[1]

相关 · 模型

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。