连续Dyna循环让十英雄MOBA胜率升至70.2%

论文AI 评分 78/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对含206个单位、每局至多6000帧的十英雄MOBA,研究构建了结构化多智能体世界模型,仅在模型内用1400帧自由想象片段训练策略。通过异步Dyna循环,用真实对局数据修复世界模型并在线锚定策略,使策略在真实游戏中作为Radiant方取得70.2%胜率(421/600,95%置信区间66.4-73.7),而循环前仅33.7%、纯梦境训练为0%。作为Dire方胜率为0%。研究发现模型利用在梦境内不可见,未锚定运行均迅速崩溃;世界模型在策略自身对局上严重失真,Dyna修复带来9.2个百分点的胜率提升。策略继承了模型保真度,擅长全局施压而缺乏团战配合。已开源模型、训练框架及日志。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

真实胜率与评估基准

研究在包含206个单位、每局最多6000帧的十英雄MOBA环境中测试。策略仅在结构化多智能体世界模型内部,通过1400帧的自由想象片段进行训练。采用连续异步Dyna循环后,策略在真实游戏中作为Radiant方取得70.2%的胜率(600局中胜421局,95%置信区间为66.4至73.7),测试种子未参与任何决策。作为对比,纯梦境训练的胜率为0%,启动Dyna循环前的胜率仅为33.7%。此外,该策略作为Dire方胜率为0%,游戏自带对手自对局时Dire方同样全败。

梦境训练的模型利用缺陷

研究揭示了纯梦境训练的严重缺陷:模型利用在梦境内部完全不可见。每一次未锚定的运行都在几次更新后崩溃,而梦境内的任何指标都无法追踪这种崩溃。此外,世界模型虽在训练语料上准确,但在策略自身产生的对局数据上却严重出错。Dyna循环通过将真实对局数据作为世界模型的训练集,并在线评估以选择和锚定策略,有效修复了模型在策略自身对局上的失真。在策略配方固定的情况下,这种修复带来了9.2个百分点的真实胜率提升。

策略行为特征与开源

策略的行为直接继承了世界模型的保真度特征。由于模型能表征宏观对局,却无法表征人群控制、施法时机和致死率,导致策略通过全图施压获胜,几乎不进行任何协同团战。研究已开源所有资源,包括世界模型、dream-PPO训练框架、世界模型调试器、评估协议以及全部策略和日志。

为什么值得看

揭示纯梦境训练的模型利用崩溃问题,证明Dyna循环修复世界模型失真对提升真实胜率的关键作用。

智能体开源模型

信源1 家

  1. [1]arXiv cs.AI一手信源Learning in Dreams, Winning in Reality: A Continuous Dyna Loop for a Ten-Hero MOBA

关键事实

  • 在十英雄MOBA中,连续异步Dyna循环使策略作为Radiant方真实胜率达70.2%(421/600)[1]

  • 纯梦境训练胜率为0%,Dyna循环前胜率为33.7%,Dyna修复世界模型失真带来9.2个百分点胜率提升[1]

  • 未锚定的梦境训练均迅速崩溃且无内部指标可追踪,模型在策略自身对局上严重失真[1]

  • 策略继承世界模型保真度,擅长全局施压但缺乏控制、施法时机与致死率等团战配合[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。