连续Dyna循环让十英雄MOBA胜率升至70.2%
论文AI 评分 78/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对含206个单位、每局至多6000帧的十英雄MOBA,研究构建了结构化多智能体世界模型,仅在模型内用1400帧自由想象片段训练策略。通过异步Dyna循环,用真实对局数据修复世界模型并在线锚定策略,使策略在真实游戏中作为Radiant方取得70.2%胜率(421/600,95%置信区间66.4-73.7),而循环前仅33.7%、纯梦境训练为0%。作为Dire方胜率为0%。研究发现模型利用在梦境内不可见,未锚定运行均迅速崩溃;世界模型在策略自身对局上严重失真,Dyna修复带来9.2个百分点的胜率提升。策略继承了模型保真度,擅长全局施压而缺乏团战配合。已开源模型、训练框架及日志。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载真实胜率与评估基准
研究在包含206个单位、每局最多6000帧的十英雄MOBA环境中测试。策略仅在结构化多智能体世界模型内部,通过1400帧的自由想象片段进行训练。采用连续异步Dyna循环后,策略在真实游戏中作为Radiant方取得70.2%的胜率(600局中胜421局,95%置信区间为66.4至73.7),测试种子未参与任何决策。作为对比,纯梦境训练的胜率为0%,启动Dyna循环前的胜率仅为33.7%。此外,该策略作为Dire方胜率为0%,游戏自带对手自对局时Dire方同样全败。
梦境训练的模型利用缺陷
研究揭示了纯梦境训练的严重缺陷:模型利用在梦境内部完全不可见。每一次未锚定的运行都在几次更新后崩溃,而梦境内的任何指标都无法追踪这种崩溃。此外,世界模型虽在训练语料上准确,但在策略自身产生的对局数据上却严重出错。Dyna循环通过将真实对局数据作为世界模型的训练集,并在线评估以选择和锚定策略,有效修复了模型在策略自身对局上的失真。在策略配方固定的情况下,这种修复带来了9.2个百分点的真实胜率提升。
策略行为特征与开源
策略的行为直接继承了世界模型的保真度特征。由于模型能表征宏观对局,却无法表征人群控制、施法时机和致死率,导致策略通过全图施压获胜,几乎不进行任何协同团战。研究已开源所有资源,包括世界模型、dream-PPO训练框架、世界模型调试器、评估协议以及全部策略和日志。
为什么值得看
揭示纯梦境训练的模型利用崩溃问题,证明Dyna循环修复世界模型失真对提升真实胜率的关键作用。
智能体开源模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
