新算法RDA2C提出:重塑经验回放角色,多任务超越PPO与SAC

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Nianli Peng等人提出正则化对偶平均演员评论家算法(RDA2C),改变经验回放的传统用法,让历史优势估计直接累积参与演员目标构建,而非仅作最新更新的离策略样本。该算法存储带优势标签的样本,拟合对偶评分模型并经熵镜像映射导出策略。实验显示,使用GAE标签时,RDA2C在八分之六的MuJoCo任务与十二分之八的Atari游戏上胜过PPO,并在六分之六的MuJoCo任务上优于基线AAPDA;使用双Q标签时,在同等批大小与更新频率下匹敌SAC。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

经验回放角色重构

传统演员评论家方法通过复用过往经验提升样本效率,但历史数据通常仅被视为当前策略改进更新的离策略样本。RDA2C算法为回放分配了不同角色:在正则化对偶平均框架下,后续策略由累积的策略改进反馈决定,因此历史优势估计直接贡献于演员目标,而不仅服务于最近一次更新。该算法将状态动作样本与评论家估计的优势标签一同存储,对聚合数据集拟合对偶评分模型,再利用熵镜像映射从累积评分模型中推导当前策略,从而使回放定义了计算策略的经验对偶目标。

理论分析与误差分解

为分析RDA2C,研究建立了有限时间值间隙分解。该分解将正则化对偶平均项与由陈旧回放监督拟合、评论家偏差、有限缓冲区方差及回放覆盖度引起的误差分离开来,并阐述了各项误差受限所需的前提假设。此外,RDA2C具备灵活性,能够接受来自任意评论家的优势标签。

多基准实验对比

在实证评估中,采用广义优势估计标签时,RDA2C在八个MuJoCo任务的六个以及十二个Atari游戏的八个上超越了PPO。同时,在八个MuJoCo任务的六个上击败了最接近的对偶平均基线AAPDA。当采用双Q标签时,在匹配的批大小与更新频率设定下,RDA2C取得了与SAC相匹配的表现。

为什么值得看

突破传统离策略回放局限,显著提升强化学习样本效率,多基准测试下超越主流算法PPO与SAC。

信源1 家

  1. [1]arXiv cs.AI一手信源Policy as Data: Replay-Based Policy Dual Averaging via Advantage Regression

关键事实

  • RDA2C算法让历史优势估计直接累积参与演员目标构建,而非仅作为最新更新的离策略样本。[1]

  • 使用GAE标签时,RDA2C在6/8的MuJoCo任务和8/12的Atari游戏上表现优于PPO。[1]

  • 使用双Q标签时,RDA2C在匹配的批大小和更新频率下与SAC表现相当。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。