AMSC算法利用任务相似度实现终身强化学习策略复用
论文AI 评分 62/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
终身强化学习中,仅保留旧策略不足以向新任务迁移。该研究提出AMSC方法,通过非参数Wasserstein任务嵌入从在线经验估算任务相似度,经z-score标准化sparsemax处理,动态选取并加权旧策略构成新任务先验。在CT-graph与MiniGrid上,AMSC均值表现及前向迁移优于模块化组合基线且无遗忘;Continual World实验表明层特定组合需额外调优。消融证实筛选复用源及复用强度是关键,独立测量的成对迁移与嵌入相似度正相关。代码已开源。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载终身RL策略复用痛点
在终身强化学习场景下,智能体持续面对新任务。仅简单保留过往策略无法保障向新任务的有效迁移,因为有用知识可能散布于多个旧策略中,且其相关性随经验积累而动态变化。研究假设任务相似度可作为持续学习环境下的有效准则,用以发现并组合旧策略,从而解决知识迁移与组合难题。
AMSC方法核心机制
为验证假设,研究设计了自适应掩码选择与组合(AMSC)算法。该算法从状态-动作-奖励样本中提取非参数Wasserstein任务嵌入,以此在线估算任务相似度。相似度得分经z-score标准化及sparsemax运算后,生成变长支撑集,周期性地挑选并赋权旧策略,构建出学习新任务时的先验知识。
实验表现与局限
在CT-graph与MiniGrid测试中,AMSC取得比受评模块化组合基线更高的均值表现与前向迁移,且未出现遗忘。但在Continual World上结果表明,识别相关先验并确定其层特定组合可能需额外层特定调优。消融实验证实,选取相关复用源及确定复用强度是收益核心。独立测量的成对迁移与任务嵌入相似度呈正相关,印证了任务相似度作为策略复用标准的有效性。
为什么值得看
解决终身强化学习中新旧任务知识迁移与组合难题,提供基于相似度的无遗忘动态策略复用新思路。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
