AI 圈大事记

论文探讨强化学习内在动机与自适应自组织

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Anatoly Belikov 提交论文探讨人工神经系统中内在奖励能否在没有共享外部目标的情况下支持适应、功能特化及高层自组织。文章回顾了赋能、好奇心、学习进度等概念,分析了内在目标失效的模式,并提出资源受限环境、循环智能体网络及分层世界模型智能体三个实验方向,以测试内在学习能否导致更高层次的自适应组织。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

内在动机与自组织

该研究从生物细胞作为交互智能体的视角出发,探讨人工神经系统能否利用内在奖励实现适应、功能特化和高层自组织,而不依赖共享的外部目标。文章旨在解决内在目标在持续探索和产生复杂行为方面的失效问题,论证了更强大的系统可能需要互补的目标、通信机制、记忆能力以及多时间尺度的学习策略。

方法回顾与失效分析

论文系统回顾了包括赋能、好奇心、学习进度、信息增益、无监督技能发现、互信息估计以及利用世界模型计算内在奖励等多种技术手段。作者特别关注了这些方法的失效模式,指出了在何种情况下这些目标无法维持有效的探索行为或导致行为复杂度的提升,为后续设计更鲁棒的内在动机系统提供了分析基础。

三个实验方向

基于上述视角,作者勾勒了三个具体的实验方向。首先是构建资源受限环境,测试环境约束能否缓解内在目标的典型失效模式,使原本稳定的行为吸引子变得不可持续。其次是建立具有各自内在奖励的循环智能体网络。最后是设计分层世界模型智能体,旨在探索性运动能力发展之后再发展目标导向行为,以验证内在学习能否在递进的高层次上引导自适应组织的形成。

为什么值得看

探索无外部奖励的智能体自组织机制,为通用人工智能提供新研究路径。

智能体强化学习论文

信源1

  1. [1]arXiv cs.AI一手信源Intrinsic Motivation in Reinforcement Learning: A Research Agenda for Adaptive Self-Organisation

关键事实

  • 论文探讨内在奖励如何支持无外部目标的自适应自组织。[1]

  • 文章回顾了赋能、好奇心、学习进度等内在奖励计算方法。[1]

  • 研究提出了三个实验方向以测试环境约束和分层结构的作用。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。