分层强化学习实现欠驱动双足机器人无碰撞行走

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对欠驱动双足机器人避障与平衡严重耦合难题,研究提出分层强化学习框架。高层策略依据姿态、射线测距及障碍物状态等输入,每十步输出体速度指令;底层策略通过PD控制关节目标来追踪指令,两者用SAC联合训练。收敛步态冻结后供经典规划器调用以构建基线。百次随机测试显示,新法在静态与动态试验达标率分别为98.0%与88.0%,远超规划器混合方案最高78.0%与68.0%,且路径长度与A*参考偏差在4%内。消融实验证实各观测通道与奖励项均有效。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

避障与平衡耦合难题

双足机器人在行进中若需偏离原有轨迹以躲避障碍物,往往不得不打破自身平衡。这种避障与平衡之间的耦合关系,在欠驱动平台上表现得尤为严峻。该研究聚焦的双足机器人每条腿包含四个受控关节,且髋部与踝部均不具备侧倾自由度,这极大增加了其在复杂环境中实现无碰撞行走的难度。

分层策略与联合训练机制

为解决上述问题,研究构建了分层强化学习框架。高层策略负责感知环境,其输入涵盖机器人姿态、三十六条射线投射近距测量值、动态障碍物状态及局部目标,每隔十个控制步输出包含纵向、横向速度与偏航角速度的体速度指令。底层策略则依据速度指令,借助PD控制的关节目标来执行追踪。两层策略通过软执行者-评论家算法进行联合训练。

基线构建与性能对比

由于训练收敛后的步态具备任务无关性,研究者将其冻结,并通过相同的指令接口接入经典规划器,由此构建出SAC+A*、SAC+RRT*与SAC+APF三种受控基线。在PyBullet随机环境中开展的每方法百次评估表明,所提方法在静态与动态试验的达标率分别达到98.0%与88.0%,而规划器混合方案最高仅获78.0%与68.0%。同时,新法路径长度与A*参考值的偏差控制在4%以内,消融实验也验证了各观测通道与奖励项对最终性能的实质性贡献。

为什么值得看

解决欠驱动双足避障与平衡耦合痛点,在动态环境达标率大幅超越传统规划器混合方案。

强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Hierarchical Reinforcement Learning for Collision-Free Locomotion of an Underactuated Biped

关键事实

  • 提出分层强化学习框架解决欠驱动双足机器人避障与平衡耦合问题[1]

  • 高层策略每十步输出体速度指令,底层策略通过PD控制追踪指令,两者用SAC联合训练[1]

  • 百次测试中,新方法在静态和动态试验的达标率分别为98.0%和88.0%[1]

  • 传统规划器混合方案在静态和动态试验的最高达标率仅为78.0%和68.0%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。