AI 圈大事记

SGPS加速视觉策略学习

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究提出采样引导策略搜索(SGPS),结合基于采样的模型预测控制与一阶策略优化。该方法将渲染从计算图中解耦,直接从深度观测学习。实验显示,SGPS在单GPU上训练的机器人策略能实现运动、越障、推箱及双臂搬运,且蒸馏后的策略可零样本迁移至真实Go2机器人,利用板载深度相机自主完成小跑、爬行及跨栏行为切换。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

方法核心设计

针对视觉策略学习中接触协调带来的高计算与显存成本,研究提出了采样引导策略搜索(SGPS)。该方法将基于采样的模型预测控制与一阶策略优化相结合。训练过程通过行为克隆从采样动作初始化策略,随后在扰动初始状态和随机动力学下,交替进行基于采样的精炼和短视距一阶策略梯度更新。这种设计旨在解决传统一阶策略梯度在局部优化中可能收敛至非预期接触模式的问题。

视觉训练优化

为了降低视觉策略训练的资源消耗,SGPS采用了一种解耦的一阶策略梯度公式。该方案将渲染过程排除在计算图之外,使得策略能够直接从深度观测中进行学习,而无需依赖状态策略教师。这一改进显著减少了对GPU显存的需求,使得在单个GPU上完成复杂的视觉策略训练成为可能。

实验与部署效果

在模拟环境中,SGPS成功在Unitree Go2和G1机器人上学习到了运动、障碍穿越、推箱子以及双臂搬运等策略。实验结果表明,单纯的初始化或跟踪效果不如经过精炼的策略学习。在硬件部署方面,经过蒸馏的策略实现了零样本迁移,能够控制真实的Go2机器人利用板载深度相机,自主完成小跑、爬行、清理障碍物以及在这些行为之间进行切换。

为什么值得看

降低视觉策略训练算力成本,实现零样本迁移至真实硬件。

蒸馏GPU

信源1

  1. [1]arXiv cs.AI一手信源Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

关键事实

  • 提出SGPS方法,结合采样MPC与一阶策略优化训练视觉策略。[1]

  • 使用解耦的一阶策略梯度,将渲染排除在计算图之外。[1]

  • 策略在单GPU上训练,支持运动、越障、推箱及双臂搬运任务。[1]

  • 蒸馏策略零样本迁移至真实Go2机器人,利用板载深度自主运动。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。