EyeRobot 2.0用主动注视替代腕部相机实现精细操作

论文AI 评分 78/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

EyeRobot 2.0提出基于主动注视的双臂操作框架,仅靠单台立体相机即可完成精细任务。系统通过转动双目对准3D注视点,并在图像中心分配更多视觉令牌以聚焦计算。其采用分层强化学习训练注视伺服与目标选择模块,并将夹爪信息转换至注视相对坐标系以缩减动作分布。实测超千次物理试验表明,仅用被动立体视觉时常规策略成功率从52%降至27%,而该框架较被动立体视觉在实体与仿真中分别提升40%与20%成功率。当抓取物遮挡腕部相机时,其成功率超腕部方案两倍多(48%对22%)。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

仿生主动注视机制

受人类视觉启发,EyeRobot 2.0构建了仅依赖单台立体相机的精细操作框架。系统通过物理转动两个视点,将目光对准场景中的三维注视点。在图像处理阶段,采用中央凹机制,向图像中心分配更多视觉令牌,从而将算力集中于与任务相关的特征上。这种设计使得机器人在不增加额外相机的情况下,依然能获取操作细节的高清视觉信息。

分层训练与坐标系变换

实现协调注视依赖分层强化学习:底层注视伺服策略基于目标物体进行训练,采用密集几何奖励;高层目标选择器根据任务进度发出注视目标,并与行为克隆夹爪策略协同训练,使其能发现类似人类的注视序列。此外,系统将夹爪信息转换至注视相对的SE(3)坐标系中,有效缩减了需学习的动作分布规模,降低了策略学习难度。

实测对比与遮挡优势

研究收集了7项实体与6项仿真任务的遥操作数据,开展超1000次物理及1800次仿真试验。移除腕部相机对常规策略代价高昂:仅用被动立体视觉时,实体成功率从52%骤降至27%。EyeRobot 2.0弥补了此差距,在实体与仿真中较被动立体视觉分别提升40%与20%成功率。在腕部视野清晰时,其表现与含腕部相机方案相当(69%对64%);而当抓取物遮挡腕部镜头时,其成功率更超后者两倍多(48%对22%)。

为什么值得看

摆脱易受遮挡的腕部相机依赖,仅凭单立体相机实现高精度操作,大幅降低硬件复杂度并解决视觉盲区痛点。

强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

关键事实

  • EyeRobot 2.0仅用单台立体相机,通过主动注视机制完成精细双臂操作,无需腕部相机。[1]

  • 系统采用分层强化学习,先训练基于几何密集奖励的底层注视伺服策略,再训练与BC夹爪策略协同的目标选择器。[1]

  • 在超1000次物理试验中,仅用被动立体视觉时常规策略成功率从52%降至27%,而EyeRobot 2.0较被动立体视觉提升40%成功率。[1]

  • 当抓取物体遮挡腕部相机时,EyeRobot 2.0成功率达48%,超腕部相机方案的22%两倍多。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。