EyeRobot 2.0用主动注视替代腕部相机实现精细操作
论文AI 评分 78/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
EyeRobot 2.0提出基于主动注视的双臂操作框架,仅靠单台立体相机即可完成精细任务。系统通过转动双目对准3D注视点,并在图像中心分配更多视觉令牌以聚焦计算。其采用分层强化学习训练注视伺服与目标选择模块,并将夹爪信息转换至注视相对坐标系以缩减动作分布。实测超千次物理试验表明,仅用被动立体视觉时常规策略成功率从52%降至27%,而该框架较被动立体视觉在实体与仿真中分别提升40%与20%成功率。当抓取物遮挡腕部相机时,其成功率超腕部方案两倍多(48%对22%)。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载仿生主动注视机制
受人类视觉启发,EyeRobot 2.0构建了仅依赖单台立体相机的精细操作框架。系统通过物理转动两个视点,将目光对准场景中的三维注视点。在图像处理阶段,采用中央凹机制,向图像中心分配更多视觉令牌,从而将算力集中于与任务相关的特征上。这种设计使得机器人在不增加额外相机的情况下,依然能获取操作细节的高清视觉信息。
分层训练与坐标系变换
实现协调注视依赖分层强化学习:底层注视伺服策略基于目标物体进行训练,采用密集几何奖励;高层目标选择器根据任务进度发出注视目标,并与行为克隆夹爪策略协同训练,使其能发现类似人类的注视序列。此外,系统将夹爪信息转换至注视相对的SE(3)坐标系中,有效缩减了需学习的动作分布规模,降低了策略学习难度。
实测对比与遮挡优势
研究收集了7项实体与6项仿真任务的遥操作数据,开展超1000次物理及1800次仿真试验。移除腕部相机对常规策略代价高昂:仅用被动立体视觉时,实体成功率从52%骤降至27%。EyeRobot 2.0弥补了此差距,在实体与仿真中较被动立体视觉分别提升40%与20%成功率。在腕部视野清晰时,其表现与含腕部相机方案相当(69%对64%);而当抓取物遮挡腕部镜头时,其成功率更超后者两倍多(48%对22%)。
为什么值得看
摆脱易受遮挡的腕部相机依赖,仅凭单立体相机实现高精度操作,大幅降低硬件复杂度并解决视觉盲区痛点。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
