AI 圈大事记

Underwater C3-JEPA水下机器人预测世界模型发布

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对近场重载水下ROV打捞,提出Underwater C3-JEPA预测世界模型。在无触觉传感器下,该架构融合多视角RGB观测与控制信号,于隐空间预测任务物体状态演化。其通过留出视角注意力融合跨相机证据,结合弱绑定与SIGReg以低标注代价锐化几何表征。实验表明,相比无重建基线,其向下游传递更多任务相关信息且预测器轻量,支持MPC评估与想象展开训练。真实水下视频验证显示,该架构可恢复被遮挡相机状态并优于持续基线,已向IEEE投稿。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

模型架构与预测机制

Underwater C3-JEPA专为近场重载水下ROV打捞设计,属于物体中心的多视角预测世界模型。在缺乏触觉传感器的条件下,该模型接收同步的多相机RGB观测数据与车辆控制信号作为输入,在隐空间中预测任务物体状态随接触交互及水动力滞后的演化过程。架构上,它将多相机观测编码为任务物体与上下文标记,通过留出视角注意力机制融合跨相机证据,并基于控制信号直接预测未来状态。

表征优化与下游应用

为提升表征质量,该模型引入弱绑定机制以低标注代价锚定目标与抓手,同时结合SIGReg锐化几何表征。实验显示,相较于无重建的隐空间基线,所学表征能向下游探针传递显著更多的任务相关信息,且保持预测器轻量化。该预测接口支持模型预测控制(MPC)候选评估以及基于想象展开的行为智能体训练。

真实场景验证情况

除仿真实验外,研究在真实水下视频上进行了验证。结果表明,相同架构能够恢复被遮挡相机的物体状态,且表现优于持续基线,证明该方案可超越仿真环境实现跨域迁移。该论文由Yuncong Yang等7人撰写,共12页14图,已提交IEEE等待出版。

为什么值得看

提出无需触觉传感的多视角隐空间预测方案,解决水下重载打捞接触交互状态预测难题,且真实场景有效。

信源1 家

  1. [1]arXiv cs.AI一手信源Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage

关键事实

  • 提出Underwater C3-JEPA模型,面向近场重载水下ROV打捞的物体中心多视角预测世界模型[1]

  • 在无触觉传感器条件下,通过融合多视角RGB观测与车辆控制信号,在隐空间预测任务物体状态演化[1]

  • 采用弱绑定与SIGReg机制,以低标注代价锚定目标与抓手,并锐化几何表征[1]

  • 真实水下视频验证表明,该架构能恢复被遮挡相机的物体状态且优于持续基线,超越仿真局限[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。