Underwater C3-JEPA水下机器人预测世界模型发布
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对近场重载水下ROV打捞,提出Underwater C3-JEPA预测世界模型。在无触觉传感器下,该架构融合多视角RGB观测与控制信号,于隐空间预测任务物体状态演化。其通过留出视角注意力融合跨相机证据,结合弱绑定与SIGReg以低标注代价锐化几何表征。实验表明,相比无重建基线,其向下游传递更多任务相关信息且预测器轻量,支持MPC评估与想象展开训练。真实水下视频验证显示,该架构可恢复被遮挡相机状态并优于持续基线,已向IEEE投稿。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载模型架构与预测机制
Underwater C3-JEPA专为近场重载水下ROV打捞设计,属于物体中心的多视角预测世界模型。在缺乏触觉传感器的条件下,该模型接收同步的多相机RGB观测数据与车辆控制信号作为输入,在隐空间中预测任务物体状态随接触交互及水动力滞后的演化过程。架构上,它将多相机观测编码为任务物体与上下文标记,通过留出视角注意力机制融合跨相机证据,并基于控制信号直接预测未来状态。
表征优化与下游应用
为提升表征质量,该模型引入弱绑定机制以低标注代价锚定目标与抓手,同时结合SIGReg锐化几何表征。实验显示,相较于无重建的隐空间基线,所学表征能向下游探针传递显著更多的任务相关信息,且保持预测器轻量化。该预测接口支持模型预测控制(MPC)候选评估以及基于想象展开的行为智能体训练。
真实场景验证情况
除仿真实验外,研究在真实水下视频上进行了验证。结果表明,相同架构能够恢复被遮挡相机的物体状态,且表现优于持续基线,证明该方案可超越仿真环境实现跨域迁移。该论文由Yuncong Yang等7人撰写,共12页14图,已提交IEEE等待出版。
为什么值得看
提出无需触觉传感的多视角隐空间预测方案,解决水下重载打捞接触交互状态预测难题,且真实场景有效。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
