DepthWorld提出基于3D几何的机器人世界模型
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有视频世界模型仅靠RGB训练,逐帧看似正确但无法构成3D一致空间。DepthWorld引入校准管线,结合学习式立体深度与因子图,从同台机器人汇集的片段中恢复运动学参数及外参,处理DROID数据集得到DROID-3D,其90%片段外参重投影误差低于0.7像素。模型基于SVD架构,借空间潜变量平铺联合预测多视角RGB与深度,冻结预训练VAE。在同等算力下,深度监督让RGB预测PSNR较纯RGB基线提升1.48分贝,同时输出精准度量深度供几何推理。该文被CoRL 2026接收。
为什么值得看
解决视频世界模型缺乏3D一致性问题,深度监督反促RGB预测质量提升,对机器人规划与评估具实用价值。
算力论文数据集
信源1 家
关键事实
DepthWorld引入校准管线,结合学习式立体深度与因子图,从同台机器人的所有片段中恢复共享运动学参数及各场景外参。[1]
将DROID数据集转化为DROID-3D,提供稠密度量深度与重校准多视角外参,90%片段的外部相机重投影误差低于0.7像素。[1]
DepthWorld基于Stable Video Diffusion,通过空间潜变量平铺联合预测多视角RGB与深度,保持预训练VAE不变。[1]
深度监督使RGB预测PSNR较同等训练预算下的纯RGB基线提升1.48分贝,并同时提供精准度量深度。[1]
论文被Conference on Robot Learning (CoRL) 2026接收。[1]
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
