InfiNoVA框架通过3D高斯渲染提升机器人策略视角鲁棒性
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
VLA策略在未训练视角下性能常大幅下降,物理采集多视角演示成本高且覆盖稀疏。InfiNoVA框架将多相机同步演示重建为时变3D高斯表征,从采样位姿渲染新视角观测并保持原状态-动作对应。该显式表征提升了帧级保真度与时序一致性,减少生成式新视角合成中的关键幻觉。四项真实操作任务测试显示,经其训练的策略在未见随机视角下平均成功率比基于VISTA扩增及无扩增策略高5.4倍,比直接用五个物理相机视角训练高1.7倍,且无需修改底层策略架构。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载VLA策略视角脆弱性
视觉-语言-动作(VLA)策略对训练时见过的相机视角依赖极强,当部署在未见过的新视角时,性能会出现显著下降。为了缓解此问题,传统做法是从足够多样的物理视角采集演示数据,但这不仅成本高昂,而且仅能对视角空间提供稀疏覆盖,难以满足泛化需求。
3D高斯重建与渲染扩增
InfiNoVA作为一种数据扩增框架,将同步的多相机演示数据转化为几何一致的密集训练视角分布。其核心方法是将每条操作轨迹重建为随时间变化的3D高斯表征,随后从采样的相机位姿渲染出全新视角的观测结果,同时严格保持原始的状态-动作对应关系。这种显式的场景表征有效提升了帧级保真度与时序一致性,并减少了生成式新视角合成中易出现的任务关键幻觉。
真实任务评估与对比
在四项真实世界的操作任务评估中,使用InfiNoVA扩增数据训练的策略,在未见过的随机视角下,其平均成功率比基于VISTA的扩增方法及无扩增策略高出5.4倍。此外,该策略的成功率也比直接在全部五个物理相机视角上训练的策略高出1.7倍。这表明密集且基于几何的视角扩增,在不修改底层策略架构的前提下,为构建相机鲁棒的机器人策略提供了一条实用路径。
为什么值得看
无需修改策略架构即可实现视角鲁棒性,用低成本数据扩增大幅超越多物理相机训练效果。
幻觉
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
