NeurIPS 2024论文提出SNAP模型,限制解码器提升几何表征
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对现有基于编码器的新视角/视角合成方法因空间表现力强的解码器稀释表征能力、像素空间目标阻碍特征学习导致表征效果差的问题,提出自监督编码器-解码器Transformer SNAP。其采用姿态条件局部解码器与潜空间重建目标,在视觉定位、位姿估计、点对应、深度估计及机器人操作五项任务上媲美专用几何监督方法。SNAP的块特征展现出接近强监督模型的涌现视角不变性,且计算与数据预算更低。在相机偏移下标准2D表征崩溃时,SNAP退化更平缓,证实限制解码器表现力可防止可迁移几何结构被抑制。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载NVS表征瓶颈与架构归因
新视角合成本应推理三维场景结构以生成可迁移的多视角几何表征,但现有基于编码器的NVS方法生成的表征质量欠佳。论文指出,这并非缺乏监督信号所致,而是架构选择存在缺陷:一方面,空间表现力过强的解码器稀释了场景编码器的表征能力;另一方面,低级像素空间重建目标阻碍了有效的特征学习。
SNAP架构设计与核心机制
为解决上述问题,研究团队提出了自监督编码器-解码器Transformer模型SNAP。该模型通过两项核心设计进行干预:引入姿态条件局部解码器以限制解码器的空间表现力,并采用潜空间重建目标替代像素空间目标。这种任务无关的设计使得SNAP无需专用几何监督即可学习到有效的可迁移几何结构。
多任务评测与涌现特性
在视觉定位、位姿估计、点对应、深度估计及机器人操作五项下游任务评测中,SNAP均展现出与专用几何监督方法相当的竞争力。值得注意的是,在较低计算量与数据预算下,SNAP的块特征涌现出接近重度监督模型的视角不变性。当面临相机偏移导致标准2D表征崩溃的场景时,SNAP的退化更为平缓,证实限制解码器表现力能有效防止可迁移几何结构被抑制。
为什么值得看
揭示限制解码器表现力可防几何结构被抑制,以低算力获近强监督的视角不变性,对多视觉任务具通用价值。
论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
