NeurIPS 2024论文提出SNAP模型,限制解码器提升几何表征

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对现有基于编码器的新视角/视角合成方法因空间表现力强的解码器稀释表征能力、像素空间目标阻碍特征学习导致表征效果差的问题,提出自监督编码器-解码器Transformer SNAP。其采用姿态条件局部解码器与潜空间重建目标,在视觉定位、位姿估计、点对应、深度估计及机器人操作五项任务上媲美专用几何监督方法。SNAP的块特征展现出接近强监督模型的涌现视角不变性,且计算与数据预算更低。在相机偏移下标准2D表征崩溃时,SNAP退化更平缓,证实限制解码器表现力可防止可迁移几何结构被抑制。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

NVS表征瓶颈与架构归因

新视角合成本应推理三维场景结构以生成可迁移的多视角几何表征,但现有基于编码器的NVS方法生成的表征质量欠佳。论文指出,这并非缺乏监督信号所致,而是架构选择存在缺陷:一方面,空间表现力过强的解码器稀释了场景编码器的表征能力;另一方面,低级像素空间重建目标阻碍了有效的特征学习。

SNAP架构设计与核心机制

为解决上述问题,研究团队提出了自监督编码器-解码器Transformer模型SNAP。该模型通过两项核心设计进行干预:引入姿态条件局部解码器以限制解码器的空间表现力,并采用潜空间重建目标替代像素空间目标。这种任务无关的设计使得SNAP无需专用几何监督即可学习到有效的可迁移几何结构。

多任务评测与涌现特性

在视觉定位、位姿估计、点对应、深度估计及机器人操作五项下游任务评测中,SNAP均展现出与专用几何监督方法相当的竞争力。值得注意的是,在较低计算量与数据预算下,SNAP的块特征涌现出接近重度监督模型的视角不变性。当面临相机偏移导致标准2D表征崩溃的场景时,SNAP的退化更为平缓,证实限制解码器表现力能有效防止可迁移几何结构被抑制。

为什么值得看

揭示限制解码器表现力可防几何结构被抑制,以低算力获近强监督的视角不变性,对多视觉任务具通用价值。

论文

信源1 家

  1. [1]arXiv cs.AI一手信源Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis

关键事实

  • 现有基于编码器的NVS方法因空间表现力强的解码器和低级像素空间目标导致几何表征效果差[1]

  • SNAP采用姿态条件局部解码器和潜空间重建目标解决上述架构问题[1]

  • SNAP在视觉定位、位姿估计、点对应、深度估计和机器人操作五项任务上媲美专用几何监督方法[1]

  • SNAP的块特征在较低计算和数据预算下展现出接近强监督模型的涌现视角不变性[1]

  • 该论文被NeurIPS 2026接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。