GeoLatent提出新空间推理架构,刷新两项3D基准成绩

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对从二维图像进行三维空间推理的难题,GeoLatent框架引入CR-GEO与路由优化机制。该机制将共享与残差教师几何分离,联合训练几何与语言,并临时通过潜变量引导视觉答案学习。实验显示,CR-GEO将几何有效秩从1.00提升至3.87;在瓶颈处阻断潜变量读取会使128个固定问题的方向准确率从89.1%骤降至25.8%。恢复后,模型保留分化几何表征与潜变量视觉路径。GeoLatent在SPAR-Bench达73.0%,SPBench达72.1%,均超越此前已报告方法。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

空间推理痛点与解法

现有视觉语言模型从二维图像推导三维空间关系存在局限。基于文本的方法用离散标记描述中间几何,限制了连续空间关系的保真度;而连续潜变量虽表征更丰富,但单一类型无法显式分离不同空间任务所需的线索。分解空间潜变量虽能在几何监督下分别表征位置、方向和全局几何,但仍面临几何表征向单一主导方向坍缩,以及无约束注意力导致潜变量在答案学习时未被充分利用的问题。GeoLatent通过结合通用-残差几何对齐(CR-GEO)与路由优化来应对这些挑战。

CR-GEO与路由优化机制

CR-GEO机制将共享的教师几何与残差教师几何进行分离。路由优化则联合训练几何与语言模块,在训练期间临时通过潜变量引导视觉答案学习路径,随后在几何监督下恢复全注意力机制。实验验证了该机制的有效性:CR-GEO将几何有效秩从1.00提升至3.87,有效缓解了表征坍缩。同时,消融实验表明,在瓶颈处阻断潜变量读取会导致128个固定问题的方向准确率从89.1%大幅降至25.8%,证明了潜变量介导路径的关键作用。恢复全注意力后,分化的几何表征与潜变量视觉路径仍可保留使用。

基准测试表现

在三维空间推理基准测试中,GeoLatent框架取得了实质性突破。该模型在SPAR-Bench上达到73.0%的准确率,在SPBench上达到72.1%的准确率。这两项成绩均超越了此前已报告的所有方法,确立了新的最优性能水平,展示了其在处理复杂三维空间推理任务上的优越性。

为什么值得看

解决连续潜变量表征空间关系易坍缩难题,显著提升3D空间推理准确率并刷新基准。

信源1 家

  1. [1]arXiv cs.AI一手信源GeoLatent: Geometry-Guided Latent Structuring with Routed Optimization for 3D Reasoning

关键事实

  • GeoLatent结合CR-GEO与路由优化,结构化几何状态并促进潜变量介导的答案学习[1]

  • CR-GEO将几何有效秩从1.00提升至3.87[1]

  • 阻断潜变量读取使方向准确率从89.1%降至25.8%[1]

  • 在SPAR-Bench和SPBench上分别取得73.0%和72.1%,超越此前方法[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。