AI 圈大事记

TrackEverything打破点追踪权衡,实现长视频全点3D追踪

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有模型难以兼顾长时序稀疏追踪与短片段全点追踪,TrackEverything将其打破。它将视频转为世界坐标系下的持久3D场景轨迹,使复杂度与视频时长解耦,仅随独特物理几何缩放。该模型引入三项创新:滑动窗口体素化去重合并同位轨迹;将追踪分解为端点精炼与动静分类,再由轻量轨迹精炼器专解动态点密集轨迹;提出3D WAFT以场景云特征采样替代高耗内存的4D关联体。它是首个在40GB显存内对超1000帧视频追踪所有可见点的3D追踪器。在TAPVid-3D上,其短片段APD超所有开源全帧密集3D追踪器20%以上,长序列上也与顶尖稀疏追踪器保持竞争力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

核心问题与解耦思路

现有点追踪模型长期受限于一种权衡:要么在长时序下追踪稀疏查询点,要么仅在短片段中追踪所有点。TrackEverything通过将视频表示为世界坐标系下的持久3D场景轨迹来打破该限制。其核心洞察在于视频是底层3D世界的2D投影,这使得模型复杂度与视频时长解耦,转而随独特的物理场景几何进行缩放,从而具备了处理长视频密集追踪的理论基础。

三项关键技术创新

该研究引入三项创新:首先,在滑动窗口边界采用基于体素化的去重机制合并同位轨迹,防止对同一表面的重复观测造成冗余累积。其次,将追踪任务分解为端点精炼器与轻量轨迹精炼器,前者预测各点目的地并进行动静分类,后者仅为动态点解码密集轨迹。最后,提出3D WAFT,用场景云中的高效特征采样取代了消耗大量内存的4D关联体,大幅降低了显存占用。

性能表现与评测对比

凭借上述设计,TrackEverything成为首个能在40GB显存内对超1000帧视频追踪所有可见点的3D追踪器。在TAPVid-3D数据集上,尽管追踪点数远超对手,其在短片段的APD指标仍比所有开源全帧密集3D追踪器高出20%以上;同时在长序列评测中,也能与当前最先进的稀疏追踪器保持竞争力,成功在密集与长时序两个维度上实现了优异表现。

为什么值得看

首个在有限显存内实现超千帧全点3D追踪,突破长短时序与稀密集追踪的固有矛盾。

信源1 家

  1. [1]arXiv cs.AI一手信源TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

关键事实

  • TrackEverything是首个能在40GB显存内对超1000帧视频追踪所有可见点的3D追踪器[1]

  • 在TAPVid-3D短片段评测中,APD超所有开源全帧密集3D追踪器20%以上[1]

  • 通过体素化去重、动静分解及3D WAFT三项创新打破稀疏长时与密集短时的追踪权衡[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。