TrackEverything打破点追踪权衡,实现长视频全点3D追踪
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有模型难以兼顾长时序稀疏追踪与短片段全点追踪,TrackEverything将其打破。它将视频转为世界坐标系下的持久3D场景轨迹,使复杂度与视频时长解耦,仅随独特物理几何缩放。该模型引入三项创新:滑动窗口体素化去重合并同位轨迹;将追踪分解为端点精炼与动静分类,再由轻量轨迹精炼器专解动态点密集轨迹;提出3D WAFT以场景云特征采样替代高耗内存的4D关联体。它是首个在40GB显存内对超1000帧视频追踪所有可见点的3D追踪器。在TAPVid-3D上,其短片段APD超所有开源全帧密集3D追踪器20%以上,长序列上也与顶尖稀疏追踪器保持竞争力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载核心问题与解耦思路
现有点追踪模型长期受限于一种权衡:要么在长时序下追踪稀疏查询点,要么仅在短片段中追踪所有点。TrackEverything通过将视频表示为世界坐标系下的持久3D场景轨迹来打破该限制。其核心洞察在于视频是底层3D世界的2D投影,这使得模型复杂度与视频时长解耦,转而随独特的物理场景几何进行缩放,从而具备了处理长视频密集追踪的理论基础。
三项关键技术创新
该研究引入三项创新:首先,在滑动窗口边界采用基于体素化的去重机制合并同位轨迹,防止对同一表面的重复观测造成冗余累积。其次,将追踪任务分解为端点精炼器与轻量轨迹精炼器,前者预测各点目的地并进行动静分类,后者仅为动态点解码密集轨迹。最后,提出3D WAFT,用场景云中的高效特征采样取代了消耗大量内存的4D关联体,大幅降低了显存占用。
性能表现与评测对比
凭借上述设计,TrackEverything成为首个能在40GB显存内对超1000帧视频追踪所有可见点的3D追踪器。在TAPVid-3D数据集上,尽管追踪点数远超对手,其在短片段的APD指标仍比所有开源全帧密集3D追踪器高出20%以上;同时在长序列评测中,也能与当前最先进的稀疏追踪器保持竞争力,成功在密集与长时序两个维度上实现了优异表现。
为什么值得看
首个在有限显存内实现超千帧全点3D追踪,突破长短时序与稀密集追踪的固有矛盾。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
