WorldCrafter视频世界模型引入隐式3D记忆实现长程一致探索
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
WorldCrafter提出一种视频世界模型,通过学习可按相机查询的隐式3D感知记忆,解决长时序与多视角下难以保持先验观察的问题。其核心机制是让目标视角决定多视图证据如何压缩至生成器的有限token预算中。记忆编码器与位姿条件读出模块联合视频生成器训练,在去噪前将历史观察整合为特定视角token,无需显式深度对应。结合时序上下文与少步蒸馏,该模型支持从单图或文本提示进行流式场景探索,在分钟级探索中显著提升长程一致性与相机控制精度,同时保持视觉质量。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载3D感知记忆机制
现有视频世界模型在动态环境中进行交互探索时,难以在长时序与跨视角下保持对先前观察的遵循。WorldCrafter通过引入可按相机查询的隐式3D感知记忆来应对此挑战。其核心洞察在于,让所请求的视角来决定如何将多视图证据压缩进视频生成器有限的token预算中,从而在生成过程中有效融入历史空间信息。
模型训练与推理
该架构包含记忆编码器与位姿条件读出模块,它们与视频生成器联合训练。在去噪步骤之前,这两个模块将历史观察整合为一组固定的、特定于目标视图的token,此过程完全无需基于显式深度的对应关系。此外,通过将该记忆机制与近端时序上下文及少步蒸馏技术相结合,WorldCrafter实现了从单张输入图像或文本提示出发的流式场景探索能力。
实验效果与表现
在静态与动态场景的实验评估中,WorldCrafter在长程一致性与相机控制精度方面取得了显著提升。同时,模型在长达分钟级的探索过程中依然能够保持视觉质量,证明了其在无需显式深度信息条件下维持跨视角与长时序稳定性的有效性。
为什么值得看
解决视频世界模型长时序与跨视角一致性痛点,无需显式深度即可实现分钟级3D一致探索。
蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
