GenCine系统实现3D空间内相机与物体运动联合可控视频生成

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有可控视频生成依赖2D轨迹,在相机与物体同时运动时存在歧义。GenCine系统将单图提升为可编辑3D场景,允许创作者联合设定相机路径并使用局部3D控制柄移动前景区域。多个控制柄可独立操控主体不同部位,以分段刚性近似非刚性运动,无需物理模拟器或类别先验。系统将3D控制投影为引导图,在统一世界坐标系下记录受控区域位置与控制柄颜色,向预训练Wan模型传达运动指令。训练时从真实视频恢复控制信号,并结合合成视频的真值几何与轨迹,训练轻量引导分支与LoRA适配器。实验显示该方法在视角变化下几何一致性更优,且在多样真实场景中具备强可控性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

3D联合控制机制

当前可控视频生成常依赖二维轨迹或稀疏拖拽信号,当镜头与目标同时移动时,相同二维轨迹可对应多种三维运动,导致控制存在歧义。GenCine系统将单图转化为可编辑三维场景支架,创作者可同时设定相机路径并利用局部三维控制柄移动前景。多个控制柄能独立操控主体不同部位,通过分段刚性方式近似非刚性运动,整个过程无需物理模拟器或特定类别先验。

引导图与模型训练

为将三维控制传达给预训练视频模型,系统将其投影为引导图。该图记录受控区域在每帧的出现位置,为各控制柄分配跨帧固定颜色,并在与背景相同的世界坐标系中编码其当前三维位置,从而在镜头移动时仍能描述物体相对场景的运动。训练阶段,系统从真实视频观测运动中恢复控制信号,并利用合成视频的几何与轨迹真值,在预训练Wan模型上训练轻量引导分支与LoRA适配器以遵循这些控制。

实验表现与优势

实验表明,该方法能实现一致的相机相对运动,在视角变化下提升了几何一致性,并在多种真实世界场景中展现出强可控性。该研究由Jiahan Zhang等七位作者完成,于2026年10月1日提交至arXiv,所属领域为计算机视觉与模式识别及人工智能。

为什么值得看

解决2D轨迹在相机与物体同动时的歧义,实现3D空间内精准联合控制,对影视与动画创作具高实用价值。

信源1 家

  1. [1]arXiv cs.AI一手信源Generative Cinematographer: Composing Camera and Object Motion in 3D

关键事实

  • GenCine系统将单张图像提升为可编辑的3D场景支架,支持联合创作相机路径与前景运动。[1]

  • 系统使用局部3D运动控制柄移动前景,多个控制柄可独立操控主体不同部位,无需物理模拟器或类别特定先验。[1]

  • 系统将3D控制投影为引导图,在统一世界坐标系下编码受控区域位置与控制柄固定颜色,以向预训练视频模型传达指令。[1]

  • 训练过程结合从真实视频恢复的控制信号与合成视频的几何及轨迹真值,训练轻量引导分支与LoRA适配器以遵循控制。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。