AI 圈大事记

DyMD框架将14B视频世界模型蒸馏至1.3B四步生成

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对分布匹配蒸馏(DMD)在少步视频生成中易抑制交互动态的问题,DyMD框架通过时序亲和性重噪声采样与动态引导伪分数追踪,自适应调整教师监督与评判拟合。该方案将14B教师模型蒸馏为1.3B四步学生模型,推理无需辅助模块。在具身视频基准上,学生模型比基础DMD的R-Bench任务依从性提升9.6个百分点,PAI-Bench-G域得分提升5.1分,视觉质量持平。作为动作规划骨干,在两项WorldArena任务中平均成功率从16%升至34%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

少步蒸馏的交互动态缺陷

大型视频扩散模型为具身预测提供了强先验,但多步采样在交互下游任务中计算成本高昂。分布匹配蒸馏虽能实现少步视频生成,却常在保持视觉质量时抑制机器与物体的运动。研究发现,弱重噪声使教师后验集中于缺乏运动的轨迹,限制了运动恢复指导;而强运动轨迹会产生更大的伪分数拟合误差,阻碍生成器学习交互动态。

自适应监督与评判拟合机制

DyMD框架通过两种机制适配不断演进的学生模型:一是时序亲和性条件重噪声采样,通过将基础调度与基于局部后验变化的教师先验混合,调整时间步分布以匹配当前轨迹的交互保真度,平衡运动恢复与外观细化;二是动态引导伪分数追踪,使用噪声条件预测器从潜变量时间动态估计噪声相对拟合难度,并在评判损失中增加预测困难轨迹的权重,以更好追踪强运动轨迹。

蒸馏效果与下游规划验证

利用DyMD,14B教师被蒸馏为1.3B四步学生模型,推理过程无需辅助模块。在具身视频基准测试中,该学生模型相较基础DMD,R-Bench任务依从性提升9.6个百分点,PAI-Bench-G域得分提升5.1分,且视觉质量保持可比。作为下游动作规划骨干,该学生模型在两项WorldArena任务中取得34%的平均成功率,而基础DMD仅为16%。

为什么值得看

解决少步视频世界模型蒸馏中动作丢失痛点,以极小参数量实现交互动态大幅提升,对具身智能规划极具实用价值。

蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源DyMD: Preserving Interaction Dynamics through Distribution Matching Distillation in Few-Step Video World Models

关键事实

  • DyMD将14B教师模型蒸馏为1.3B四步学生模型,推理无需辅助模块[1]

  • 相比基础DMD,学生模型R-Bench任务依从性提升9.6个百分点,PAI-Bench-G域得分提升5.1分[1]

  • 作为动作规划骨干,在两项WorldArena任务中平均成功率从16%升至34%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。