TRACK: 无需训练的视频扩散加速策略,异构模型切换实现最高2.73倍提速
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对视频扩散推理计算昂贵的问题,研究者提出TRACK策略,通过在选定的去噪步骤中,于兼容的大模型与小模型间进行切换,降低单步平均计算开销。该策略先利用大模型生成参考轨迹,再通过校准过程对比两模型预测以获取分歧分数图,从而决定切换策略:高质量敏感步骤保留大模型,低分歧步骤路由至小模型。全程无需重训练、改架构或在线双模型评估。在Wan 2.1、Cosmos 3、TurboDiffusion及FastVideo上,分别获得1.95倍、2.04至2.73倍、2.69倍和2.17倍的加速,且保持相近质量与高多样性。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载异构模型切换机制
视频扩散因需在大量去噪步骤中执行大模型而计算昂贵,即便经过步骤蒸馏,每步的模型评估成本依然很高。TRACK提出一种异构去噪策略,核心是在选定的去噪步骤中,于兼容的大模型与小模型间进行切换,以此降低每次去噪评估的平均开销。推理时每步仅执行被选中的模型,完全避免了在线双模型评估的额外算力消耗。
校准与策略生成
切换步骤的确定依赖一个校准过程。首先,使用大模型展开生成一条参考轨迹。随后在每个步骤,收集小模型的预测结果,并与大模型预测对比以计算相对分歧分数。两模型接收相同的潜变量、时间步、条件及引导输入。在校准集上聚合该信号后,生成覆盖各去噪步骤的分歧分数图,据此制定切换策略:对质量敏感的步骤继续使用大模型,而低分歧步骤则路由给小模型处理。
免训练特性与加速表现
该方法的实现不需要任何重训练、架构修改或调度器更改。在Wan 2.1、Cosmos 3、TurboDiffusion和FastVideo四类模型上的测试表明,TRACK分别带来了1.95倍、2.04至2.73倍、2.69倍和2.17倍的推理加速。在实现显著提速的同时,总体的生成质量与多样性保持可比,确立了免训练自动模型切换作为视频扩散实用加速范式的地位。
为什么值得看
提供免训练、不改架构的视频扩散加速范式,显著降低推理成本,对部署视频生成模型的工程师极具实用价值。
大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
