AI 圈大事记

TRACK: 无需训练的视频扩散加速策略,异构模型切换实现最高2.73倍提速

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对视频扩散推理计算昂贵的问题,研究者提出TRACK策略,通过在选定的去噪步骤中,于兼容的大模型与小模型间进行切换,降低单步平均计算开销。该策略先利用大模型生成参考轨迹,再通过校准过程对比两模型预测以获取分歧分数图,从而决定切换策略:高质量敏感步骤保留大模型,低分歧步骤路由至小模型。全程无需重训练、改架构或在线双模型评估。在Wan 2.1、Cosmos 3、TurboDiffusion及FastVideo上,分别获得1.95倍、2.04至2.73倍、2.69倍和2.17倍的加速,且保持相近质量与高多样性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

异构模型切换机制

视频扩散因需在大量去噪步骤中执行大模型而计算昂贵,即便经过步骤蒸馏,每步的模型评估成本依然很高。TRACK提出一种异构去噪策略,核心是在选定的去噪步骤中,于兼容的大模型与小模型间进行切换,以此降低每次去噪评估的平均开销。推理时每步仅执行被选中的模型,完全避免了在线双模型评估的额外算力消耗。

校准与策略生成

切换步骤的确定依赖一个校准过程。首先,使用大模型展开生成一条参考轨迹。随后在每个步骤,收集小模型的预测结果,并与大模型预测对比以计算相对分歧分数。两模型接收相同的潜变量、时间步、条件及引导输入。在校准集上聚合该信号后,生成覆盖各去噪步骤的分歧分数图,据此制定切换策略:对质量敏感的步骤继续使用大模型,而低分歧步骤则路由给小模型处理。

免训练特性与加速表现

该方法的实现不需要任何重训练、架构修改或调度器更改。在Wan 2.1、Cosmos 3、TurboDiffusion和FastVideo四类模型上的测试表明,TRACK分别带来了1.95倍、2.04至2.73倍、2.69倍和2.17倍的推理加速。在实现显著提速的同时,总体的生成质量与多样性保持可比,确立了免训练自动模型切换作为视频扩散实用加速范式的地位。

为什么值得看

提供免训练、不改架构的视频扩散加速范式,显著降低推理成本,对部署视频生成模型的工程师极具实用价值。

大模型

信源1 家

  1. [1]arXiv cs.AI一手信源Accelerating Video Diffusion via Training-Free Trajectory Routing

关键事实

  • TRACK策略通过在去噪步骤中切换大模型与小模型来加速视频扩散推理[1]

  • 切换策略基于校准集上的分歧分数图决定,高质量敏感步骤用大模型,低分歧步骤用小模型[1]

  • 该方法无需重训练、架构调整或在线双模型评估[1]

  • 在Wan 2.1、Cosmos 3、TurboDiffusion和FastVideo上分别实现1.95倍、2.04至2.73倍、2.69倍和2.17倍加速[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。