研究提出LoT Diffusion框架,按需分配多分辨率Token加速生成

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有图像与视频扩散模型对所有区域分配等量算力,忽略了细节需求的空间差异。Level-of-Token (LoT) Diffusion框架通过显式多分辨率Token布局实现自适应高效生成,在需细节处分配精细Token,其余区域用粗粒度Token。该框架通过逐块非对称流参数化与多分辨率嵌入改造预训练扩散Transformer,在保留全分辨率流预测的同时仅处理缩减的Token序列,维持原有生成先验。结合语义掩码、边界框、景深等线索,该方案在图像与视频生成中实现了质量与效率的优良权衡,加速比取决于布局的Token预算。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

多分辨率Token布局机制

传统扩散模型在生成视觉内容时,无论画面区域复杂与否均投入相同计算量。LoT框架利用场景细节分布常可预判的特性,将其转化为显式多分辨率Token布局。该布局中,Token代表大小与形状各异的矩形块,在需精细刻画处部署小尺寸Token,平坦区域则用大尺寸粗粒度Token,从而减少整体Token数量并降低计算开销。

预训练模型改造与推理

为使预训练扩散Transformer适配LoT布局,研究引入逐块非对称流参数化及多分辨率嵌入技术。该改造确保在每个去噪步骤仍能进行全分辨率流预测,但实际仅处理缩减后的Token序列。此方式在实现布局自适应生成的同时,完整保留了预训练模型的生成先验,避免了从零训练的开销。

布局来源与加速效果

LoT布局可由多种线索驱动,包括语义掩码、边界框、纹理方差、景深提示以及智能体规划。在图像与视频生成任务中,该框架展现出质量与效率的优良权衡。其加速幅度直接由特定布局下的Token预算决定,Token序列缩减越多,推理加速越显著。

为什么值得看

突破扩散模型全局等算力限制,按需分配算力实现生成加速,对优化视觉模型推理成本极具价值。

智能体算力

信源1 家

  1. [1]arXiv cs.AI一手信源Level-of-Token Diffusion

关键事实

  • 现有扩散模型对图像视频各区域分配等量计算,未考虑细节需求差异[1]

  • LoT框架采用显式多分辨率Token布局,细节区用精细Token,其余用粗Token[1]

  • 通过逐块非对称流参数化与多分辨率嵌入改造预训练扩散Transformer[1]

  • 处理缩减Token序列同时保留全分辨率流预测与预训练生成先验[1]

  • 支持语义掩码、边界框、纹理方差、景深及智能体规划等多种布局来源[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。