研究提出LoT Diffusion框架,按需分配多分辨率Token加速生成
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有图像与视频扩散模型对所有区域分配等量算力,忽略了细节需求的空间差异。Level-of-Token (LoT) Diffusion框架通过显式多分辨率Token布局实现自适应高效生成,在需细节处分配精细Token,其余区域用粗粒度Token。该框架通过逐块非对称流参数化与多分辨率嵌入改造预训练扩散Transformer,在保留全分辨率流预测的同时仅处理缩减的Token序列,维持原有生成先验。结合语义掩码、边界框、景深等线索,该方案在图像与视频生成中实现了质量与效率的优良权衡,加速比取决于布局的Token预算。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载多分辨率Token布局机制
传统扩散模型在生成视觉内容时,无论画面区域复杂与否均投入相同计算量。LoT框架利用场景细节分布常可预判的特性,将其转化为显式多分辨率Token布局。该布局中,Token代表大小与形状各异的矩形块,在需精细刻画处部署小尺寸Token,平坦区域则用大尺寸粗粒度Token,从而减少整体Token数量并降低计算开销。
预训练模型改造与推理
为使预训练扩散Transformer适配LoT布局,研究引入逐块非对称流参数化及多分辨率嵌入技术。该改造确保在每个去噪步骤仍能进行全分辨率流预测,但实际仅处理缩减后的Token序列。此方式在实现布局自适应生成的同时,完整保留了预训练模型的生成先验,避免了从零训练的开销。
布局来源与加速效果
LoT布局可由多种线索驱动,包括语义掩码、边界框、纹理方差、景深提示以及智能体规划。在图像与视频生成任务中,该框架展现出质量与效率的优良权衡。其加速幅度直接由特定布局下的Token预算决定,Token序列缩减越多,推理加速越显著。
为什么值得看
突破扩散模型全局等算力限制,按需分配算力实现生成加速,对优化视觉模型推理成本极具价值。
智能体算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
