DMAD对抗蒸馏法实现少步视觉生成SOTA

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

DMAD将分布匹配重构为分类任务,通过共享主干上的双判别器头直接学习对数密度比,免除了DMD所需的辅助扩散模型拟合开销。引入基于差距的重新加权机制以调节噪声层面的教师监督。在ImageNet-64x64单步生成达FID 1.04,四步SDXL于COCO-10K达FID 14.47,四步Wan2.1-T2V-14B获VBench 85.15分,均优于对比少步法及多步教师。针对MiniMax-H3-33B的音视频联合生成,四步学生模型相对DMD2与rCM的人类偏好率分别达79.1%和84.6%。

为什么值得看

免辅助模型的对抗蒸馏新范式,在图像与音视频少步生成评测中全面超越多步教师与已有蒸馏法。

MiniMax蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation

关键事实

  • DMAD将分布匹配转化为分类任务,用双判别器头直接学习对数密度比,无需辅助扩散模型拟合[1]

  • 在ImageNet-64x64单步生成FID为1.04,四步SDXL在COCO-10K的FID为14.47[1]

  • 四步Wan2.1-T2V-14B的VBench总分为85.15,优于对比少步法及多步教师[1]

  • 在MiniMax-H3-33B音视频联合生成上,四步学生对DMD2和rCM的人类偏好率分别为79.1%和84.6%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。