Logit Refiner 提升视觉自回归模型生成质量
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Logit Refiner 是一个轻量级自回归模块,旨在解决视觉自回归模型(VAR)因并行解码导致的空间依赖缺失问题。该方法通过基于冻结主干特征的顺序采样恢复同尺度依赖,仅需增加约 10% 参数和不到 5% 的训练算力,且无需重新训练即可接入预训练模型。实验显示,该方法在 310M 至 2B 参数规模的主干网络上均能提升生成质量,使 1.1B 参数模型性能超越两倍参数量的模型,并已验证适用于文生图任务。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决并行解码瓶颈
视觉自回归模型(VAR)通过下一尺度预测生成图像,并在每个尺度内并行生成所有 Token。研究表明,这种并行解码构成了一种平均场风格的近似,丢弃了同尺度 Token 之间的空间依赖关系。无论主干网络容量如何,这种解码规则的局限性都会导致生成的样本在局部缺乏连贯性。Logit Refiner 的提出正是为了解决这一瓶颈,通过恢复同尺度依赖来改善生成质量。
低成本即插即用方案
Logit Refiner 被设计为一个轻量级的自回归模块,它通过基于冻结主干特征的顺序采样来恢复同尺度依赖。该方案在实现上非常高效,仅增加约 10% 的参数量,所需的训练算力也不到基础模型的 5%。更重要的是,它可以即插即用到任何预训练的 VAR 检查点中,而无需对原有模型进行重新训练,这大大降低了应用门槛。
性能提升与泛化能力
在从 310M 到 2B 参数规模的不同主干网络上进行的受控消融实验表明,联合同尺度采样是提升性能的关键因素,而非额外的容量或训练。在类别条件的 ImageNet 256x256 生成任务中,该 Refiner 始终能提升生成质量,使得一个 1.1B 参数的模型能够超越参数量是其两倍的模型。此外,该方法还成功泛化到了文本到图像生成任务,证实了平均场瓶颈在 VAR 变体中普遍存在且该方法有效。
为什么值得看
以极低成本显著提升 VAR 模型性能,无需重新训练即可复用现有权重。
文生图算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
