AI 圈大事记

Logit Refiner 提升视觉自回归模型生成质量

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Logit Refiner 是一个轻量级自回归模块,旨在解决视觉自回归模型(VAR)因并行解码导致的空间依赖缺失问题。该方法通过基于冻结主干特征的顺序采样恢复同尺度依赖,仅需增加约 10% 参数和不到 5% 的训练算力,且无需重新训练即可接入预训练模型。实验显示,该方法在 310M 至 2B 参数规模的主干网络上均能提升生成质量,使 1.1B 参数模型性能超越两倍参数量的模型,并已验证适用于文生图任务。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解决并行解码瓶颈

视觉自回归模型(VAR)通过下一尺度预测生成图像,并在每个尺度内并行生成所有 Token。研究表明,这种并行解码构成了一种平均场风格的近似,丢弃了同尺度 Token 之间的空间依赖关系。无论主干网络容量如何,这种解码规则的局限性都会导致生成的样本在局部缺乏连贯性。Logit Refiner 的提出正是为了解决这一瓶颈,通过恢复同尺度依赖来改善生成质量。

低成本即插即用方案

Logit Refiner 被设计为一个轻量级的自回归模块,它通过基于冻结主干特征的顺序采样来恢复同尺度依赖。该方案在实现上非常高效,仅增加约 10% 的参数量,所需的训练算力也不到基础模型的 5%。更重要的是,它可以即插即用到任何预训练的 VAR 检查点中,而无需对原有模型进行重新训练,这大大降低了应用门槛。

性能提升与泛化能力

在从 310M 到 2B 参数规模的不同主干网络上进行的受控消融实验表明,联合同尺度采样是提升性能的关键因素,而非额外的容量或训练。在类别条件的 ImageNet 256x256 生成任务中,该 Refiner 始终能提升生成质量,使得一个 1.1B 参数的模型能够超越参数量是其两倍的模型。此外,该方法还成功泛化到了文本到图像生成任务,证实了平均场瓶颈在 VAR 变体中普遍存在且该方法有效。

为什么值得看

以极低成本显著提升 VAR 模型性能,无需重新训练即可复用现有权重。

文生图算力

信源1

  1. [1]arXiv cs.AI一手信源Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

关键事实

  • Logit Refiner 通过顺序采样恢复同尺度依赖,解决 VAR 并行解码的空间缺失问题。[1]

  • 该模块增加约 10% 参数和不到 5% 训练算力,无需重新训练即可接入预训练模型。[1]

  • 在 ImageNet 256x256 任务上,使 1.1B 参数模型性能超越两倍参数量的模型。[1]

  • 该方法已验证适用于文本到图像生成任务。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。