研究提出读取MM-DiT上下文Token框架并引入对齐训练提升生成质量

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对多模态扩散Transformer生成中动态上下文Token功能不明的问题,研究者提出通过自然语言探询读取该空间的框架。训练轻量瓶颈网络将中间上下文Token映射至冻结LLM输入空间,使LLM能直接从隐表示回答关于生成图像的问题。发现这些Token编码了丰富全局场景表征,提示未明确的属性在去噪极早期即可读,细粒度细节随时间可读;即使空提示下信息仍可解码,表明其从视觉表征累积图像特有信息。上下文可读性与人类偏好评分正相关。基于此提出上下文对齐训练技术,显式强化视觉语义信息,提升生成质量与分布覆盖度。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

上下文Token读取框架

多模态扩散Transformer在生成过程中通过多模态注意力反复更新文本Token,形成动态上下文Token,其内部作用尚不清晰。为探查该空间,研究构建了一种基于自然语言质询的读取机制。具体做法是训练一个轻量级的瓶颈网络,把模型中间产生的上下文Token映射至一个处于冻结状态的大语言模型的输入空间。这使得大语言模型能够绕过常规视觉输入,直接依据这些隐含表征来回答关于正在生成图像的提问,从而实现对内部表征的解读。

上下文Token编码特性

通过读取框架探测发现,上下文Token编码了关于生成场景的丰富全局表征。令人意外的是,即便提示词未明确指定的属性,在去噪过程的极早期阶段便已具备可读性,而更精细的细节则随着去噪步数推进逐渐变得可读。此外,即便向多模态扩散Transformer输入空提示,图像相关信息依然能从上下文Token中解码出来,这证明上下文Token从不断演进的视觉表征自身中累积了大量图像特有信息。研究还指出,生成结果的上下文表征可读程度越高,其获得的人类偏好评分往往也越高。

上下文对齐训练技术

基于上述可读性与生成质量的正相关观察,研究者提出了一种名为上下文对齐的训练方法。该技术旨在显式地增强上下文Token中所编码的视觉语义信息。实验表明,通过这种针对性的强化训练,不仅能够提升模型的图像生成质量,还能有效改善生成结果的分布覆盖度。这一成果将上下文Token确立为窥探多模态扩散Transformer内部动态的可解释视角,同时也证明其是改进生成模型的有效优化目标。

为什么值得看

揭示了MM-DiT内部动态机制,提供可解释性视角,并证实强化上下文Token能有效提升生成质量。

多模态对齐

信源1 家

  1. [1]arXiv cs.AI一手信源Learning to Read the Contextual Tokens in Diffusion Transformers

关键事实

  • 训练轻量瓶颈网络将中间上下文Token映射至冻结LLM输入空间以读取生成图像信息[1]

  • 上下文Token在去噪早期即可读出提示未明确的属性,细粒度细节随时间推移可读[1]

  • 即使输入空提示,上下文Token仍可解码出图像信息[1]

  • 上下文表征可读性越高,生成图像的人类偏好评分越高[1]

  • 提出上下文对齐训练技术,强化视觉语义信息以提升生成质量与分布覆盖度[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。