扩散模型引入递归潜在推理,数独求解率大幅跃升

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对扩散模型在视觉推理任务上的缺陷,研究者提出Painter-Thinker(PaTh)架构。该架构让轻量递归网络(Thinker)在每个去噪步骤中,基于编码图像与条件的令牌网格细化潜在状态,通过ControlNet引导冻结的扩散模型(Painter)。仅用标准重构损失训练,无需符号监督。在困难MNIST数独上,该方案以10M参数量实现92.5%求解率(此前最优75%),极端数独达71.2%(此前4.1%),且随问题规模扩大优势更明显,并能修复扩散模型无法处理的错误。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

架构设计与训练机制

扩散模型虽能生成逼真图像,但在数独填空或迷宫寻路等视觉推理上表现不佳。传统符号递归方法能解此类难题,但像素空间缺乏符号表达。为此,研究团队提出PaTh框架,将符号推理机制引入像素生成。该框架包含一个冻结的扩散模型(Painter)与小型递归网络(Thinker)。Thinker处理编码了噪声图像与条件的令牌网格,在每个去噪步骤中迭代细化潜在状态,再经ControlNet适配器去引导Painter。训练仅用标准重构损失,无需符号目标、求解器或验证器。

评测表现与参数效率

在MNIST数独任务上,PaTh解决了92.5%的困难谜题与71.2%的极端谜题,而此前最佳结果分别为75%和4.1%。同时,该模型参数量仅10M,远低于标准扩散模型的82M。除数独外,它在迷宫、皇后问题及具特定空间关系的CLEVR场景上亦有提升,且问题规模越大优势越显著。诊断实验表明,当大量单元格出错时,PaTh能从注入的错误中恢复,而普通扩散模型无法修复。

为什么值得看

证明符号推理机制可无监督融入像素扩散模型,突破复杂约束下图像生成瓶颈。

信源1 家

  1. [1]arXiv cs.AI一手信源Think Before You Paint: Recursive Latent Reasoning for Diffusion Models

关键事实

  • 提出PaTh架构,用轻量递归网络引导冻结扩散模型,无需符号监督即可完成视觉推理[1]

  • 困难MNIST数独求解率达92.5%(此前最优75%),极端数独达71.2%(此前4.1%)[1]

  • 模型仅10M参数,远小于标准扩散模型的82M,且随问题规模扩大优势增长[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。