扩散模型引入递归潜在推理,数独求解率大幅跃升
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对扩散模型在视觉推理任务上的缺陷,研究者提出Painter-Thinker(PaTh)架构。该架构让轻量递归网络(Thinker)在每个去噪步骤中,基于编码图像与条件的令牌网格细化潜在状态,通过ControlNet引导冻结的扩散模型(Painter)。仅用标准重构损失训练,无需符号监督。在困难MNIST数独上,该方案以10M参数量实现92.5%求解率(此前最优75%),极端数独达71.2%(此前4.1%),且随问题规模扩大优势更明显,并能修复扩散模型无法处理的错误。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载架构设计与训练机制
扩散模型虽能生成逼真图像,但在数独填空或迷宫寻路等视觉推理上表现不佳。传统符号递归方法能解此类难题,但像素空间缺乏符号表达。为此,研究团队提出PaTh框架,将符号推理机制引入像素生成。该框架包含一个冻结的扩散模型(Painter)与小型递归网络(Thinker)。Thinker处理编码了噪声图像与条件的令牌网格,在每个去噪步骤中迭代细化潜在状态,再经ControlNet适配器去引导Painter。训练仅用标准重构损失,无需符号目标、求解器或验证器。
评测表现与参数效率
在MNIST数独任务上,PaTh解决了92.5%的困难谜题与71.2%的极端谜题,而此前最佳结果分别为75%和4.1%。同时,该模型参数量仅10M,远低于标准扩散模型的82M。除数独外,它在迷宫、皇后问题及具特定空间关系的CLEVR场景上亦有提升,且问题规模越大优势越显著。诊断实验表明,当大量单元格出错时,PaTh能从注入的错误中恢复,而普通扩散模型无法修复。
为什么值得看
证明符号推理机制可无监督融入像素扩散模型,突破复杂约束下图像生成瓶颈。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
