新方法 Looped Flows 提升循环模型推理能力
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对深度学习中循环模型训练时反向传播步数受限的问题,研究人员提出了 Looped Flows 方法。该方法利用局部去噪目标训练循环结构,通过递减的噪声级别和共享噪声建立时间关联,使模型学会传递有用信息。推理时将去噪器参数化的概率流速度与循环状态结合,允许通过更细的时间网格增加计算量。在六个推理基准测试中,该方法优于先前的最先进循环模型,在 ARC-AGI-1 上达到 58.8% 的测试准确率,在 ARC-AGI-2 上达到 12.2%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决训练瓶颈
人类和机器通常通过增加计算时间来解决更难的问题,深度学习中的循环模型通过在推理过程中循环更新隐藏状态来实现这一理念。然而在实践中,这类模型的训练通常只对一次或少数几次更新进行反向传播,导致难以训练早期的更新以支持未来的更新。为了绕过这一难题,研究人员提出了 Looped Flows 方法,利用局部去噪目标来训练循环结构。
时间关联机制
该方法通过逐渐降低的噪声级别和共享噪声,在去噪目标之间施加时间关联。这种机制激励模型学习能够随时间传递有用计算的循环状态,即使梯度仅覆盖少数几次更新也能生效。这种设计使得模型能够在不依赖长程反向传播的情况下,建立起有效的时序依赖关系。
推理与性能表现
在推理阶段,该方法将推理表述为整合由学习到的去噪器参数化的概率流速度,并结合循环状态。这种方式允许通过更细的时间网格花费更多计算来解决更难的问题,并支持从不同初始噪声样本生成多个有效预测。在包括两个多解基准在内的六个推理基准测试中,Looped Flows 总体上优于先前的最先进循环模型。具体而言,该模型在 ARC-AGI-1 上实现了 58.8% 的测试准确率,在 ARC-AGI-2 上达到了 12.2%。
为什么值得看
为解决循环模型训练难题提供了新思路,并在 ARC-AGI 等高难度推理任务上取得显著进展。
基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
