研究发现潜在推理模型能自发习得泛化性循环搜索算法
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型不同推理机制是否同源的问题,研究者基于GPTNeoX在多跳推理任务ProsQA-Ext上从头训练了五种变体。结果显示,常规、CoT及暂停词模型虽在分布内表现佳,但依赖局部图特征,向更长跳数的分布外问题泛化极差。相反,无中间轨迹的潜在推理变体泛化更强,其内部动态契合图上的前向可达性传播。因果干预与电路分析定位出瓶颈潜在模型中存在稀疏循环搜索电路:注意力头检索图关系,MLP与残差流跨步更新可达状态,多头完成候选匹配。这证明潜在循环能支撑超越训练深度的可复用前向搜索算法。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载五种模型变体与测试设定
为探究大模型不同推理形式是否依赖相同底层机制,研究者基于相同GPTNeoX主干,在扩展多跳推理任务ProsQA-Ext上从零训练五种变体:常规模型、思维链模型、暂停词模型,以及两种无中间推理轨迹、端到端优化的潜在推理模型。该设定旨在对比显式词元级推理与隐空间计算在处理需多步推导问题时的差异。
分布内优异不等于深度泛化
实验发现,强劲的分布内表现无法保证深度泛化。常规、思维链及暂停词模型虽能妥善解决分布内问题,但主要依赖局部图特征,在面临跳数更长的分布外问题时泛化表现糟糕。相反,潜在推理变体展现出更优泛化能力,其内部动态与图结构上的前向可达性传播保持一致,表明隐空间计算在应对超出训练深度的推理时具备显著优势。
稀疏循环搜索电路的机制解析
通过因果干预与电路分析,研究将潜在模型的计算定位至瓶颈结构中一个稀疏循环搜索电路。该电路运作机制为:一个注意力头负责检索图关系,MLP与残差流跨循环步骤更新可达性状态,随后多个注意力头共同执行候选匹配。这证实不同推理机制即便分布内表现相近,也会习得截然不同的计算方案;潜在循环能支撑起可复用前向搜索算法,实现超越训练深度的泛化。
为什么值得看
揭示潜在推理为何比CoT泛化更好,为构建超越训练深度限制的推理模型提供电路级解释与新方向。
GPT大模型推理模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
