SAGE框架通过拓扑引导缓解大模型长程推理偏差
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
大模型在稀疏奖励下进行长程推理时,易受探索偏差与复合偏差影响而表现脆弱。SAGE框架引入代数稀疏化与双曲结构引导两种互补机制:前者将局部容许候选投射至算子索引代数子空间以抑制伪分支,后者将推理状态嵌入负曲率空间以提供密集深度信号。在12个基准与7个模型家族上的测试表明,该框架优于竞争基线,并在Andrews-Curtis这一开放长程任务上取得最高8倍提升。代码已公开,论文被NeurIPS 2026接收。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长程推理偏差成因
大语言模型在稀疏奖励场景下执行长程推理时表现脆弱,根源在于复杂推理空间引发的两种偏差。探索偏差指模型容易被局部看似合理但结构不稳定的分支吸引;复合偏差则指微小的局部偏离随深度不断累积,最终压制了稀有的奖励信号。研究引入符号闭包分析作为理论透镜,刻画了分支结构与稀疏奖励如何在局部容许性下诱发上述偏差,并以此作为非形式化推理任务中结构先验的设计原则。
SAGE双机制结构引导
基于上述分析,SAGE框架通过注入结构引导来缓解两类偏差。代数稀疏化负责将局部容许候选投射到算子索引的代数子空间上,从而抑制伪分支的生成,减轻探索偏差。双曲结构引导则将推理状态嵌入负曲率空间,借此提供密集的深度方向信号,以克服复合偏差。两者互补,共同为长程推理提供拓扑层面的约束与指引。
实验表现与适用范围
该框架在12个基准测试及7个模型家族中均超越了竞争基线。尤其在Andrews-Curtis问题这一开放的真实世界长程任务上,SAGE实现了最高8倍的性能提升,验证了拓扑与代数引导在极端长程稀疏奖励场景下的有效性。代码现已公开,该研究已被NeurIPS 2026接收。
为什么值得看
针对大模型长程推理易陷入局部伪分支的痛点,提供拓扑与代数结合的结构化解法,实测提升显著。
大模型论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
