AI 圈大事记

SAGE框架通过拓扑引导缓解大模型长程推理偏差

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

大模型在稀疏奖励下进行长程推理时,易受探索偏差与复合偏差影响而表现脆弱。SAGE框架引入代数稀疏化与双曲结构引导两种互补机制:前者将局部容许候选投射至算子索引代数子空间以抑制伪分支,后者将推理状态嵌入负曲率空间以提供密集深度信号。在12个基准与7个模型家族上的测试表明,该框架优于竞争基线,并在Andrews-Curtis这一开放长程任务上取得最高8倍提升。代码已公开,论文被NeurIPS 2026接收。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

长程推理偏差成因

大语言模型在稀疏奖励场景下执行长程推理时表现脆弱,根源在于复杂推理空间引发的两种偏差。探索偏差指模型容易被局部看似合理但结构不稳定的分支吸引;复合偏差则指微小的局部偏离随深度不断累积,最终压制了稀有的奖励信号。研究引入符号闭包分析作为理论透镜,刻画了分支结构与稀疏奖励如何在局部容许性下诱发上述偏差,并以此作为非形式化推理任务中结构先验的设计原则。

SAGE双机制结构引导

基于上述分析,SAGE框架通过注入结构引导来缓解两类偏差。代数稀疏化负责将局部容许候选投射到算子索引的代数子空间上,从而抑制伪分支的生成,减轻探索偏差。双曲结构引导则将推理状态嵌入负曲率空间,借此提供密集的深度方向信号,以克服复合偏差。两者互补,共同为长程推理提供拓扑层面的约束与指引。

实验表现与适用范围

该框架在12个基准测试及7个模型家族中均超越了竞争基线。尤其在Andrews-Curtis问题这一开放的真实世界长程任务上,SAGE实现了最高8倍的性能提升,验证了拓扑与代数引导在极端长程稀疏奖励场景下的有效性。代码现已公开,该研究已被NeurIPS 2026接收。

为什么值得看

针对大模型长程推理易陷入局部伪分支的痛点,提供拓扑与代数结合的结构化解法,实测提升显著。

大模型论文

信源1 家

  1. [1]arXiv cs.AI一手信源SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

关键事实

  • SAGE框架结合代数稀疏化与双曲结构引导,缓解大模型长程推理的探索偏差与复合偏差[1]

  • 在12个基准和7个模型家族上优于竞争基线,于Andrews-Curtis问题取得最高8倍提升[1]

  • 论文被NeurIPS 2026接收,代码已公开[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。