研究定义再可导性决定LM智能体管线故障恢复程度
论文AI 评分 62/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
该论文提出“再可导性”概念,衡量阶段从原问题重建所需信息的能力,以此决定语言模型智能体分阶段管线中上游故障的代价与恢复程度。实验在120个gsm_hard条目上注入确定性故障,将原问题重新暴露给下游0至3个阶段。结果显示,基于原问题的检查智能体相比盲检带来+0.358至+0.608的提升;故障下准确率在四个骨干上提升+0.233至+0.392。修复成本低且前置,Qwen3-14B首阶段仅用每项59.8个token即获+0.394保留度,后续阶段无贡献。无故障时,分解管线性能不及单次直接调用。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载再可导性定义与实验设置
论文定义了“再可导性”,即某阶段能从原始问题重建其所需信息的程度,该变量决定了上游故障对分阶段语言模型智能体管线的代价。实验在120个gsm_hard条目上进行,温度设为零,向第一阶段注入一个确定性故障,随后将原始问题重新暴露给下游k=0至3个阶段,同时保持智能体、条目、故障和拓扑固定。测试使用了四个开源权重骨干模型,并在禁用思考模式下提供服务。
故障恢复效果与修复成本
实验表明,将检查智能体基于原始问题接地相比盲检带来显著提升,在四个骨干上提升幅度为+0.358至+0.608,而在两个Qwen骨干上盲检完全未改变任何条目。故障下准确率在四个骨干上均上升,增幅从+0.233到+0.392。修复成本低且集中在前置阶段:在Qwen3-14B上,首个重新接地的阶段以每项59.8个token的代价获得了+0.394的匹配保留度,后续阶段则无额外贡献。在Llama-3.1-8B上故障未产生可检测代价。
管线分解与单次调用对比
研究还发现再可导性同样决定了架构代价,所测量的分解管线在无故障注入时均未可靠超越单次直接调用。注册管线相比单次调用损失了-0.267、-0.125和-0.317的准确率;在Phi-4上虽读数为+0.058,但p值为0.118,统计上无法与零区分。这表明在当前测量条件下,将任务分解为多阶段管线的架构成本可能抵消其带来的收益。
为什么值得看
为多阶段LM智能体管线的容错设计提供量化依据,揭示前置重接地是高效修复关键且分解未必优于单次调用。
Qwen智能体论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
