研究揭示数学智能体受工具错误输出影响,强制反思可完全恢复性能

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

数学智能体常隐式信任工具返回结果,但工具可能静默失效并返回看似合理的错误值。该研究通过隐藏拦截器替换工具调用结果构建受控破坏框架,在31个问题上评估智能体在四种验证设计下的表现。无验证基线下,破坏使准确率从100%骤降至72.4%;强制同上下文反思可将性能完全恢复至100%。可选验证仅在模型主动调用时提升准确率,检查频率与鲁棒性差异强相关。完全重启可在显式检测后100%成功恢复。结果表明验证器可用性与验证策略是智能体可靠性的独立组件。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

工具静默失效与受控破坏框架

数学问题求解通常依赖智能体将确定性计算步骤委托给外部工具,且智能体会隐式信任这些工具的返回结果。然而,工具可能发生静默失效,返回看似合理实则错误的输出。为探究智能体检测并纠正此类受损输出的能力,研究者构建了一种受控破坏框架。该框架引入一个隐藏拦截器,针对特定问题将真实的工具调用结果替换为具有迷惑性的错误信息,从而模拟工具“说谎”的场景。

四种验证设计的性能对比

研究在31个数学问题上评估了智能体在四种验证设计下的鲁棒性:无验证基线、强制同上下文反思、可选新上下文验证以及可选结构化验证。实验表明,在无验证基线下,工具输出受损导致准确率从100%急剧下降至72.4%。引入强制同上下文反思机制后,性能得以完全恢复,准确率重回100%。对于可选验证机制,只有当模型主动调用验证时,准确率才会得到改善。数据揭示,检查频率与鲁棒性差异之间存在强关联,而不均等的调用频率阻碍了对验证器质量的受控比较。

验证策略与可用性的独立性

辅助恢复实验显示,一旦显式检测到工具输出受损,通过完全重启问题能够在100%的情况下成功恢复。这些发现证明,验证器的可用性与验证策略是决定数学智能体可靠性的两个独立组件。强制策略能够确保验证行为的发生,从而保障鲁棒性;而可选策略的实际效果则高度依赖于模型自身是否选择调用验证器。该研究已被NeurIPS 2026的MathAI研讨会接收。

为什么值得看

揭示智能体隐式信任工具的风险,证明强制验证策略对抵御工具静默失效至关重要。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源When Tools Lie: Reliability of Mathematical Agents Under Corrupted Tool Feedback

关键事实

  • 无验证基线下,工具输出被破坏导致数学智能体准确率从100%降至72.4%[1]

  • 强制同上下文反思验证策略可将受破坏影响的准确率完全恢复至100%[1]

  • 可选验证策略仅在模型主动调用时提升准确率,检查频率与鲁棒性差异强相关[1]

  • 显式检测后进行完全问题重启可在100%的情况下成功恢复[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。