AI 圈大事记

FIRE框架通过运行时策略提升大模型智能体可靠性

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

大模型智能体常在找到解后无法稳定交付。FIRE框架在模型权重与用户提示不变时,于曾出错的状态施加定向自然语言指令与动作拒绝。在87项Terminal-Bench 2.1任务中,双次尝试的重复成功率在GPT-5.6三个层级均提升:Luna从50.6%升至54.0%,Terra从55.2%升至60.9%,Sol从64.4%升至73.6%。Sol的重复成功率增9.2点远超最佳双次成功率1.2点,表明策略将可达解转为稳定交付。Terra加策略达71.4%,超无辅助Sol的64.3%且成本减半。五臂随机实验中,真实策略达61%,远超无策略的39%及通用验证等对照组,证明其为实用可靠性层。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

运行时策略机制

大模型智能体常面临已找到可行解却无法稳定交付的问题。FIRE框架提出运行时策略方法,在智能体运行到曾导致失败的状态时,由智能体框架施加定向自然语言指令与动作拒绝。此过程完全无需修改模型权重或用户原始提示,在保持模型能力恒定前提下,将智能体已具备的能力转化为更可重复的稳定交付。

Terminal-Bench评测表现

在完整的87项Terminal-Bench 2.1测试中,每个任务允许两次尝试。应用运行时策略后,GPT-5.6的三个层级重复成功率均获提升:Luna从50.6%升至54.0%,Terra从55.2%升至60.9%,Sol从64.4%升至73.6%。Sol的重复成功率跃升9.2点,而最佳双次成功率仅变动1.2点,这证实策略核心作用是将已可达的解转化为可靠交付,而非单纯提升单次上限。

跨层级对比与成本优势

在Terra的14个冻结组合任务中,受策略引导的Terra层级达到71.4%的重复成功率,不仅超越了无辅助Sol层级的64.3%,且计算成本仅约其一半。这表明通过在模型外围进行工程化构建,能够以更低成本解锁特定用例的高可靠性,实现低阶模型加策略超越高阶模型的效果。

消融实验验证有效性

为分离策略机制作用,研究设置了五臂随机实验。在符合条件任务上,真实策略达到61%成功率,显著高于无策略组的39%、时间匹配伪装组的36%,以及通用验证或重新考虑组的39%至43%。在24次编码策略尝试中,预期纠正行为在22次中出现,而其他任何对照组最多仅14次,确证运行时策略是切实有效的可靠性层。

为什么值得看

无需改模型权重即可大幅提升智能体任务交付稳定性,且低成本模型加策略可超越高阶模型,对工程落地极具价值。

GPT大模型智能体

信源1

  1. [1]arXiv cs.AI一手信源FIRE: Failure-Informed Runtime Engineering for Reliable Language-Model Agents

关键事实

  • FIRE框架在不改变模型权重和用户提示的情况下,通过运行时策略(定向自然语言指令和动作拒绝)提升智能体可靠性。[1]

  • 在Terminal-Bench 2.1的87个任务中,GPT-5.6的Luna、Terra、Sol三个层级的重复成功率(pass^2)分别从50.6%、55.2%、64.4%提升至54.0%、60.9%、73.6%。[1]

  • Sol的重复成功率提升9.2点,而最佳双次成功率仅变1.2点,表明策略主要将可达解转化为稳定交付。[1]

  • 在Terra的14个冻结任务中,策略引导的Terra达71.4%,超无辅助Sol的64.3%,且成本约为一半。[1]

  • 五臂随机实验显示真实策略达61%,高于无策略的39%、时间匹配伪装的36%及通用验证或重新考虑的39%至43%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。