FIRE框架通过运行时策略提升大模型智能体可靠性
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载运行时策略机制
大模型智能体常面临已找到可行解却无法稳定交付的问题。FIRE框架提出运行时策略方法,在智能体运行到曾导致失败的状态时,由智能体框架施加定向自然语言指令与动作拒绝。此过程完全无需修改模型权重或用户原始提示,在保持模型能力恒定前提下,将智能体已具备的能力转化为更可重复的稳定交付。
Terminal-Bench评测表现
在完整的87项Terminal-Bench 2.1测试中,每个任务允许两次尝试。应用运行时策略后,GPT-5.6的三个层级重复成功率均获提升:Luna从50.6%升至54.0%,Terra从55.2%升至60.9%,Sol从64.4%升至73.6%。Sol的重复成功率跃升9.2点,而最佳双次成功率仅变动1.2点,这证实策略核心作用是将已可达的解转化为可靠交付,而非单纯提升单次上限。
跨层级对比与成本优势
在Terra的14个冻结组合任务中,受策略引导的Terra层级达到71.4%的重复成功率,不仅超越了无辅助Sol层级的64.3%,且计算成本仅约其一半。这表明通过在模型外围进行工程化构建,能够以更低成本解锁特定用例的高可靠性,实现低阶模型加策略超越高阶模型的效果。
消融实验验证有效性
为分离策略机制作用,研究设置了五臂随机实验。在符合条件任务上,真实策略达到61%成功率,显著高于无策略组的39%、时间匹配伪装组的36%,以及通用验证或重新考虑组的39%至43%。在24次编码策略尝试中,预期纠正行为在22次中出现,而其他任何对照组最多仅14次,确证运行时策略是切实有效的可靠性层。
为什么值得看
无需改模型权重即可大幅提升智能体任务交付稳定性,且低成本模型加策略可超越高阶模型,对工程落地极具价值。
信源1 家
关键事实
FIRE框架在不改变模型权重和用户提示的情况下,通过运行时策略(定向自然语言指令和动作拒绝)提升智能体可靠性。[1]
在Terminal-Bench 2.1的87个任务中,GPT-5.6的Luna、Terra、Sol三个层级的重复成功率(pass^2)分别从50.6%、55.2%、64.4%提升至54.0%、60.9%、73.6%。[1]
Sol的重复成功率提升9.2点,而最佳双次成功率仅变1.2点,表明策略主要将可达解转化为稳定交付。[1]
在Terra的14个冻结任务中,策略引导的Terra达71.4%,超无辅助Sol的64.3%,且成本约为一半。[1]
五臂随机实验显示真实策略达61%,高于无策略的39%、时间匹配伪装的36%及通用验证或重新考虑的39%至43%。[1]
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
