Turbo Harness框架实现按任务实例自适应优化智能体Harness
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有智能体Harness优化通常产出全局统一方案,平均表现好但未必适配每个实例。Turbo Harness框架能将全局方案针对单实例做适配。其复用全局优化阶段产生的中间产物,将其总结为结构化剧本,并训练Harness编辑器,利用该剧本为全局方案生成实例专属补丁。推理时,编辑器依据实例与剧本构建定制Harness供执行模型运行。在涵盖交互智能体、软件工程及长周期终端任务的七项基准测试中,该方法稳定优于现有Harness优化基线。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载全局Harness优化的局限
自动搜索有效的Harness是智能体递归自我改进的关键步骤。然而,当前主流的Harness优化方法通常只生成单一的全局Harness,并将其均匀应用于所有任务实例。这种做法的缺陷在于,平均表现优异的全局方案并不一定对每一个具体实例都是最优选择,从而限制了智能体在特定任务上的发挥上限。
实例自适应优化机制
为克服上述局限,Turbo Harness框架能够将全局优化后的Harness针对每个实例进行适配。其核心机制是回收已完成全局优化运行期间产生的中间产物,并将其总结为结构化的剧本。基于此,框架训练了一个Harness编辑器,使其能够利用先前的优化经验,为全局Harness生成针对特定实例的补丁。在推理阶段,编辑器利用当前实例和剧本构建出定制化的Harness,执行模型便在该定制环境中运作。
多基准测试验证效果
通过数值实验验证,Turbo Harness在七项基准测试中均展现出稳定优势,持续超越现有的Harness优化基线。这些基准测试覆盖了多种复杂场景,包括交互智能体任务、软件工程任务以及长周期终端任务,证明了该实例自适应方法在不同任务类型上的广泛有效性与性能提升能力。
为什么值得看
解决全局Harness对单任务非最优问题,让智能体按任务实例动态调整执行框架,提升多场景表现。
智能体基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
