AI 圈大事记

GrowingHarness范式将智能体控制逻辑转可复用代码,大幅降推理成本

论文AI 评分 82/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对LLM智能体重复构建控制决策的痛点,GrowingHarness范式从无策略脚手架中学习智能体控制结构,将循环控制转为可复用执行代码,保留LLM处理特定语义。在BrowseComp-Plus和WebArena-Verified评测中,该范式在六项基准模型设定里五项取得最高平均成功率。相比Tool-Calling智能体,其LLM调用减少76.0%至91.8%,推理成本降低74.4%至98.6%。在WebArena-Verified上,4B小模型下其成功率保持44.7%至45.3%,而Tool-Calling降至6.7%。

为什么值得看

将智能体控制逻辑外化至代码,极大削减LLM调用与推理成本,且让小模型维持高成功率。

智能体

信源1

  1. [1]arXiv cs.AI一手信源Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

关键事实

  • GrowingHarness范式将智能体循环控制转为可复用执行代码,仅保留LLM处理任务特定语义推理。[1]

  • 相比Tool-Calling智能体,GrowingHarness减少76.0%至91.8%的LLM调用,推理成本降74.4%至98.6%。[1]

  • 在WebArena-Verified上,4B参数模型下GrowingHarness成功率为44.7%至45.3%,Tool-Calling降至6.7%。[1]

  • 在六项基准模型设定中,GrowingHarness在五项取得最高平均成功率,第六项落后最佳均值0.7个百分点。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。