两篇论文探索 LLM Agent 框架与模型协同进化
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载流程图自我演化
针对长程任务中 Agent 容易迷失目标、乱用工具的问题,第一篇论文提出了 Procedural Graph 框架。该框架将流程知识组织成(流程、关系、流程)的三元组结构,类似于知识图谱对事实知识的组织方式。在决策步骤中,框架定位当前活跃节点,利用指导模型将周围子图转化为情境指导,引导求解器生成下一步动作。该图结构具备自我演化能力,通过对比失败轨迹与成功轨迹,利用 LLM 修正图的拓扑结构和属性。实验显示,从最小骨架开始,该循环构建的图能匹配或超越人工设计的图,并能修复有缺陷的专家先验,在多种任务和模型上带来一致的性能提升。
Harness 与模型冲突
第二篇论文探讨了 Agent Harness(包括系统提示、工具集和上下文管理脚手架)与模型权重的协同进化。研究团队在七个企业级 Agent 任务上发现,先用弱模型演化出 Harness,再让强模型使用,效果通常更好。然而,若直接让弱模型模仿强模型在该演化 Harness 下的完整轨迹,结果适得其反。在 Qwen3-Coder 和 Gemma 4 等模型上的测试显示,这种模仿会导致性能在所有任务上下降 4 到 30 点。分析表明,模仿虽然增加了对脚手架的使用,但破坏了模型与 Harness 的适配性,弱模型采纳了强模型的规划策略却不具备执行能力,导致其不再匹配围绕其原生规划风格演化出的 Harness。
在策略修正方案
为解决模仿学习导致的模型与 Harness 冲突,研究人员开发了一种在策略专家修正流水线。该流程由元级 MLE Agent 自动化,定位弱模型自身推演中的失败回合,并仅请求专家重写该特定步骤。这种方法保留了弱模型原有的规划风格,避免了全盘模仿带来的适配性问题。结果表明,该方案成功结合了 Harness 进化和模型适应带来的收益,解决了 Harness 更新与权重更新之间的冲突,为在特定领域企业任务上进行经济高效的协同进化提供了兼容性保障的方案。
为什么值得看
提出 Agent 自我进化与协同训练新范式,降低人工设计成本。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
