AI 圈大事记

研究提出环境进化方法提升终端智能体性能

工具AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

该研究提出环境进化方法,通过离线增加环境难度并安排生成顺序,为训练提供持续学习信号。实验显示该方法能产生更困难的环境,在Qwen3.6-27B和Qwen3.6-35B-A3B模型上,Terminal-Bench 2.1性能分别提升14.4和18.0个百分点。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

环境演进的提出

训练终端智能体需要具备可扩展性且能交互验证的环境。随着前沿模型能力提升,从零合成的环境挑战性降低,提供的学习信号有限。现有的共同进化方法虽能基于模型在推演中暴露的弱点,迭代合成接近模型学习前沿的环境,但其对策略推演的依赖限制了泛化能力,且难以在模型变强时持续提供学习信号。为此,研究者提出环境演进方法,旨在通过离线方式逐步增加环境难度,并在训练期间按代调度演进环境,从而保证持续的学习信号。

演进方向与实现

该研究从多轮学习目标中推导出影响环境难度的三个演进方向,并通过循环工程化的多代理框架沿这些方向实施演进。在定量推演实验中,利用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 进行测试,结果显示环境演进能够持续产生更具挑战性的环境。这种方法通过离线调整环境参数,避免了传统方法对在线策略的过度依赖,使得环境生成过程更加灵活,能够适应不同能力水平的模型需求。

性能提升验证

为验证该方法的有效性,研究团队在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 模型上进行了简单的长视界强化学习训练。测试结果显示,在 Terminal-Bench 2.1 基准上,这两个模型的性能分别提升了 14.4 和 18.0 个百分点。这表明环境演进能够有效增强终端智能体在复杂任务中的表现,为解决高难度环境下的训练问题提供了新的思路,有助于推动智能体在终端操作领域的发展。

为什么值得看

解决了终端智能体训练中环境难度不足的问题,显著提升模型性能。

Qwen智能体

信源1

  1. [1]arXiv cs.AI一手信源Environment Evolution for Terminal Agents

关键事实

  • 环境进化方法通过离线增加环境难度并安排生成顺序提供持续学习信号[1]

  • 实验证明该方法能产生更困难的环境[1]

  • 在Qwen3.6-27B模型上Terminal-Bench 2.1性能提升14.4个百分点[1]

  • 在Qwen3.6-35B-A3B模型上Terminal-Bench 2.1性能提升18.0个百分点[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。