AI 圈大事记

ActObs 方法通过监督观测 token 提升 RL 智能体性能

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

ActObs 方法在监督微调阶段引入对环境观测 token 的预测,而非仅预测动作。在 Qwen3-4B 和 8B 模型上,结合 GRPO 训练后,该方法在 Terminal-Bench 2.0 和跨域代码编辑任务中,相比仅监督动作的基线,实现了更高的 pass@k 指标。分析显示,联合监督保留了更多熵,减少了策略偏移,避免了单一动作训练导致的环境预测能力退化。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

观测监督机制

标准监督微调通常只计算智能体生成的动作 token 的损失,将环境观测仅作为上下文。ActObs 打破这一惯例,对轨迹中已存在的观测 token 也施加监督。虽然部署后的智能体不生成观测,但学习预测观测能促使策略建模动作后果,且不需要增加数据、参数、序列 token 或前向传播次数。

实验性能表现

在 SFT 阶段,ActObs 与仅监督动作的方法表现相似,但在应用 GRPO 后出现分化。基于 Qwen3-4B 的实验显示,ActObs 在 Terminal-Bench 2.0 的所有评估采样预算下,pass@k 均高于基线。在 Qwen3-8B 上,该方法以少量 pass@1 可靠性为代价,换取了更高的 pass@k,在 pass@16 处提升 3.4 个百分点,并能解决更多不同任务。

跨域任务优势

该优势延伸至跨域代码编辑任务。在 aider-polyglot 数据集上,这些任务在 SFT 和 RL 阶段均未见过,ActObs 依然表现出色。4B 模型在 pass@1 指标上提升了 4.2 个百分点。这表明 ActObs 有助于模型处理未见过的任务,具备更好的泛化能力。

训练过程分析

ActObs 在 RL 过程中保留了更多熵,同时需要更少的策略移动,使最终策略更接近 SFT 初始化状态。分析指出,动作和观测梯度在 ActObs 中迅速正交,而仅动作训练留下了较大的观测梯度残差,并使环境预测能力退化至基础模型以下。联合监督防止了这种单边专业化,保留了后果预测能力,为下游探索做好准备。

为什么值得看

不增加数据与算力成本,仅通过改变监督目标显著提升智能体探索与代码任务表现。

Qwen智能体微调

信源1

  1. [1]arXiv cs.AI一手信源Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

关键事实

  • ActObs 在 SFT 阶段同时对动作和观测 token 进行监督,无需增加额外数据或参数。[1]

  • 在 Qwen3-4B 上,ActObs 结合 GRPO 在 Terminal-Bench 2.0 各采样预算下 pass@k 均优于仅监督动作的方法。[1]

  • 在 Qwen3-8B 上,该方法在 pass@16 指标提升 3.4 个百分点,并解决了更多不同任务。[1]

  • 在跨域代码编辑任务 aider-polyglot 上,4B 模型 pass@1 提升 4.2 个百分点。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。