ActObs 方法通过监督观测 token 提升 RL 智能体性能
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载观测监督机制
标准监督微调通常只计算智能体生成的动作 token 的损失,将环境观测仅作为上下文。ActObs 打破这一惯例,对轨迹中已存在的观测 token 也施加监督。虽然部署后的智能体不生成观测,但学习预测观测能促使策略建模动作后果,且不需要增加数据、参数、序列 token 或前向传播次数。
实验性能表现
在 SFT 阶段,ActObs 与仅监督动作的方法表现相似,但在应用 GRPO 后出现分化。基于 Qwen3-4B 的实验显示,ActObs 在 Terminal-Bench 2.0 的所有评估采样预算下,pass@k 均高于基线。在 Qwen3-8B 上,该方法以少量 pass@1 可靠性为代价,换取了更高的 pass@k,在 pass@16 处提升 3.4 个百分点,并能解决更多不同任务。
跨域任务优势
该优势延伸至跨域代码编辑任务。在 aider-polyglot 数据集上,这些任务在 SFT 和 RL 阶段均未见过,ActObs 依然表现出色。4B 模型在 pass@1 指标上提升了 4.2 个百分点。这表明 ActObs 有助于模型处理未见过的任务,具备更好的泛化能力。
训练过程分析
ActObs 在 RL 过程中保留了更多熵,同时需要更少的策略移动,使最终策略更接近 SFT 初始化状态。分析指出,动作和观测梯度在 ActObs 中迅速正交,而仅动作训练留下了较大的观测梯度残差,并使环境预测能力退化至基础模型以下。联合监督防止了这种单边专业化,保留了后果预测能力,为下游探索做好准备。
为什么值得看
不增加数据与算力成本,仅通过改变监督目标显著提升智能体探索与代码任务表现。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
