AI 圈大事记

仅靠自我反思微调即可提升智能体表现,无需强化学习

论文AI 评分 85/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究提出Retrospection-Only Fine-Tuning (ROFT)方法,让语言模型智能体仅通过微调自身生成的反思解释来提升后续行为,无需外部教师或基于奖励的策略更新。在软件工程实验中,Qwen3.5-4B经20次ROFT更新后,在SWE-bench Verified和Pro上解决率分别达49.2%和26.8%,优于GRPO经40次更新后的48.0%与25.3%,且早期训练进展更快。该方法甚至能学会解决基础模型64次采样均失败的难题,表明解释学习能间接归因动作并促进行为改进。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

ROFT核心机制

ROFT旨在剥离单纯解释训练对行为的影响。其在线流程为:智能体尝试任务并观察反馈,随后生成回顾性解释,最后仅对这些解释token施加下一词预测损失进行微调。该过程完全不依赖外部教师指导,也不采用基于奖励的策略更新,仅依靠模型自身对经验的复盘与阐释来优化后续表现。

软件工程基准对比

基于Qwen3.5-4B的实验显示,在混合成败基础尝试上训练后,ROFT在留存测试集SWE-bench Verified与Pro上,仅经20次更新便取得49.2%和26.8%的解决率。作为对比,GRPO在40次更新后仅达48.0%与25.3%。ROFT不仅更新步数减半,且无需验证器,在训练时间与采样尝试上均展现出更快的早期进步。

零成功轨迹与行为分析

ROFT的突出能力在于能解决基础模型64次采样全败的任务,证明学习可在无初始成功轨迹下启动。行为分析揭示,反思微调能间接为动作分配功劳,鼓励正确行为并抑制错误行为。此外,若提示反思时强调更直接的方案,后续尝试长度会自然缩短,无需显式的长度惩罚约束,印证了学习解释能促进学习做事。

为什么值得看

提供无需强化学习的智能体训练新范式,仅靠反思解释即可超越GRPO,大幅降低训练门槛与成本。

Qwen智能体微调强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Shockingly Simple Self-retrospection Improves Agentic Models Without RL

关键事实

  • ROFT方法仅对智能体生成的反思解释token进行下一词预测微调,无需外部教师或奖励策略更新。[1]

  • Qwen3.5-4B经20次ROFT更新后,在SWE-bench Verified和Pro解决率达49.2%和26.8%。[1]

  • GRPO经40次更新后在同基准上解决率为48.0%和25.3%,ROFT更新次数更少且早期进展更快。[1]

  • ROFT能解决基础模型64次采样全部失败的个体任务,实现零成功轨迹启动学习。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。