仅靠自我反思微调即可提升智能体表现,无需强化学习
论文AI 评分 85/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究提出Retrospection-Only Fine-Tuning (ROFT)方法,让语言模型智能体仅通过微调自身生成的反思解释来提升后续行为,无需外部教师或基于奖励的策略更新。在软件工程实验中,Qwen3.5-4B经20次ROFT更新后,在SWE-bench Verified和Pro上解决率分别达49.2%和26.8%,优于GRPO经40次更新后的48.0%与25.3%,且早期训练进展更快。该方法甚至能学会解决基础模型64次采样均失败的难题,表明解释学习能间接归因动作并促进行为改进。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载ROFT核心机制
ROFT旨在剥离单纯解释训练对行为的影响。其在线流程为:智能体尝试任务并观察反馈,随后生成回顾性解释,最后仅对这些解释token施加下一词预测损失进行微调。该过程完全不依赖外部教师指导,也不采用基于奖励的策略更新,仅依靠模型自身对经验的复盘与阐释来优化后续表现。
软件工程基准对比
基于Qwen3.5-4B的实验显示,在混合成败基础尝试上训练后,ROFT在留存测试集SWE-bench Verified与Pro上,仅经20次更新便取得49.2%和26.8%的解决率。作为对比,GRPO在40次更新后仅达48.0%与25.3%。ROFT不仅更新步数减半,且无需验证器,在训练时间与采样尝试上均展现出更快的早期进步。
零成功轨迹与行为分析
ROFT的突出能力在于能解决基础模型64次采样全败的任务,证明学习可在无初始成功轨迹下启动。行为分析揭示,反思微调能间接为动作分配功劳,鼓励正确行为并抑制错误行为。此外,若提示反思时强调更直接的方案,后续尝试长度会自然缩短,无需显式的长度惩罚约束,印证了学习解释能促进学习做事。
为什么值得看
提供无需强化学习的智能体训练新范式,仅靠反思解释即可超越GRPO,大幅降低训练门槛与成本。
Qwen智能体微调强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
