PACT算法对齐Critic与策略,数学推理及代码修复准确率大幅超越PPO与G…
论文AI 评分 78/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型强化学习后训练中token级信用缺乏数学定义的问题,PACT提出三个正则条件唯一确定该信用,并揭示理想教师与RLOO信号与其的关联。为解决GAE中间Critic误差问题,PACT采用Actor-then-Critic更新顺序,通过重要性采样校正训练Critic,使其与更新后策略对齐。在智能体数学推理四项基准上,PACT平均准确率达72.87%,较GRPO与PPO分别高出8.80和13.16个百分点;在SWE-bench Verified上通过率67.4%,较PPO、GRPO及SAO分别领先2.4、2.0与3.8个百分点。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载信用分配理论统一
大语言模型后训练的强化学习环节中,token级信用一直缺少公认的数学定义,导致其与常用训练信号的关系不明确。该研究提出完备性、前缀一致性与中性三个正则条件,从数学上证明这三个条件能唯一确定token级信用。基于该表征,研究阐释了现有算法中的现象:同策略蒸馏中的理想教师充当隐式Critic,产生的期望策略梯度与token级信用诱导成比例;响应级RLOO信号虽粒度较粗,但其期望策略梯度贡献与token级信用相匹配。
Critic对齐与PACT设计
研究进一步在有界结果奖励下确立了近似信用稀疏性,并指出广义优势估计(GAE)中的中间Critic误差会变得与底层信用相当,影响训练效果。为此,提出策略对齐Critic训练(PACT)。该方法改变更新顺序,先执行Actor更新再执行Critic更新,并在Critic训练中引入重要性采样校正,从而让Critic更好地与已更新的策略保持对齐,减少误差干扰。
基准测试性能对比
在智能体数学推理任务中,PACT在四项基准上取得72.87%的平均准确率,相比GRPO和PPO分别提升8.80与13.16个百分点。在代码修复评测SWE-bench Verified上,PACT达到67.4%的通过率,较PPO领先2.4个百分点,较GRPO领先2.0个百分点,较SAO领先3.8个百分点,展现出在复杂推理与代码生成场景下的显著优势。
为什么值得看
从理论层面统一了RLHF信用分配解释,且在数学推理与代码修复实测中显著超越主流PPO/GRPO算法。
大模型智能体强化学习对齐基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
