RollVerify框架解决长尾Rollout RL效率与精度矛盾
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
大语言模型强化学习中,上下文增长使rollout呈长尾分布,导致同策略训练出现GPU空闲;异步方法虽提效但引入过时样本损害精度。现有重加权方案仍有精度差距。RollVerify框架在部分rollout基础上,于样本进入训练前主动验证修复。其引入OPS指标量化轨迹偏离,在序列与token级验证并截断无效后缀,兼顾部分rollout效率与同策略精度。数学及工具辅助推理实验表明,该框架训练成本降低且精度与同策略训练相当,代码生成实验也提供初步证据。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长尾Rollout效率与精度困境
强化学习对提升大语言模型推理与泛化能力至关重要,但依赖大量rollout。随着上下文窗口扩大,rollout长度呈现长尾分布。在同策略训练中,这种长尾特性会造成GPU计算出现空闲气泡,降低系统利用率并限制强化学习扩展性。若采用异步或部分rollout方法放宽同步限制来提升吞吐量,又不可避免地引入过时的异策略样本,损害最终精度。现有方案多在训练时对异策略样本重加权以缓解该问题,但相比完全同策略训练仍存在性能差距。
OPS指标与主动验证修复机制
RollVerify作为一种基于部分rollout的轻量级强化学习框架,改变了被动重加权的做法,在样本进入训练前主动验证并修复。该框架提出异策略偏移指标OPS,用于量化部分生成轨迹偏离策略的程度。在OPS约束引导下,RollVerify执行序列级与token级验证,识别并截断轨迹中的无效后缀。此机制在保留部分rollout效率增益的同时,产出高质量样本以保护模型精度。
实验表现与适用范围
在数学推理及工具辅助数学推理任务上的实验表明,RollVerify实现了与同策略训练相当的精度,同时降低了训练成本。此外,在代码生成任务上的结果也提供了超越数学领域的初步有效性证据。该工作由Yongqiang Yao与Dahua Lin等人提交。
为什么值得看
解决大模型长上下文RL训练中GPU利用率低与异步样本过时损害精度的痛点,实现降本不降精。
大模型强化学习量化代码生成GPU
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
