RollVerify框架解决长尾Rollout RL效率与精度矛盾

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

大语言模型强化学习中,上下文增长使rollout呈长尾分布,导致同策略训练出现GPU空闲;异步方法虽提效但引入过时样本损害精度。现有重加权方案仍有精度差距。RollVerify框架在部分rollout基础上,于样本进入训练前主动验证修复。其引入OPS指标量化轨迹偏离,在序列与token级验证并截断无效后缀,兼顾部分rollout效率与同策略精度。数学及工具辅助推理实验表明,该框架训练成本降低且精度与同策略训练相当,代码生成实验也提供初步证据。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

长尾Rollout效率与精度困境

强化学习对提升大语言模型推理与泛化能力至关重要,但依赖大量rollout。随着上下文窗口扩大,rollout长度呈现长尾分布。在同策略训练中,这种长尾特性会造成GPU计算出现空闲气泡,降低系统利用率并限制强化学习扩展性。若采用异步或部分rollout方法放宽同步限制来提升吞吐量,又不可避免地引入过时的异策略样本,损害最终精度。现有方案多在训练时对异策略样本重加权以缓解该问题,但相比完全同策略训练仍存在性能差距。

OPS指标与主动验证修复机制

RollVerify作为一种基于部分rollout的轻量级强化学习框架,改变了被动重加权的做法,在样本进入训练前主动验证并修复。该框架提出异策略偏移指标OPS,用于量化部分生成轨迹偏离策略的程度。在OPS约束引导下,RollVerify执行序列级与token级验证,识别并截断轨迹中的无效后缀。此机制在保留部分rollout效率增益的同时,产出高质量样本以保护模型精度。

实验表现与适用范围

在数学推理及工具辅助数学推理任务上的实验表明,RollVerify实现了与同策略训练相当的精度,同时降低了训练成本。此外,在代码生成任务上的结果也提供了超越数学领域的初步有效性证据。该工作由Yongqiang Yao与Dahua Lin等人提交。

为什么值得看

解决大模型长上下文RL训练中GPU利用率低与异步样本过时损害精度的痛点,实现降本不降精。

大模型强化学习量化代码生成GPU

信源1 家

  1. [1]arXiv cs.AI一手信源RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning

关键事实

  • 大模型RL中长尾rollout导致同策略训练GPU空闲,异步方法引入过时样本损害精度[1]

  • RollVerify引入OPS指标量化部分生成轨迹的偏离策略程度[1]

  • RollVerify在序列与token级验证并截断无效轨迹后缀,主动修复样本[1]

  • 数学及工具辅助推理实验显示RollVerify降低训练成本且精度与同策略训练相当[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。