DCRL框架通过流形对齐优化大模型强化学习,4,参数量模型超越32B基线
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大语言模型强化学习中基于规则或奖励模型存在的优化不稳与奖励黑客问题,DCRL框架从几何视角将推理视为逻辑、评估与表示三个子流形的耦合。生成与奖励估计视为解耦过程,现有系统缺陷源于策略与奖励流形失配。DCRL引入三段论逻辑提示演化动态优化奖励准则,并用重耦合机制联合更新策略与奖励模型以消除失配。实验显示,经DCRL训练的Qwen3-4B模型胜过Qwen3-32B基线,逼近Qwen3-235B表现。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载强化学习奖励系统缺陷与几何视角重构
当前提升大语言模型推理能力的强化学习范式中,无论是基于规则还是基于奖励模型的系统,均易出现优化过程不稳定及奖励黑客等痛点。DCRL研究另辟蹊径,从几何视角重新审视大模型的一般推理过程,将其概念化为一个由逻辑推演、评估和表示这三个相互依赖的子流形构成的耦合流形。在此框架下,响应生成被解释为从评估流形的解耦过程,而奖励估计则是从逻辑推演流形的解耦过程。传统系统的局限性在几何层面被归结为训练中策略与奖励流形的失配。
DCRL核心机制:提示演化与重耦合
为解决流形失配问题,DCRL框架提出两项核心组件。首先是基于三段论逻辑的提示演化机制,该机制能够动态细化奖励评价准则,从而增强奖励流形的表达能力。其次是策略-奖励重耦合机制,此机制在训练过程中对奖励模型与策略模型进行联合更新,确保评估的一致性,有效缓解训练阶段的流形失配现象。理论分析与多领域推理实验均证实了该框架相对传统基线的优越性。
跨量级性能表现与泛化能力验证
在实验验证环节,DCRL展现出了显著的跨参数量级性能优势。在Qwen3系列模型上的测试结果表明,采用DCRL方法训练的参数量为4B的模型,其表现不仅超越了同系列参数量达32B的基线模型,更是逼近了参数量高达235B的模型性能。这一结果有力地凸显了DCRL在强化学习场景下卓越的有效性与泛化能力,为以小参数量模型实现大模型推理水平提供了切实可行的路径。
为什么值得看
以极小参数量实现越级性能,为解决强化学习奖励失配与优化不稳提供全新几何视角与有效方案。
Qwen大模型强化学习对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
