AI 圈大事记

PoEM框架无需再训练即可预测新奖励的RL结果

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

基础模型针对特定奖励做RL后训练耗算力且不稳定,奖励变动需从头跑。PoEM框架利用已有不同奖励训练出的策略模型,无需实际跑RL即可预测新奖励下的策略输出。若新奖励是已有奖励的线性组合,新策略的对数空间也呈线性组合;非线性时,已有对数策略常张成近似低秩子空间,权重系数仅靠样本的奖励或基础策略输出即可估算。该算法在文本与图像模态的合成及真实奖励上获验证。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

RL后训练成本与痛点

基础模型常借助强化学习进行后训练,以最大化人类对齐、正确性或指令遵循等特定奖励。该过程计算量庞大,且有时存在不稳定性。更关键的是,一旦奖励模型发生变更,或者需要组合多种奖励,整个RL流程就必须从头重新执行,这带来了极大的资源与时间消耗。

对数策略空间的线性与低秩特性

针对上述痛点,PoEM提出利用已有奖励训练出的策略模型来预测新奖励下的结果。理论层面,当新奖励函数能写成已有奖励的线性组合时,新策略在对数空间中同样可表示为已有对数策略的线性组合。实际观察发现,即便奖励间不存在线性关联,RL训练得到的对数策略在跨奖励时也常张成一个近似低秩的子空间。此外,组合的权重系数仅需通过样本上的奖励值或基础策略输出便可完成估算。

免训练算法与跨模态验证

基于上述发现,PoEM被构建为一个具体算法:输入已有后训练模型与新奖励函数,即可逼近目标RL策略,全程无需任何额外的RL训练步骤。为检验有效性,研究者在合成及真实奖励上开展了实验,这些奖励场景横跨了文本与图像两种模态,验证了该免训练预测方法的适用范围与效果。

为什么值得看

免去新奖励下的RL重训练开销,大幅降低基础模型后训练成本与不稳定性。

算力

信源1 家

  1. [1]arXiv cs.AI一手信源PoEM: Predicting RL Outcomes from Existing Policies

关键事实

  • PoEM框架能基于已有策略预测新奖励函数下的RL输出,免去实际RL训练。[1]

  • 若新奖励为已有奖励的线性组合,新策略对数空间亦为已有对数策略的线性组合。[1]

  • 非线性奖励下,已有对数策略常张成近似低秩子空间,权重系数仅靠样本输出即可估算。[1]

  • 该算法在文本与图像模态的合成及真实奖励上完成实验验证。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。