研究提出MCMC采样算法改造SFT数据,缓解灾难性遗忘
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
传统观点认为监督微调(SFT)易产生灾难性遗忘且泛化弱,强化学习(RL)泛化更好但依赖模型自身探索成功轨迹。该研究提出一种马尔可夫链蒙特卡洛(MCMC)采样算法,在微调参考模型的指导下,将离策略专家数据逐步转化为更符合当前策略的分布,而非修改学习目标。在科学技能、数学推理等任务中,该方法使SFT达到主流后训练技术的效果,泛化更强且遗忘更少,模型还能学到基础分布之外的知识。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载SFT与RL的优劣势
后训练旨在为前沿模型引入新能力,主要依赖监督微调(SFT)和强化学习(RL)。常规认知指出,RL能在不丢失原有能力的情况下对新任务实现强泛化,而SFT则容易陷入弱泛化与灾难性遗忘的困境。然而,SFT具备从离策略专家数据中学习的优势,RL却受限于必须依靠模型自身通过反复采样来寻找成功轨迹。
MCMC采样算法机制
该研究试图结合在线学习的优势与离策略数据中的特权信息。不同于以往修改学习目标来适应数据的方式,该工作选择调整数据分布以适应学习器。具体而言,研究者引入了马尔可夫链蒙特卡洛(MCMC)采样算法,在给定微调参考模型的前提下,逐步将离策略轨迹转化为更接近在线策略的分布。
实验表现与潜在价值
在科学技能获取、数学推理及开放式专业能力等任务测试中,该采样算法赋能下的SFT能够媲美当前主流的后训练技术。相比强大的在线策略基线,它往往展现出更优的泛化能力与更少的遗忘。此外,所得微调模型呈现出良好的分布性能,能够学习到超越基础模型分布锐化之外的内容。从更高层面看,该方案将采样视为塑造数据可学习性的模型原生算子,可作为通用基础组件在整个后训练技术栈中发挥广泛作用。
为什么值得看
通过采样改造数据分布而非改目标函数,为SFT克服遗忘和泛化难题提供新思路,有望成为后训练通用基础操作。
微调强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
