新研究提出Grafting方法,用离线合并超越在线自蒸馏实现持续学习

论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对后训练模型在持续学习中的灾难性遗忘与推理崩塌问题,Chen Henry Wu等人提出Grafting方法,证明离线合并优于在线自蒸馏(OPSD)。常规SFT会干扰已有能力,Grafting通过在早期捐赠点学习更新并应用到后训练模型、缩放权重及掩码敏感方向来降低干扰。在专家轨迹蒸馏、STaR自我改进及注入新知识等场景下,该方法在新旧任务上均帕累托优于SFT与OPSD,且免除了高开销的在线采样,挑战了在线训练为持续学习必要条件的传统观念。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

持续学习的困境与挑战

让模型持续学习并自我改进是AI领域的长期目标。然而,对后训练模型进行监督微调(SFT)以学习新数据时,常引发泛化变差与灾难性遗忘。传统观点认为在线训练是持续学习的先决条件,但现实中新知识数据多为离线。虽然在线自蒸馏(OPSD)试图将离线数据转为在线信号,但已被证实会导致推理崩塌。

Grafting方法的核心机制

研究指出SFT虽能从新数据提取有效信号,但其更新会干扰既有能力。为此提出Grafting方案:首先,在更早的捐赠检查点(如预训练结束前)学习更新,再将权重更新应用于后训练模型;其次,对权重更新进行缩放,等效于模型合并;最后,当新数据分布与后训练模型差异大时,可选择掩码最敏感的更新方向。这三步有效降低了更新对原有能力的干扰。

多场景验证与范式意义

在三种持续学习设定下验证了该方案:从专家轨迹蒸馏、用STaR与教学RL自我改进、以及预训练截断后注入知识。结果显示,Grafting在新任务与旧任务表现上均帕累托优于SFT和OPSD,同时规避了昂贵的在线采样过程。该成果直接挑战了在线训练作为强化学习模型持续学习必要条件的既有认知,为低开销的模型迭代提供了新路径。

为什么值得看

挑战在线训练必要性,提供低开销且兼顾新旧能力的持续学习新范式,对大模型迭代极具实用价值。

强化学习蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源Off-Policy Merging Beats On-Policy Self-Distillation for Continual Learning

关键事实

  • Grafting方法在持续学习场景下帕累托优于SFT与OPSD,避免推理崩塌与高开销在线采样[1]

  • 该方法通过在早期检查点学习更新、缩放权重及掩码敏感方向来减少对已有能力的干扰[1]

  • 研究挑战了在线训练是强化学习训练模型持续学习必要条件的传统观念[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。