新研究提出逐单元投影器以缓解大模型微调遗忘

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对语言模型微调新数据时损害已有能力的问题,该研究利用热带几何揭示ReLU层特性,提出一种门控感知的逐单元投影器。理论证明其代价为单元自身开放token的秩,远低于共享子空间需支付的联合秩。在OPT-1.3b上,9至60个约束方向预算下,遗忘程度较Adam-NSCL降低1.1至4.3倍;用其五分之一方向即在GPM能量阈值下将遗忘减半。在OPT-6.7b上,同等预算下遗忘持平但学得更多。18组实验均验证开放与封闭token划分的关键作用。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

投影器原理与理论优势

现有无回放投影方法(如Adam-NSCL和GPM)在每行更新中禁止共享子空间,该文指出此举过于粗糙。通过热带几何分析ReLU层,作者在数据空间将单元边界视作热带超曲面,在权重空间将旧token视作超平面,两者通过恒等式相连。该恒等式将输出变化平方拆分为单元内、开到闭及闭到开项,由此引出逐单元投影器。预算分离定理表明,精确保护仅需耗费单元自身开放token的秩,而共享子空间每行至少需支付其联合的秩,理论代价更低。

实验验证与模型表现

在OPT-1.3b上,96%的(token, unit)对处于封闭状态。在9至60个每行约束方向的六档匹配预算下,新方法遗忘程度均低于Adam-NSCL,优势从1.1倍扩大至4.3倍。仅用约五分之一的方向,便在GPM能量阈值下将Adam-NSCL的遗忘减半。在OPT-6.7b上,匹配预算下两者遗忘持平,但新方法学到了更多新知识。18组种子对实验全面证实,开放与封闭token的划分是关键有效变量,其表现全面胜过随机、符号盲及反门控token集。

剪枝修复中的局限性

在剪枝修复场景下,任何基于导数的局部模型对开放对均存在盲区。门控加权目标的最小化解会偏离保持旧token侧的权重多面体,其闭式解在OPT-1.3b上比不修复差1.94纳特。对此,作者提出一种凸的单侧惩罚来约束该偏离,为实际应用提供了边界保障。

为什么值得看

以更低预算实现更优的防遗忘微调,对需持续学习且保留旧知识的LLM应用极具价值。

大模型微调

信源1 家

  1. [1]arXiv cs.AI一手信源A Tropical Geometry View of Forgetting: A Per-Unit Projector for Knowledge-Preserving Fine-Tuning

关键事实

  • 提出基于热带几何的门控感知逐单元投影器,用于大模型防遗忘微调[1]

  • 在OPT-1.3b上,同等预算下遗忘较Adam-NSCL降低1.1至4.3倍[1]

  • 用五分之一方向在GPM阈值下使Adam-NSCL遗忘减半[1]

  • 在OPT-6.7b上同等预算下遗忘与Adam-NSCL持平但学习更多[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。