新研究提出逐单元投影器以缓解大模型微调遗忘
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对语言模型微调新数据时损害已有能力的问题,该研究利用热带几何揭示ReLU层特性,提出一种门控感知的逐单元投影器。理论证明其代价为单元自身开放token的秩,远低于共享子空间需支付的联合秩。在OPT-1.3b上,9至60个约束方向预算下,遗忘程度较Adam-NSCL降低1.1至4.3倍;用其五分之一方向即在GPM能量阈值下将遗忘减半。在OPT-6.7b上,同等预算下遗忘持平但学得更多。18组实验均验证开放与封闭token划分的关键作用。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载投影器原理与理论优势
现有无回放投影方法(如Adam-NSCL和GPM)在每行更新中禁止共享子空间,该文指出此举过于粗糙。通过热带几何分析ReLU层,作者在数据空间将单元边界视作热带超曲面,在权重空间将旧token视作超平面,两者通过恒等式相连。该恒等式将输出变化平方拆分为单元内、开到闭及闭到开项,由此引出逐单元投影器。预算分离定理表明,精确保护仅需耗费单元自身开放token的秩,而共享子空间每行至少需支付其联合的秩,理论代价更低。
实验验证与模型表现
在OPT-1.3b上,96%的(token, unit)对处于封闭状态。在9至60个每行约束方向的六档匹配预算下,新方法遗忘程度均低于Adam-NSCL,优势从1.1倍扩大至4.3倍。仅用约五分之一的方向,便在GPM能量阈值下将Adam-NSCL的遗忘减半。在OPT-6.7b上,匹配预算下两者遗忘持平,但新方法学到了更多新知识。18组种子对实验全面证实,开放与封闭token的划分是关键有效变量,其表现全面胜过随机、符号盲及反门控token集。
剪枝修复中的局限性
在剪枝修复场景下,任何基于导数的局部模型对开放对均存在盲区。门控加权目标的最小化解会偏离保持旧token侧的权重多面体,其闭式解在OPT-1.3b上比不修复差1.94纳特。对此,作者提出一种凸的单侧惩罚来约束该偏离,为实际应用提供了边界保障。
为什么值得看
以更低预算实现更优的防遗忘微调,对需持续学习且保留旧知识的LLM应用极具价值。
大模型微调
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
