新方法SERA按奇异值能量分配秩,提升模型合并效果
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有谱合并方法在合并微调模型时,为各任务向量分配相同秩容量,忽略了不同任务谱复杂度的差异,导致合并空间利用不佳。该论文提出SERA(谱能量比例秩分配)策略,依据各任务向量的奇异值能量结构自适应分配秩。对复杂或孤立任务分配更多谱容量,对紧凑任务分配更少方向,将基于SVD的合并从均匀容量扩展到任务依赖分配。在标准视觉模型合并协议下,SERA在保持与现有方法相同总秩预算的同时,提升了多任务合并性能。分析还揭示了任务级谱集中度与自适应秩分配效果的相关性。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载均匀分配秩的局限性
模型合并旨在将源自同一预训练模型的多个微调版本组合为单一多任务模型,无需额外联合训练。近期谱合并方法利用任务特定更新的低秩结构,超越了简单权重平均。然而,此类方法通常为每个任务分配相等的秩容量。这种均匀分配机制忽视了不同任务向量可能具有异构的谱复杂度,使得共享的合并空间无法得到最优利用,限制了合并后模型的表现。
SERA自适应分配策略
针对上述局限,论文提出了谱能量比例秩分配(SERA)。这是一种简单的任务自适应策略,根据每个任务向量的奇异值能量结构来分配秩。具体而言,SERA为复杂或孤立的任务分配更丰富的谱容量,而为紧凑的任务分配较少的方向。通过这种方式,SERA将基于奇异值分解(SVD)的模型合并从均匀容量合并扩展到了依赖于任务的容量分配,使合并空间的分配更贴合各任务的实际需求。
实验验证与效果分析
在标准视觉模型合并协议下的实验表明,SERA在保持与现有谱合并方法相同的总秩预算条件下,有效提升了多任务合并的性能。进一步的深入分析显示,任务级别的谱集中度与自适应秩分配的逐任务效果密切相关。这一发现为理解SERA的生效机制提供了洞察,明确了在何种情境下采用该自适应分配策略能够带来显著的收益。
为什么值得看
SERA在不增加总秩预算下,通过自适应分配秩容量提升多任务合并性能,为高效融合微调模型提供了新思路。
微调论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
