新方法Selective-RL实现跨模型视觉推理能力迁移
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
模型合并可将语言模型推理能力免训迁移至视觉语言模型,但基于端点的迁移易混淆原有差异与后训练变化。Selective-RL方法隔离强化学习阶段的参数更新,保留其矩阵级主导方向及幅度并迁移至VLM语言模块。在3个模型族与5个基准上,15项对比中12项优于全量更新插值,在Qwen上MathVision提升8.55个百分点。控制实验表明单纯幅度或任意低秩无法复现该增益,揭示了后训练习得内容与跨模型可迁移内容的差异。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载跨模型迁移痛点
将语言模型推理能力向视觉语言模型免训转移时,基于端点的常规合并方式存在缺陷。它容易把模型间原本就存在的参数差异,与后训练阶段新产生的变化混为一谈,导致转移效果不佳。为解决此问题,研究转向围绕训练阶段的更新来构建能力转移机制,试图单独剥离出由强化学习引发的参数变动。
Selective-RL核心机制
研究发现强化学习更新的各组成部分在跨模型转移时表现差异巨大,其中主导方向比完整更新转移更有效。据此提出的Selective-RL方法,先分离出强化学习阶段的更新,接着保留其矩阵级别的主导方向并维持幅度不变,最后将这些精选成分转移给视觉语言模型的语言模块。对照实验证实,仅靠更新幅度或随意截取低秩均无法达到同等效果。
评测表现与启示
在涵盖3个模型族和5个视觉推理基准的测试中,Selective-RL在15项对比里有12项超越了全量更新插值基线。具体而言,以Qwen作为接收模型时,MathVision得分增加了8.55个百分点。该结果区分了后训练期间习得的内容与跨模型实际可迁移的内容,为从训练阶段视角理解跨模型能力转移提供了实证依据。代码已公开。
为什么值得看
揭示强化学习更新中可迁移成分,为跨模型免训能力转移提供新视角与显著增益。
Qwen强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
