新方法Selective-RL实现跨模型视觉推理能力迁移

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

模型合并可将语言模型推理能力免训迁移至视觉语言模型,但基于端点的迁移易混淆原有差异与后训练变化。Selective-RL方法隔离强化学习阶段的参数更新,保留其矩阵级主导方向及幅度并迁移至VLM语言模块。在3个模型族与5个基准上,15项对比中12项优于全量更新插值,在Qwen上MathVision提升8.55个百分点。控制实验表明单纯幅度或任意低秩无法复现该增益,揭示了后训练习得内容与跨模型可迁移内容的差异。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

跨模型迁移痛点

将语言模型推理能力向视觉语言模型免训转移时,基于端点的常规合并方式存在缺陷。它容易把模型间原本就存在的参数差异,与后训练阶段新产生的变化混为一谈,导致转移效果不佳。为解决此问题,研究转向围绕训练阶段的更新来构建能力转移机制,试图单独剥离出由强化学习引发的参数变动。

Selective-RL核心机制

研究发现强化学习更新的各组成部分在跨模型转移时表现差异巨大,其中主导方向比完整更新转移更有效。据此提出的Selective-RL方法,先分离出强化学习阶段的更新,接着保留其矩阵级别的主导方向并维持幅度不变,最后将这些精选成分转移给视觉语言模型的语言模块。对照实验证实,仅靠更新幅度或随意截取低秩均无法达到同等效果。

评测表现与启示

在涵盖3个模型族和5个视觉推理基准的测试中,Selective-RL在15项对比里有12项超越了全量更新插值基线。具体而言,以Qwen作为接收模型时,MathVision得分增加了8.55个百分点。该结果区分了后训练期间习得的内容与跨模型实际可迁移的内容,为从训练阶段视角理解跨模型能力转移提供了实证依据。代码已公开。

为什么值得看

揭示强化学习更新中可迁移成分,为跨模型免训能力转移提供新视角与显著增益。

Qwen强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Selective Transfer of RL Updates for Visual Reasoning

关键事实

  • Selective-RL方法隔离强化学习阶段参数更新,保留矩阵级主导方向及幅度迁移至VLM语言模块[1]

  • 在3个模型族与5个视觉推理基准上,15项对比中12项优于全量更新插值[1]

  • 在Qwen接收模型上MathVision基准提升8.55个百分点[1]

  • 控制实验表明单纯更新幅度或任意低秩无法复现该增益[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。