AI 圈大事记

AdviSD方法通过选择性自蒸馏训练小型顾问模型引导前沿大模型

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

AdviSD方法让小型可训练顾问模型用自然语言引导冻结的大模型执行器。针对共享参数模型中无效修正会限制学习的问题,该方法将结果驱动的强化学习与选择性自蒸馏结合,通过评估建议对执行器响应的影响幅度来挑选监督数据,无需执行器的似然或额外推演。用Qwen3-8B作顾问为Gemini和Claude提供引导时,在BFCL-v3上较advisor-GRPO提升4.2至6.4个百分点,在EnvScaler上提升3.9至5.1分。训练后的顾问可泛化至域外任务,并在不同执行器版本与模型家族间迁移。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

核心机制与选择逻辑

AdviSD旨在训练小型顾问模型以自然语言形式向处于冻结状态的大模型执行器提供建议。在共享参数模型中,并非所有修正都能改变执行结果,若从那些未改变执行的修正中学习,且其目标对有用建议的偏好弱于其他修正,便会限制模型学习。为解决此问题,AdviSD将基于结果的强化学习与来自反馈条件副本的自蒸馏相结合。反思机制提出修正,顾问模型对同一记录的执行器响应进行打分,分别评估有建议和无建议的情况,利用两者得分差异的幅度来挑选用于监督的决策,从而保留更有效的训练信号。

实验表现与泛化能力

实验采用Qwen3-8B作为顾问模型,分别对Gemini和Claude执行器进行引导。在BFCL-v3基准上,AdviSD相比advisor-GRPO取得了4.2至6.4个百分点的提升;在EnvScaler基准上,提升了3.9至5.1分。同时,该方法也击败了匹配数量的随机选择基线,验证了其选择规则的有效性。此外,经过训练的顾问模型展现出了良好的泛化与迁移能力,不仅能在域外任务上保持效果,还能跨不同执行器版本及不同模型家族进行迁移,且整个过程无需执行器的似然数据或额外的执行器推演。

为什么值得看

用小模型引导大模型且无需大模型内部数据,跨模型泛化能力强,为降低大模型调用与微调成本提供新路径。

ClaudeGeminiQwen大模型强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation

关键事实

  • AdviSD方法使用小型可训练顾问模型通过自然语言建议引导冻结的大模型执行器[1]

  • 该方法通过评估建议对执行器响应的改变幅度来选择监督数据,避免无效修正限制学习[1]

  • 使用Qwen3-8B作为顾问为Gemini和Claude提供引导,在BFCL-v3上较advisor-GRPO提升4.2-6.4个百分点[1]

  • 在EnvScaler上较advisor-GRPO提升3.9-5.1分,且优于等量随机选择[1]

  • 训练后的顾问模型能泛化至域外任务,并跨不同执行器版本和模型家族迁移[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。