研究提出MISVO方法以最小侵入方式引导大模型
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对冻结语言模型在测试时适配奖励的预logit引导技术,未正则化优化易破坏生成质量的问题,研究提出MISVO方法。该方法利用诱导词元分布的局部KL几何对干预进行惩罚,通过Fisher二次型衡量分布敏感度,并利用冻结模型头计算解析梯度。在1B至14B参数模型的偏好与代码生成任务中,MISVO在七项设置里的六项取得最高平均奖励,且多样性与连贯性接近Best-of-N基线。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载预logit引导的优化痛点
预logit引导旨在通过向冻结语言模型最终隐藏状态添加向量,使其在测试阶段适配特定奖励。然而,直接进行未正则化的奖励优化会显著改变模型原有的输出分布,导致生成质量严重退化。这成为该技术实际应用中的核心障碍,亟需一种能在提升目标奖励与保持原有生成特性间取得平衡的干预机制。
MISVO的干预惩罚与梯度推导
为解决上述问题,研究提出最小侵入引导向量优化(MISVO)。该方法利用诱导词元分布的局部KL散度几何对干预施加惩罚。由此产生的Fisher二次型能够衡量分布的敏感度,并允许通过冻结的语言模型头的矩阵-向量乘积计算解析梯度。研究还将序列级KL梯度精确分解为解析Fisher项与后缀得分函数项,证明在固定生成长度下,后缀项在引导幅度上为二阶量,且三个Fisher替代项与完整KL梯度一阶一致。
实验表现与基线对比
MISVO采用冻结参考替代项来优化特定位置的干预,全程无需更新模型参数。在约1B至14B参数规模的模型上,针对偏好对齐与代码生成任务进行的评估显示,MISVO在七个模型-任务设定中有六个取得了最高的平均奖励。同时,其生成结果的多样性与连贯性评分与Best-of-N采样策略表现接近,表明该方法在有效提升奖励的同时,成功维持了生成质量。
为什么值得看
提供无需更新模型参数即可在测试时高效优化模型输出的方法,兼顾高奖励与生成质量。
大模型代码生成
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
