新研究提出EDR目标函数优化并行推测解码草稿模型训练

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对并行与半自回归草稿模型训练因跨轮耦合忽略全局效率的痛点,新研究将其建模为马尔可夫奖励过程,提出期望解码轮数(EDR)目标函数。该函数用状态占用加权局部拒绝成本,无需辅助超参,且精确等于期望解码轮数。研究推导出支持无偏随机优化的精确时序差分梯度,并给出离线评估器。在九项涵盖数学、代码与对话的基准上,用EDR微调DSpark和DFly均稳定提升平均接受长度,优于现有训练目标。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

草稿模型训练痛点与建模

推测解码借助低成本草稿模型提议词元供目标模型并行验证以加速推理。并行及半自回归草稿器能在单次前向传播中提议整个块,但其训练存在难点:特定位置的草稿分布依赖解码轮起始点,而起始点又取决于前序轮接受的词元数。现有训练目标依赖块局部代理,忽略了这种跨轮耦合,未直接优化全局解码效率。本研究将推测解码建模为马尔可夫奖励过程,从而构建了训练与评估此类草稿器的理论框架。

EDR目标函数与优化评估

基于上述框架,研究提出期望解码轮数(EDR)目标函数,通过状态占用加权局部拒绝成本,使其精确等于期望解码轮数。与先前代理目标不同,EDR不引入任何辅助超参数。研究进一步推导出精确的时序差分梯度,支持从目标模型 rollout 进行无偏随机优化。同时,该框架还提供了一个精确的离线评估器,能在共享目标 rollout 上进行配对草稿器比较,无需实际运行推测解码。

微调实验与基准测试表现

在实验部分,研究使用EDR对DSpark和DFly这两个先进草稿器进行微调。测试覆盖了九个基准,横跨数学推理、代码生成和对话领域。结果显示,微调后的模型在平均接受长度上取得稳定提升,且整体表现优于现有的训练目标函数,验证了EDR在直接优化全局解码效率上的有效性。

为什么值得看

直接优化全局解码效率且无需调超参,为提升大模型推理加速中草稿模型质量提供了更优训练范式。

微调

信源1 家

  1. [1]arXiv cs.AI一手信源Training Parallel Speculative Draft Models by Directly Minimizing Expected Decoding Rounds

关键事实

  • 将推测解码建模为马尔可夫奖励过程,提出期望解码轮数(EDR)目标函数[1]

  • EDR目标函数无需辅助超参数,且精确等于期望解码轮数[1]

  • 推导出支持无偏随机优化的精确时序差分梯度及离线评估器[1]

  • 用EDR微调DSpark和DFly,在九项基准上平均接受长度均获提升并优于现有目标[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。