AI 圈大事记

Telescopic语言模型单次训练覆盖多算力预算,质量预算曲线面积降43%

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

为解决不同算力预算需单独训练的问题,Telescopic语言模型(TLM)通过随机前缀监督与全容量锚点,在单次训练中生成各深度均有效的嵌套模型。每步仅需两次前向反向传播,无需改架构或增加推理开销。在2亿参数代理套件上,TLM在二十个层前缀上均有效,相比固定退出套件(如MLMS),质量预算曲线下面积减少43-44%,全容量表现持平且单次运行GPU成本降低约12%。前缀采样密度可调,使操作点成为训练时选择而非架构限制。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

TLM训练机制与推理优势

部署的语言模型常需适配多种算力预算,传统方式需为每个预算点单独训练或压缩。TLM通过随机前缀监督与全容量锚点,将嵌套容量Transformer训练为连续体。训练每步中,容量轴上随机截断的前缀与全容量通道共同针对完整下一词目标优化,确保训练产物在各深度均为有效语言模型。此过程每步仅增加一次前向反向传播,无需修改模型架构,推理阶段也不引入额外开销。

与固定退出方案对比及实验数据

固定退出方案如Matryoshka语言模型套件仅监督少数固定退出点,致使其他深度嵌套模型困惑度飙升至10^2至10^5,近乎随机水平。在2亿参数代理套件与200亿FineWeb-Edu词元的统一数据流测试中,单次TLM训练产出的模型在二十个层前缀上均有效。相比固定退出套件,TLM将质量预算曲线下面积缩减43-44%,全容量性能完全持平,且单次运行GPU成本降低约12%。

前缀采样密度与模型弹性来源

TLM的前缀采样密度可作为调节旋钮:若将采样集中于少数深度,可在这些点恢复固定退出质量,但会牺牲连续体特性。这使得操作点成为训练时的选择,而非受限于架构设计。实验结果表明,赋予模型弹性的核心在于训练目标,而非嵌套结构本身。

为什么值得看

单次训练产出全深度有效模型,大幅降低多算力预算适配成本,揭示弹性源于训练目标而非嵌套架构。

算力GPU

信源1 家

  1. [1]arXiv cs.AI一手信源Telescopic Language Models

关键事实

  • TLM通过随机前缀监督与全容量锚点训练,每步两次前向反向传播,不改架构,无额外推理开销。[1]

  • 在2亿参数代理套件上,TLM相比固定退出套件将质量预算曲线下面积减少43-44%,全容量表现持平,GPU成本降约12%。[1]

  • 固定退出套件仅在少数固定退出点监督,导致其他深度嵌套模型处于随机水平(困惑度达10^2-10^5)。[1]

  • TLM的前缀采样密度可调,将操作点转化为训练时选择而非架构限制。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。