AI 圈大事记

研究证明混合LLM的循环部分可完全4位量化

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究人员通过Minima模型测试了对混合27B大语言模型中Gated DeltaNet循环层的完全4位量化,发现性能接近BF16精度,同时模型体积最小(17.5 GiB)且预填充速度提升14-19%。研究揭示了循环部分能够成功量化的四部分机制,包括块缩放局部化异常值、门控投影参数化对误差的压缩、delta规则对噪声的抑制以及每token量化成本随上下文增长而非累积。
量化

信源1

  1. [1]arXiv cs.AI一手信源Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM

关键事实

  • Minima模型在4K/32K困惑度、MMLU-Pro等多项测试中与BF16精度相差在种子噪声范围内(5任务平均-0.52)[1]

  • Minima模型体积为17.5 GiB,是测试中最小的模型,预填充速度提升14-19%[1]

  • 研究揭示了循环部分能够成功量化的四部分机制,包括块缩放局部化异常值、门控投影参数化对误差的压缩等[1]

  • 研究修复了当每模块校准的NVFP4检查点由融合模块为一个GEMM的内核提供服务时出现的全局规模不匹配问题[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。