新方法压缩全双工语音模型KV缓存,峰值降幅超64%
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全双工语音模型持续累积声学KV状态,导致长交互内存消耗大。新提出的声学到文本KV压缩方法,利用模型处理音频间隙(listening-time slack),通过转录侧通道将语音转为紧凑文本记忆。缓存超限时驱逐旧声学状态,保留文本与近期声学上下文。在MiniCPM-o 4.5的十分钟长语音测试中,该方法使峰值流式KV缓存大小降低64.6%,并在转录、时序问答与摘要任务上优于基线,同时保持原有的停顿处理与打断性能。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长时交互显存瓶颈与解法
全双工语音语言模型在持续运行中会不断累积声学键值(KV)状态,使得长时间交互极其消耗内存。该研究指出,模型在倾听阶段,能在下个音频单元到达前完成当前处理,此空闲期被称为倾听时间余量。提出的声学到文本KV压缩方法,正是利用该余量引入转录侧通道,将输入语音转化为占位更少的文本记忆。当推理期缓存超出目标预算时,系统会驱逐较早的声学状态,同时保留转录文本与近期的声学上下文,从而控制显存占用。
训练策略与实验表现
为训练该侧通道,研究者采用LoRA并在转录片段上使用交叉熵损失。为避免新增通道干扰原有听讲能力,他们还对原生预测位置的词级输出分布应用了知识蒸馏。在基于MiniCPM-o 4.5的十分钟LongSpeech会话测试中,相比无驱逐机制的同类模型,新方法将峰值流式KV缓存大小削减了64.6%。此外,该方法在转录、时序问答及摘要任务上均超越基线,且在Full-Duplex-Bench评测中,停顿处理、轮次切换与打断表现与原模型相当。
为什么值得看
解决全双工语音模型长时交互的显存瓶颈,且不损失对话核心能力,对部署长时语音助手极具实用价值。
语音
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
