Kokoro-82M被蒸馏为8M参数单语音TTS模型Paradee

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Sahil Mahendrakar将含54种语音的开源模型Kokoro-82M蒸馏为仅保留单语音的Paradee。新模型参数量8.07M,计算量降15倍,架构保留但层宽大幅缩窄。训练分两半独立进行:先用教师模型合成语料并提取音素等特征,分别训练文本侧预测器与解码器,最后拼接并量化为int8。量化后体积仅8.5MB,单CPU线程运行速度达实时25倍,UTMOS评分4.41(教师为4.52)。针对合成音频2至8kHz的轻微杂音,通过后处理相位锁定滤波器无需额外训练即可消除。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

模型蒸馏与训练策略

该研究将支持54种语音的Kokoro-82M提炼为仅含单语音的Paradee。新模型沿用原架构但大幅缩减层宽,参数量降至8.07M。训练无需对齐学习或联合训练,而是将模型分为两半各自独立训练:首先利用冻结的教师模型生成语料,保存其时长、音高、能量及音素特征;随后训练小型文本侧网络来预测这些特征值,并训练小型解码器将教师保存的特征转化为音频,先经频谱损失优化再经对抗训练优化,最后将两半相连。

量化压缩与运行效能

两半网络连接后,权重被量化至int8精度。最终模型体积仅8.5MB,可在单台笔记本上运行。在单CPU线程下,其推理速度达到实时的25倍,计算需求较原版降低15倍。在语音质量评测UTMOS中,Paradee得分为4.41,与教师模型的4.52分差距微小,实现了极致压缩下的质量保留。

音频瑕疵的后处理修复

开发初期学生模型合成的语音带有轻微杂音,研究者追溯发现该杂音源于2至8kHz频段间浊音的相位问题。对此,研究提出在合成后应用相位锁定滤波器进行处理,该方式无需引入任何额外参数或进行额外训练,即可消除大部分杂音,进一步提升了轻量模型的输出音质。代码、模型及音频样本已公开。

为什么值得看

仅8.5MB的单线程TTS模型评分接近82M原版,为端侧设备部署极轻量语音合成提供可行方案。

蒸馏量化开源模型语音

信源1 家

  1. [1]arXiv cs.AI一手信源Paradee: Distilling Kokoro-82M into an 8M-Parameter Single-Voice Text-to-Speech Model

关键事实

  • Paradee参数量8.07M,较Kokoro-82M减少10倍,计算需求降15倍[1]

  • 模型量化为int8后体积8.5MB,单CPU线程运行速度达实时25倍[1]

  • UTMOS评分4.41,接近教师模型的4.52[1]

  • 通过后处理相位锁定滤波器消除了2至8kHz的轻微杂音[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。