UniAE-MoE统一音频编码器登顶XARES-LLM与Interspeech…

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

UniAE-MoE通过混合专家架构融合Qwen2-Audio与Audio-Flamingo 3的编码器,实现跨语音、音乐及通用音频域的统一表征。该模型采用SwiGLU与共享专家解耦网络,结合两阶段指令微调及任务特定数据缩放技术提升理解力。在XARES-LLM基准测得0.802分创SOTA,并获Interspeech 2026音频编码器能力挑战赛最优,验证了其泛化性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

架构设计与编码器融合

为提升大型音频语言模型的多任务表现,UniAE-MoE采用混合专家架构构建统一音频编码器,以建模跨域音频表征。该研究探索并整合了源自Qwen2-Audio与Audio-Flamingo 3的编码器,这两者已被证明具备卓越的下游能力。为使模型融合更高效,研究者在编码器中引入了结合共享专家的SwiGLU机制,从而实现编码器网络的有效解耦。

训练策略与数据缩放

在训练适配方面,该工作提出两阶段指令微调策略,使模型能更好地适应多样化的下游任务。此外,为增强模型的理解能力,还引入了任务特定数据缩放技术。这些方法共同作用,提升了统一编码器在处理不同音频模态和任务指令时的精准度与泛化能力。

基准评测与挑战赛表现

在XARES-LLM基准测试中,UniAE-MoE获得0.802的分数,达成当前最优性能。同时,该模型在官方举办的Interspeech 2026音频编码器能力挑战赛中同样取得顶级表现。这两项评测结果充分证明了该统一编码器在语音、音乐及通用音频域上具备强大的跨域泛化与理解能力。

为什么值得看

融合主流音频编码器实现跨域SOTA,为构建大型音频语言模型提供更优基础组件。

Qwen微调MoE语音基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

关键事实

  • UniAE-MoE融合了Qwen2-Audio与Audio-Flamingo 3的音频编码器[1]

  • 在XARES-LLM基准测试中取得0.802分,达到当前最优性能[1]

  • 获得Interspeech 2026音频编码器能力挑战赛顶级性能[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。