AI 圈大事记

研究揭示ASR与音频模型在语码转换场景下的表现差异

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对英语与约鲁巴语混合的语码转换语音,研究评估了六个ASR模型和五个音频语言模型。结果显示,传统的词错误率掩盖了模型在语言切换点的具体表现。虽然WER最佳模型与领先的音频LM在整体得分上无显著差异,但后者在所有针对切换点的指标上表现更优。此外,多数系统在识别约鲁巴语词汇时错误率极高,且错误集中在切换至约鲁巴语的节点。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

评估背景与方法

现有的自动语音识别系统和音频语言模型在单语基准测试中通常报告较低的词错误率,但在低资源且包含变音符号的语码转换语音上的行为尚未得到充分表征。为此,研究团队针对英语与约鲁巴语混合的语码转换语音进行了“切换感知”评估。测试对象包括六个现代ASR模型和五个音频语言模型,使用了一个包含2000条语音的确定性评估集以及共享的评分管道。

核心发现与指标差异

研究引入了多项超越传统WER的指标,包括切换入口词错误率、窗口化切换点错误率、特定语言错误率以及不区分变音符号的WER。核心发现表明,聚合的WER掩盖了系统处理语码转换的真实行为。在WER上表现最佳的系统是一个ASR模型,它与领先的音频语言模型在WER数值上统计上无法区分,然而该音频语言模型在所有针对切换点的局部指标上都显著优于ASR模型。

具体错误模式分析

在所有被测试的系统中,约鲁巴语词汇的识别能力出现崩溃,错误率高达0.97,相比之下英语词汇的识别效果要好得多。错误高度集中在从英语切换到约鲁巴语的节点上。此外,部分生成式音频语言模型无法胜任精确转录任务,其输出包含翻译、冗余内容以及提示词泄露,且这些问题强烈依赖于提示词的设置。

为什么值得看

揭示了通用指标在语码转换场景下的局限性,为低资源语言评估提供新视角。

语音

信源1

  1. [1]arXiv cs.AI一手信源Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

关键事实

  • 研究评估了六个ASR模型和五个音频语言模型在英语约鲁巴语码转换语音上的表现。[1]

  • 整体WER最佳模型与领先音频LM在WER上无统计差异,但后者在切换点指标上显著更好。[1]

  • 几乎所有系统在约鲁巴语词汇识别上崩溃,错误率达0.97,错误集中在切换至约鲁巴语处。[1]

  • 部分生成式音频LM无法作为精确转录器,出现翻译、冗余和提示词泄露。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。