AI 圈大事记

Agentic-GER:基于LLM的智能体修正长语音专业术语

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对长语音ASR中领域专业术语转录准确率低的问题,Yanqiao Zhu等人提出Agentic-GER智能体。该方案利用大语言模型的全局上下文能力,从完整文本中定位可疑术语并消解歧义,选择性地对源语音重转录以校验候选修正,并用已采纳的编辑指导后续决策。在GigaSpeechBench上结合四种LLM与两种ASR的实验表明,中英文术语表现均稳定提升。中文语音下,其偏置字符错误率相对Whisper基线最高降低36.8%。论文已投ICASSP 2027。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

术语修正机制设计

长音频自动语音识别虽因语音语言模型进展而改善,但领域特定术语的准确一致转写仍存挑战。Agentic-GER作为基于大语言模型的智能体,旨在解决该问题。其核心机制是利用大语言模型的世界知识与上下文能力,从整段转写文本中提取全局信息,借此识别出可能存在错误的专业术语,并消除转写中的歧义假设。

重转录校验与反馈

在定位可疑术语后,该智能体并非直接替换,而是选择性地对原始语音片段重新转录,以此校验候选修正内容的正确性。此外,系统会将已确认并采纳的编辑结果作为反馈,用于指导后续的修正决策,从而在全局上下文中保持术语转写的一致性。

实验效果与表现

研究在GigaSpeechBench基准上开展实验,测试了四种大语言模型与两种自动语音识别系统的组合。结果显示,无论是否启用思维链,中英文的术语转写表现均有稳定提升。在中文语音场景下,与Whisper基线相比,Agentic-GER将偏置字符错误率相对降低了最高达36.8%。该论文由Yanqiao Zhu等人撰写,已提交至ICASSP 2027。

为什么值得看

利用LLM全局上下文与重转录校验机制,显著降低长语音ASR专业术语错误率,为垂直领域语音转写提供新解法。

智能体语音论文

信源1 家

  1. [1]arXiv cs.AI一手信源agentic-ger: terminology recovery in long-form speech using global context

关键事实

  • Agentic-GER利用LLM全局上下文定位可疑术语、选择性重转录校验候选修正,并用采纳结果指导后续决策[1]

  • 在中文语音测试中,偏置字符错误率相对Whisper基线最高降低36.8%[1]

  • 实验基于GigaSpeechBench,结合四种LLM与两种ASR系统,中英文术语表现均稳定提升[1]

  • 论文由Yanqiao Zhu等人提交,投稿至ICASSP 2027[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。