Agentic-GER:基于LLM的智能体修正长语音专业术语
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对长语音ASR中领域专业术语转录准确率低的问题,Yanqiao Zhu等人提出Agentic-GER智能体。该方案利用大语言模型的全局上下文能力,从完整文本中定位可疑术语并消解歧义,选择性地对源语音重转录以校验候选修正,并用已采纳的编辑指导后续决策。在GigaSpeechBench上结合四种LLM与两种ASR的实验表明,中英文术语表现均稳定提升。中文语音下,其偏置字符错误率相对Whisper基线最高降低36.8%。论文已投ICASSP 2027。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载术语修正机制设计
长音频自动语音识别虽因语音语言模型进展而改善,但领域特定术语的准确一致转写仍存挑战。Agentic-GER作为基于大语言模型的智能体,旨在解决该问题。其核心机制是利用大语言模型的世界知识与上下文能力,从整段转写文本中提取全局信息,借此识别出可能存在错误的专业术语,并消除转写中的歧义假设。
重转录校验与反馈
在定位可疑术语后,该智能体并非直接替换,而是选择性地对原始语音片段重新转录,以此校验候选修正内容的正确性。此外,系统会将已确认并采纳的编辑结果作为反馈,用于指导后续的修正决策,从而在全局上下文中保持术语转写的一致性。
实验效果与表现
研究在GigaSpeechBench基准上开展实验,测试了四种大语言模型与两种自动语音识别系统的组合。结果显示,无论是否启用思维链,中英文的术语转写表现均有稳定提升。在中文语音场景下,与Whisper基线相比,Agentic-GER将偏置字符错误率相对降低了最高达36.8%。该论文由Yanqiao Zhu等人撰写,已提交至ICASSP 2027。
为什么值得看
利用LLM全局上下文与重转录校验机制,显著降低长语音ASR专业术语错误率,为垂直领域语音转写提供新解法。
智能体语音论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
