REVE方法利用复用编码器状态高效修正音频大模型幻觉
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
大型音频语言模型常生成输入中不存在的声学事件。现有验证方法需额外音频编码器与前向传播。REVE方法复用目标模型已计算的编码器状态,通过两种读出方式汇总类分数,并结合类感知分数融合验证生成事件,无需二次音频编码。在AudioSet上,REVE在忠实提及召回约束下移除92.9%无标签支持的提及。其增加参数少,验证延迟约为CED-Base路径的1/18,降幅却与CED-Tiny及CED-Base相当。在受控DESED混合及不同目标模型架构上的结果也证实了该复用机制的有效性。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载音频大模型幻觉验证痛点
大型音频语言模型在处理输入时,常会提及实际并不存在的声学事件,即产生幻觉。为解决此问题,通常引入独立的音频事件检测器来核实这些提及。然而,这种独立验证方式存在明显开销:它需要配置第二个音频编码器,并执行一次单独的前向传播,导致计算成本与延迟显著增加,限制了其在实际应用中的效率。
REVE复用编码器状态机制
REVE提出一种轻量级修正方案,核心在于复用目标模型已经计算出的编码器状态,从而彻底免除二次音频编码过程。具体而言,该方法设计了两种读出机制:一种跨音频帧汇总类分数,另一种利用四个连续帧区间的池化状态。随后,通过类感知分数融合技术结合这两种输出,对模型生成的声学事件提及进行验证,在保持高精度的同时极大降低了计算开销。
性能对比与实验验证
在AudioSet数据集上,REVE在满足忠实提及召回约束的条件下,成功移除了92.9%缺乏标签支持的事件提及。与CED-Tiny和CED-Base相比,REVE在增加更少参数的前提下,取得了与之相当的幻觉降幅。在延迟方面,REVE的完整验证延迟仅为CED-Base路径的约1/18。此外,在受控的DESED混合数据及不同目标模型架构上的实验,进一步确认了复用编码器状态这一机制的有效性与泛化能力。
为什么值得看
无需额外编码器即可高效验证并修正音频大模型幻觉,验证延迟大幅降至传统方案1/18,极具工程落地价值。
大模型幻觉
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
