AI 圈大事记

论文提出M-TAG方法将音频情感识别重构为时序定位任务

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

传统音频情感识别对整段录音分配单一标签,多说话人时情感时间范围模糊。该研究将其重构为时序情感定位(TAG)任务,将情感与有时间边界的语音片段及语调描述关联。研究构建含两到四个情感语音片段(含重叠语音)的数据集。针对长格式训练导致性能下降及语调描述提供捷径的问题,提出M-TAG监督训练目标,结合全序列语言建模与交叉熵损失,通过注意力掩码减少捷径依赖,并用距离感知权重惩罚较大时间误差。基于此微调的EMO-TAG模型在情感识别与时序定位上对比Flamingo-Next等三个基线,结果显示现有模型情感识别尚可但时序定位能力有限。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

重构音频情感识别任务

传统音频情感识别对整段录音分配单一标签,当存在多个说话人及情感事件时,标签的时间范围变得模糊。为解决该局限,研究将音频情感识别重构为时序情感定位任务。该任务将情感与具有时间边界的语音片段以及语调描述相关联,从而明确情感在时间轴上的归属。为支撑这一任务设定,研究团队对现有情感识别数据集进行了时序标注,并构建了包含两到四个情感语音片段的录音,其中涵盖了重叠语音的情况。

M-TAG训练目标与机制

在长格式数据上使用标准语言建模目标进行训练,会导致情感识别与时序定位性能下降,且语调描述可能为情感预测提供捷径。针对这些挑战,研究引入了M-TAG监督训练目标。该目标将全序列语言建模与情感及时间戳的交叉熵损失相结合,并在注意力掩码机制下运行。掩码通过改变情感标签token可见的上下文,减少对捷径的依赖并提升泛化能力;同时时间戳损失引入了距离感知权重,对较大的时间误差施加更重惩罚。

模型评测与基线对比

研究使用构建的数据集和M-TAG目标微调得到EMO-TAG模型,并在情感识别和情感时序定位两项任务上对其进行评估。对比基线包括Flamingo-Next、Audio-Reasoner和AffectGPT三个音频情感识别及音频语言模型。评测结果表明,尽管现有模型在情感识别上表现出竞争力,但在情感时序定位方面的能力十分有限,凸显了新方法在时序定位上的优势与必要性。

为什么值得看

解决多说话人场景下情感时间范围模糊问题,提供新训练目标与数据集,提升情感时序定位能力。

微调模型评测语音论文数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Finding Emotions Where They Belong: Rethinking Audio Emotion Recognition through Masked Temporal Affective Grounding

关键事实

  • 将音频情感识别重构为时序情感定位任务,关联情感与时间边界语音片段及语调描述[1]

  • 构建含两到四个情感语音片段(含重叠语音)的时序标注数据集[1]

  • 提出M-TAG监督训练目标,用注意力掩码减少捷径依赖,用距离感知权重惩罚时间误差[1]

  • EMO-TAG模型评测显示现有模型情感识别尚可但时序定位能力有限[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。