论文提出M-TAG方法将音频情感识别重构为时序定位任务
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
传统音频情感识别对整段录音分配单一标签,多说话人时情感时间范围模糊。该研究将其重构为时序情感定位(TAG)任务,将情感与有时间边界的语音片段及语调描述关联。研究构建含两到四个情感语音片段(含重叠语音)的数据集。针对长格式训练导致性能下降及语调描述提供捷径的问题,提出M-TAG监督训练目标,结合全序列语言建模与交叉熵损失,通过注意力掩码减少捷径依赖,并用距离感知权重惩罚较大时间误差。基于此微调的EMO-TAG模型在情感识别与时序定位上对比Flamingo-Next等三个基线,结果显示现有模型情感识别尚可但时序定位能力有限。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载重构音频情感识别任务
传统音频情感识别对整段录音分配单一标签,当存在多个说话人及情感事件时,标签的时间范围变得模糊。为解决该局限,研究将音频情感识别重构为时序情感定位任务。该任务将情感与具有时间边界的语音片段以及语调描述相关联,从而明确情感在时间轴上的归属。为支撑这一任务设定,研究团队对现有情感识别数据集进行了时序标注,并构建了包含两到四个情感语音片段的录音,其中涵盖了重叠语音的情况。
M-TAG训练目标与机制
在长格式数据上使用标准语言建模目标进行训练,会导致情感识别与时序定位性能下降,且语调描述可能为情感预测提供捷径。针对这些挑战,研究引入了M-TAG监督训练目标。该目标将全序列语言建模与情感及时间戳的交叉熵损失相结合,并在注意力掩码机制下运行。掩码通过改变情感标签token可见的上下文,减少对捷径的依赖并提升泛化能力;同时时间戳损失引入了距离感知权重,对较大的时间误差施加更重惩罚。
模型评测与基线对比
研究使用构建的数据集和M-TAG目标微调得到EMO-TAG模型,并在情感识别和情感时序定位两项任务上对其进行评估。对比基线包括Flamingo-Next、Audio-Reasoner和AffectGPT三个音频情感识别及音频语言模型。评测结果表明,尽管现有模型在情感识别上表现出竞争力,但在情感时序定位方面的能力十分有限,凸显了新方法在时序定位上的优势与必要性。
为什么值得看
解决多说话人场景下情感时间范围模糊问题,提供新训练目标与数据集,提升情感时序定位能力。
微调模型评测语音论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
