RetroThinker提升语音大模型推理能力
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
RetroThinker 是一个多阶段后训练框架,使流式语音大模型能够在推理过程中动态修正思维链。该方法结合了监督微调与基于长度的直接偏好优化,让 Moshi 模型具备在用户说话时并发推理并自我验证的能力。在 GSM8K 基准测试中,该方案在保持相当延迟的同时,实现了 11% 的绝对准确率提升。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载语音模型推理瓶颈
语音大模型虽然降低了延迟并保留了副语言特征,但在复杂推理任务上仍落后于纯文本模型。实时口语交互对延迟有严格要求,尽管此前已有工作利用思维链和并发推理来增强能力且不造成过大延迟,但精度与延迟之间的权衡问题依然存在。如何在保持低延迟的同时提升推理准确性,是该领域面临的关键挑战。
动态修正推理机制
RetroThinker 框架旨在探索流式语音大模型能否在运行中动态修订其推理轨迹。该方案基于 Moshi 模型,使其具备在推理阶段自我验证并前向修正思维链步骤的能力。具体做法是结合监督微调与基于长度的直接偏好优化,利用精心整理的回顾性思维数据进行训练。这种机制允许模型在用户说话的同时进行早期推理,并即时优化推理过程。
性能提升与验证
研究团队在 GSM8K 数学推理基准上对 RetroThinker 进行了评估。结果显示,该方法显著改善了准确率与延迟之间的权衡关系。在与不具备回顾能力的基线模型对比中,RetroThinker 在保持相当延迟水平的前提下,实现了 11% 的绝对准确率提升。该论文已被 IEEE SLT 2026 接收,涉及音频语音处理及人工智能等领域。
为什么值得看
解决了语音大模型在复杂推理任务中精度与延迟难以兼得的痛点。
大模型微调语音基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
