WorldSonus框架实现世界模型实时交互空间音频合成

论文AI 评分 78/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对世界模型生成环境普遍静音的痛点,WorldSonus框架实现了实时、可交互且空间对齐的音频合成。该框架采用流式因果自回归扩散架构,将实时因子降至0.41以满足交互视频流速度;结合音频中心标注与分块索引提示调度,支持生成中途动态操控声音事件;并利用立体声与高阶立体声数据实现高质量双耳监督以匹配场景几何与相机运动。实验表明,该框架在开放域视频生音频基准上,声学与空间对齐指标均匹敌或超越现有双向模型。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

世界模型音频合成挑战

当前世界模型在视觉合成上进展显著,但生成的虚拟环境通常缺乏声音。为世界模型引入音频面临三大核心难题:首先是实时性要求,音频生成必须跟上交互视频流的播放速度;其次是交互控制,系统需响应生成过程中途插入的声音指令;最后是空间对齐,立体声效果需准确反映三维场景几何形态及相机运动轨迹。WorldSonus框架正是为解决上述需求而提出的交互式视频转音频方案。

流式架构与交互调度机制

在实时生成方面,WorldSonus采用流式因果自回归扩散架构,将音频切分为块进行合成,使其实时因子达到0.41,满足交互流的速度需求。在交互控制方面,该框架引入音频中心标注流程,并配合分块索引提示调度机制。这一设计允许用户在音频流生成过程中,动态地插入指令并改变后续的声音事件,打破了传统单向生成的限制。

空间对齐与泛化性能表现

为实现空间对齐的双声道输出,该框架利用从多种立体声及高阶立体声数据中筛选的高质量监督信号进行训练,确保生成的音频能精准映射场景几何与镜头移动。大量实验证明,尽管WorldSonus专为世界模型定制,其能力可有效泛化至开放域视频转音频基准测试。在声学质量与空间对齐两项关键指标上,它均达到甚至超越了当前最先进的双向模型。

为什么值得看

解决世界模型无声痛点,以0.41低延迟与中途交互控制实现空间音频,对沉浸式交互场景极具价值。

对齐基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源WorldSonus: Bringing Sound to Worlds

关键事实

  • WorldSonus采用流式因果自回归扩散架构,音频合成的实时因子低至0.41[1]

  • 该框架结合音频中心标注与分块索引提示调度,支持生成中途动态操控声音事件[1]

  • 利用立体声与高阶立体声数据提供高质量双耳监督,实现空间对齐的双声道输出[1]

  • 在开放域视频生音频基准测试中,声学质量与空间对齐效果匹敌或超越现有双向模型[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。