WorldAuditBench发布:评估多模态智能体3D世界异常审查能力

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究团队提出WorldAuditBench基准,用于测试多模态智能体在交互式3D环境中寻找异常(如穿模墙体、悬浮物体)的能力。该基准包含基于虚幻引擎5等构建的13个环境、5类异常族共213个任务。测试了5个前沿模型在固定探索预算下的两种审查范式:VLA探索加VLM识别,以及端到端VLM直接指导行动。模型成功率仅6.6%至42.3%,远低于人类的83.4%,凸显当前智能体在行动与视觉推理耦合及证据收集上的严重不足。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

3D世界异常审查挑战

随着交互式3D世界被广泛用于智能行为研究,高效识别模拟环境中的异常变得至关重要。常见异常包括悬浮物体、可穿越的墙体或与周围场景不一致的物体。多模态AI系统(含视觉语言模型VLM和视觉语言行动模型VLA)在自动化此任务上具有潜力,但3D世界审查极具复杂性,要求紧密耦合两种能力:行动能力用于系统高效导航搜索,视觉推理能力用于理解环境并从多模态观察中识别异常。当前多模态智能体能否有效耦合这两种能力仍属未知。

基准构建与评估范式

为探究上述问题,研究者构建了WorldAuditBench基准。该基准涵盖213个异常任务,分布于基于虚幻引擎5构建的13个环境中,覆盖5个异常族。评估采用固定探索预算,测试了5个前沿模型在两种审查范式下的表现:一是基于VLA的探索后接VLM的异常识别;二是端到端VLM智能体,由视觉推理直接指导行动选择。

模型表现与人类差距

评估结果显示,在所有受测模型与两种审查范式中,任务成功率介于6.6%至42.3%之间,大幅落后于人类83.4%的表现。该基准不仅为研究多模态智能体如何在交互式3D环境中耦合行动与视觉推理提供了测试床,也凸显了现有模型在探索过程中收集和解释证据能力的显著局限。

为什么值得看

揭示当前多模态智能体在3D环境中行动与视觉推理协同的短板,为后续提升空间推理与交互能力提供明确测试床。

多模态智能体

信源1 家

  1. [1]arXiv cs.AI一手信源WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

关键事实

  • WorldAuditBench包含213个异常审查任务,跨越13个环境和5个异常族[1]

  • 测试环境基于虚幻引擎5构建[1]

  • 前沿多模态模型在基准上的成功率为6.6%到42.3%[1]

  • 人类在相同任务上的成功率为83.4%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。