WorldAuditBench发布:评估多模态智能体3D世界异常审查能力
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究团队提出WorldAuditBench基准,用于测试多模态智能体在交互式3D环境中寻找异常(如穿模墙体、悬浮物体)的能力。该基准包含基于虚幻引擎5等构建的13个环境、5类异常族共213个任务。测试了5个前沿模型在固定探索预算下的两种审查范式:VLA探索加VLM识别,以及端到端VLM直接指导行动。模型成功率仅6.6%至42.3%,远低于人类的83.4%,凸显当前智能体在行动与视觉推理耦合及证据收集上的严重不足。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载3D世界异常审查挑战
随着交互式3D世界被广泛用于智能行为研究,高效识别模拟环境中的异常变得至关重要。常见异常包括悬浮物体、可穿越的墙体或与周围场景不一致的物体。多模态AI系统(含视觉语言模型VLM和视觉语言行动模型VLA)在自动化此任务上具有潜力,但3D世界审查极具复杂性,要求紧密耦合两种能力:行动能力用于系统高效导航搜索,视觉推理能力用于理解环境并从多模态观察中识别异常。当前多模态智能体能否有效耦合这两种能力仍属未知。
基准构建与评估范式
为探究上述问题,研究者构建了WorldAuditBench基准。该基准涵盖213个异常任务,分布于基于虚幻引擎5构建的13个环境中,覆盖5个异常族。评估采用固定探索预算,测试了5个前沿模型在两种审查范式下的表现:一是基于VLA的探索后接VLM的异常识别;二是端到端VLM智能体,由视觉推理直接指导行动选择。
模型表现与人类差距
评估结果显示,在所有受测模型与两种审查范式中,任务成功率介于6.6%至42.3%之间,大幅落后于人类83.4%的表现。该基准不仅为研究多模态智能体如何在交互式3D环境中耦合行动与视觉推理提供了测试床,也凸显了现有模型在探索过程中收集和解释证据能力的显著局限。
为什么值得看
揭示当前多模态智能体在3D环境中行动与视觉推理协同的短板,为后续提升空间推理与交互能力提供明确测试床。
多模态智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
