VISTA视觉框架让Claude Opus 5.0在ARC-AGI-3达满分

论文AI 评分 88/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

VISTA为通用多模态模型赋予长程视觉能力,通过无损保留历史观测并允许模型主动检索重组视觉输入来解锁推理潜力。在ARC-AGI-3测试中,该框架将Claude Opus 5.0的相对人类动作效率得分从40.68提升至100.00,以比人类初试者少57.4%的动作完成全部25个公开游戏。在另三个涵盖视觉游戏与谜题的基准测试中,其同样大幅超越使用相同底层模型的最小框架基线。该设计可自然扩展至多种视觉环境。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

核心机制与视觉记忆

VISTA旨在为通用多模态模型赋予长程视觉能力,使其能在多样交互环境中解决任务。其核心机制在于让模型直接通过视觉观测感知环境,同时维持无损的视觉记忆,将过往观测以其原始形态完整保留。在推理过程中,模型能够主动检索这些历史观测,并对视觉输入进行重新组织,从而解锁多模态模型在复杂场景下的推理潜力。

ARC-AGI-3基准表现

在ARC-AGI-3基准测试中,VISTA显著提升了Claude Opus 5.0的表现。该框架将模型的相对人类动作效率得分从原先的40.68直接拉升至完美的100.00。在全部25个公开游戏中,搭载VISTA的模型不仅完成了所有任务,且其使用的动作数量比首次参与的人类受试者减少了57.4%,展现出极高的交互效率与任务解决能力。

跨环境泛化与对比

VISTA的简洁设计使其能够以极少的适应性调整,自然扩展至多样的视觉环境中。在涵盖多种视觉游戏与谜题的另外三个基准测试中,VISTA大幅超越了基线方法。这些基线使用了相同的底层模型,但仅配备了最小化的框架。这一对比结果凸显了VISTA作为一种通用视觉框架,在推进多模态智能体于复杂视觉环境中发展的巨大潜力。

为什么值得看

以极简设计实现无损视觉记忆与主动检索,显著提升多模态模型在复杂交互环境中的长程推理与动作效率。

Claude多模态基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源VISTA: A Visual Harness for Reasoning in an Interactive World

关键事实

  • VISTA为通用多模态模型提供长程视觉能力,维持无损视觉记忆并允许主动检索重组。[1]

  • 在ARC-AGI-3上,VISTA将Claude Opus 5.0的相对人类动作效率得分从40.68提升至100.00。[1]

  • 模型在ARC-AGI-3的25个公开游戏中,使用动作数比首次参与的人类少57.4%。[1]

  • 在另外三个视觉游戏与谜题基准上,VISTA大幅超越采用相同底层模型的最小框架基线。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。