ARC Prize Foundation 发布第二代抽象推理基准 ARC-AG…

论文AI 评分 92/100Epoch AI:研究、数据与评测待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

ARC Prize Foundation 推出 ARC-AGI-2 基准,含 1360 项网格任务,要求系统从输入输出示例推断变换规则并应用于新测试,允许两次尝试。该基准移除了易受暴力搜索破解的旧任务,新增针对符号解释、组合推理及上下文规则应用等当前系统弱项的考题,并强调计算效率。超 400 人受控测试显示人类平均得分 60%,而发布时纯大语言模型得分为 0%,前沿推理系统仅获个位数百分比。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

任务构成与评测机制

ARC-AGI-2 延续前代基于网格的输入输出演示形式,要求参与系统推断底层变换规则并将其应用于全新测试输入,每个测试用例允许两次尝试机会。整个基准涵盖 1360 项任务,包含 1000 项训练任务与 360 项评测任务。评测任务被均匀划分为公开、半私有与私有三个子集,每个子集各含 120 项任务。此外,新基准在评测中额外强调解决单个任务所需的计算效率。

难度提升与核心挑战

为显著提升对 AI 系统的难度同时保持对人类的友好度,ARC-AGI-2 剔除了初代基准中易受暴力程序搜索破解的任务。新增任务专门瞄准当前 AI 系统的主要缺陷,包括符号解释、组合推理以及上下文规则应用。当前系统在这些领域难以超越表层视觉模式赋予意义,或同时应用多个相互作用的规则,这正是新基准设置高门槛的核心所在。

人机表现差异悬殊

受控人类测试有超 400 名参与者加入,结果证实所有评测任务均至少有两人能在两次尝试内完成解答,人类平均得分达到 60%。然而在基准发布之际,纯大语言模型的得分为 0%,即便是当前最先进的前沿推理系统也仅能取得个位数百分比的得分。这一巨大落差直观反映了现有 AI 在抽象推理与模式泛化能力上与人类的显著差距。

为什么值得看

新基准专攻当前 AI 符号与组合推理软肋,人类轻松及格而顶尖 AI 几近零分,凸显通用推理短板。

信源1 家

  1. [1]Epoch AI:研究、数据与评测线索来自 AIHOTARC Prize Foundation 推出第二代抽象推理基准 ARC-AGI-2

关键事实

  • ARC-AGI-2 包含 1360 项任务,其中 1000 项训练任务与 360 项评测任务,评测分为公开、半私有和私有各 120 项。[1]

  • 该基准移除了易被暴力程序搜索破解的任务,新增针对符号解释、组合推理和上下文规则应用弱项的考题。[1]

  • 超 400 人参与受控测试,人类平均得分 60%,每项评测任务至少有两人能在两次尝试内解出。[1]

  • 发布时纯大语言模型得分 0%,前沿推理系统仅获个位数百分比得分。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。