ARC Prize Foundation 发布第二代抽象推理基准 ARC-AG…
论文AI 评分 92/100Epoch AI:研究、数据与评测待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT
ARC Prize Foundation 推出 ARC-AGI-2 基准,含 1360 项网格任务,要求系统从输入输出示例推断变换规则并应用于新测试,允许两次尝试。该基准移除了易受暴力搜索破解的旧任务,新增针对符号解释、组合推理及上下文规则应用等当前系统弱项的考题,并强调计算效率。超 400 人受控测试显示人类平均得分 60%,而发布时纯大语言模型得分为 0%,前沿推理系统仅获个位数百分比。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载任务构成与评测机制
ARC-AGI-2 延续前代基于网格的输入输出演示形式,要求参与系统推断底层变换规则并将其应用于全新测试输入,每个测试用例允许两次尝试机会。整个基准涵盖 1360 项任务,包含 1000 项训练任务与 360 项评测任务。评测任务被均匀划分为公开、半私有与私有三个子集,每个子集各含 120 项任务。此外,新基准在评测中额外强调解决单个任务所需的计算效率。
难度提升与核心挑战
为显著提升对 AI 系统的难度同时保持对人类的友好度,ARC-AGI-2 剔除了初代基准中易受暴力程序搜索破解的任务。新增任务专门瞄准当前 AI 系统的主要缺陷,包括符号解释、组合推理以及上下文规则应用。当前系统在这些领域难以超越表层视觉模式赋予意义,或同时应用多个相互作用的规则,这正是新基准设置高门槛的核心所在。
人机表现差异悬殊
受控人类测试有超 400 名参与者加入,结果证实所有评测任务均至少有两人能在两次尝试内完成解答,人类平均得分达到 60%。然而在基准发布之际,纯大语言模型的得分为 0%,即便是当前最先进的前沿推理系统也仅能取得个位数百分比的得分。这一巨大落差直观反映了现有 AI 在抽象推理与模式泛化能力上与人类的显著差距。
为什么值得看
新基准专攻当前 AI 符号与组合推理软肋,人类轻松及格而顶尖 AI 几近零分,凸显通用推理短板。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
