探索能力评测集ExplorationBench发布,用异星世界防数据泄露
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
为解决AI科学探索评估中难以验证新假设及区分探索与预训练记忆的难题,ExplorationBench基于可验证的异星世界构建评测框架。其规则可执行以精确校验答案,且与常识相悖以杜绝单纯回忆。该基准含AlienCode与AlienLogic两个沙盒,分别设31和24个发现目标及各70项任务,提供残缺手册、环境反馈与工具调用规范。对10个系统的测试表明,最强模型能获取并运用陌生规则,但轨迹表现差异大,持续探索甚至会导致增益停滞或倒退。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载异星世界防记忆泄露
评估AI系统的科学探索能力面临两大挑战:一是难以验证真正新颖的假设是否成立,二是无法判定系统究竟是靠探索发现还是靠回忆预训练数据解题。ExplorationBench通过引入异星世界将此棘手问题转化为可处理的框架。这些世界的规则具备可执行性,确保每个答案都能被精确校验;同时其规则与既有常识相冲突,使得单纯依赖记忆召回无法完成任务,从而逼迫系统必须真正执行探索行为。
沙盒构成与任务设定
该基准包含AlienCode与AlienLogic两个沙盒环境。AlienCode设有31个发现目标与70项任务,AlienLogic包含24个发现目标与70项任务。各沙盒均向系统提供一份存在缺陷的手册、针对特定任务的环境反馈机制,以及专属的工具调用规范。参与测试的系统需要利用这些有限且带有误导性的资源去探索未知环境,进而解决未公开的保留任务。
系统评测表现与发现
研究团队对10个AI系统进行了评估。结果显示,表现最优的系统确实能够获取并应用不熟悉的规则来解决问题。然而,不同探索轨迹下的性能表现存在显著差异。更为关键的是,持续的探索过程并不总是带来正向收益,有时会导致进展停滞,甚至逆转先前已取得的成果,这揭示了当前AI系统在未知环境中维持稳定探索策略的局限性。
为什么值得看
解决AI探索评测中预训练数据泄露的痛点,提供可精确验证的陌生环境,真实衡量系统获取全新知识的能力。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
