TasteVal基准测试发布,Opus 5.5实验品味超人类专家
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载实验品味量化定义
TasteVal基准由Oliver Jaffe与Dane Sherburn提出,旨在评估前沿AI系统的实验研究品味。研究品味被定义为挑选有趣问题、设计实验及解读结果的能力。该基准聚焦实验环节,在给定固定研究问题的前提下,衡量模型迭代设计实验并从结果中得出结论的水平。为将品味与编码能力剥离,评估中模型仅作为研究员角色负责设计实验,由固定的编码代理执行并反馈结果。实验品味被操作化定义为计算效率:若研究员以一半的串行实验计算量达到与人类专家相同的分数,则其品味为两倍,这使得品味成为实验计算上的乘数。
测试设置与人类基线
该基准包含8项具有挑战性的开放式任务,代表前沿AI研发工作。为防止数据污染,这些任务不予公开。每次评估运行直至耗尽40个H100小时或120个挂钟小时的预算。研究招募了24名人类专家,每项任务至少2人参与,并以每项任务上最佳专家尝试作为人类基线。研究评估了2023至2026年间发布的20个模型。表现最优的Opus 5.5超越了人类专家基线,其计算倍数为2.3倍(95%置信区间1.15至4.37),且单次运行成本大约仅为基线人类专家平均成本的三十分之一。
模型品味增速远超性能
评估揭示了模型能力演进的重要趋势。在TasteVal基准上,前沿模型的计算倍数自2025年12月起倍增时间约为3.0个月(95%置信区间1.7至5.0个月),显著快于2023年至2025年12月期间的14个月倍增周期。然而,若以最终归一化性能衡量,前沿模型并未显示出趋势突破,倍增周期仍为14.6个月。这表明模型在实验研究品味上的提升速度近期急剧加快,远超其在最终性能得分上的提升速度,品味作为计算乘数对预测AI进展具有关键输入价值。
为什么值得看
提出将研究品味量化为计算倍数的新范式,且发现模型实验品味增速远超性能增速,Opus 5.5已超越人类专家。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
