TasteVal基准测试发布,Opus 5.5实验品味超人类专家

论文AI 评分 85/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Oliver Jaffe等人提出TasteVal基准,用于评估前沿模型在固定问题下迭代设计实验与解读结果的“实验研究品味”。该基准将品味量化为计算效率倍数:若模型以一半串行计算达到专家同等分数,则品味为2倍。测试包含8项不公开任务,模型作为研究员设计实验,固定编码代理执行,受40个H100小时或120小时挂钟时间预算限制,与24名人类专家对比。Opus 5.5以2.3倍计算倍数超越专家基线,单次运行成本约为专家三十分之一。自2025年12月起,前沿模型品味倍增期缩至约3个月,远快于此前14个月;而归一化性能倍增期仍为14.6个月。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

实验品味量化定义

TasteVal基准由Oliver Jaffe与Dane Sherburn提出,旨在评估前沿AI系统的实验研究品味。研究品味被定义为挑选有趣问题、设计实验及解读结果的能力。该基准聚焦实验环节,在给定固定研究问题的前提下,衡量模型迭代设计实验并从结果中得出结论的水平。为将品味与编码能力剥离,评估中模型仅作为研究员角色负责设计实验,由固定的编码代理执行并反馈结果。实验品味被操作化定义为计算效率:若研究员以一半的串行实验计算量达到与人类专家相同的分数,则其品味为两倍,这使得品味成为实验计算上的乘数。

测试设置与人类基线

该基准包含8项具有挑战性的开放式任务,代表前沿AI研发工作。为防止数据污染,这些任务不予公开。每次评估运行直至耗尽40个H100小时或120个挂钟小时的预算。研究招募了24名人类专家,每项任务至少2人参与,并以每项任务上最佳专家尝试作为人类基线。研究评估了2023至2026年间发布的20个模型。表现最优的Opus 5.5超越了人类专家基线,其计算倍数为2.3倍(95%置信区间1.15至4.37),且单次运行成本大约仅为基线人类专家平均成本的三十分之一。

模型品味增速远超性能

评估揭示了模型能力演进的重要趋势。在TasteVal基准上,前沿模型的计算倍数自2025年12月起倍增时间约为3.0个月(95%置信区间1.7至5.0个月),显著快于2023年至2025年12月期间的14个月倍增周期。然而,若以最终归一化性能衡量,前沿模型并未显示出趋势突破,倍增周期仍为14.6个月。这表明模型在实验研究品味上的提升速度近期急剧加快,远超其在最终性能得分上的提升速度,品味作为计算乘数对预测AI进展具有关键输入价值。

为什么值得看

提出将研究品味量化为计算倍数的新范式,且发现模型实验品味增速远超性能增速,Opus 5.5已超越人类专家。

量化基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts

关键事实

  • TasteVal将实验研究品味量化为计算效率倍数,若以一半串行计算达同等分数则品味为2倍[1]

  • Opus 5.5在TasteVal上以2.3倍计算倍数超越人类专家基线,成本约为专家三十分之一[1]

  • 自2025年12月起前沿模型品味倍增期约3个月,此前为14个月,归一化性能倍增期仍为14.6个月[1]

  • 基准含8项不公开任务,模型作研究员设计实验,固定编码代理执行,预算为40个H100小时或120小时[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。