DAYJOB基准发布:测试长周期专业工作,最强模型通过率不足25%

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

DAYJOB基准包含130项由医疗与金融专家构建的长周期任务,单任务平均耗时超13小时。评估采用容器化环境与二项标准专家量规,须全满足才算通过。在30种模型配置测试中,表现最佳的Claude Opus 5.5在医疗与金融任务的通过率分别为24.7%和23.9%,中位数配置通过率仅0.6%和2.5%。案例显示智能体常盲从错误前提或传递错误输入。医疗全量及50项金融任务、评估工具与排行榜已公开。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准设计与任务特征

DAYJOB聚焦于从简短请求出发的长周期专业工作,要求智能体自行判断需求、筛选相关文档并验证请求前提。该基准共涵盖130项任务,其中医疗领域50项,金融领域80项。据估算,人类专业人员在医疗任务上平均需耗费13.6小时,金融任务则需16.6小时。每项任务均配备容器化的Harbor环境,并附带由专家制定的二项评判标准,医疗与金融任务的单项标准中位数分别为47.5和57.5。评估时,智能体交付的文件须由智能评判程序逐项检验,唯有全部达标方视为通过。

模型测试与通过率表现

研究对来自13个开发者的30种模型配置进行了评测。结果显示,当前最强配置Claude Opus 5.5在医疗任务的通过率为24.7%,金融任务为23.9%。而处于中位水平的模型配置表现极差,医疗任务通过率仅0.6%,金融任务为2.5%。这表明现有智能体在处理耗时久、标准严苛的真实业务时,整体执行力依然非常薄弱,绝大多数配置几乎无法完成完整交付。

典型缺陷与开源情况

案例研究揭示了智能体在执行过程中的两类典型缺陷:一是盲目接受与既有记录相矛盾的错误前提;二是将错误的输入数据一路传递至后续分析中,导致尽管分析逻辑自洽但结论无效。为推动相关研究,团队已公开全部50项医疗任务、80项金融任务中的50项,同时放出了评估工具套件与排行榜。该论文早期版本已被NeurIPS 2026的第二届企业任务智能体AI基准与应用研讨会接收。

为什么值得看

揭示当前顶尖智能体在真实长周期专业工作上的严重不足,为评估与改进复杂业务执行力提供高标准测试集。

Claude智能体

信源1 家

  1. [1]arXiv cs.AI一手信源DAYJOB: A Benchmark for Long-Horizon Professional Work

关键事实

  • DAYJOB基准包含130项任务,其中医疗50项、金融80项,由专业人士构建[1]

  • 单任务平均耗时医疗约13.6小时,金融约16.6小时[1]

  • Claude Opus 5.5在医疗和金融任务通过率分别为24.7%和23.9%,为30种配置中最强[1]

  • 中位数模型配置在医疗和金融任务通过率仅0.6%和2.5%[1]

  • 已公开全部医疗任务、50项金融任务、评估工具及排行榜[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。