cua-speedrun:评估计算机使用智能体速度的新基准
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对计算机使用智能体(CUA)在速度与成本评估上面临的可复现性危机,研究者提出cua-speedrun基准。该工具采用统一虚拟机设置、执行管线与通用智能体接口,使单智能体实现能跨基准无缝运行。对四个CUA基准的测试表明:无单一模型族在性能、速度与成本上均最优;开源权重模型均未达前沿;增加推理努力有时反能加快任务完成,而更快的输入输出有时却会拖慢总耗时。此外,多数CUA基准的评测任务集可在不降低统计效力的前提下有效缩减,从而提升评测效率。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载评测痛点与基准设计
计算机使用智能体(CUA)通过图形用户界面执行任务,虽在多项长周期基准上超越人类,但速度与成本阻碍了其广泛部署。当前CUA基准因依赖复杂基础设施及各异的机器与容器配置,导致执行速度评测陷入可复现性危机。为此,cua-speedrun基准引入了标准化的基础设施与任务集,采用统一虚拟机设置与执行管线,并配备通用智能体接口,使单一智能体实现能跨不同基准无缝运行,从而专注且可靠地评估CUA的速度与效率。
跨基准评测核心发现
研究在四个不同CUA基准上评估了推理努力、智能体框架与环境延迟对性能、速度及成本的影响。结果显示,没有单一模型族在这三方面同时达到最优,且所有开源权重模型均未处于前沿位置。此外,存在反直觉现象:对部分模型而言,增加推理努力反而加快了任务完成速度;而更快的输入输出却可能拖慢整体任务完成时间。这表明环境交互速度与智能体内部推理节奏的匹配度对最终耗时存在复杂影响。
评测效率提升与资源开放
研究还证实,多数CUA基准的评测任务集可以被有效缩减,且不会削弱整体的统计效力。这一发现允许更高效的基准测试与模型对比,大幅降低了评测资源消耗。该工作旨在推动向快速、高效CUA的结构化进展,以解锁新的现实用例与应用。相关代码、基础设施及分析均已公开。
为什么值得看
解决CUA速度评测不可复现痛点,揭示推理努力与环境延迟对耗时反直觉影响,助力高效智能体研发。
智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
