研究提出BOTTLED基准,评估LLM将能力转化为低成本方案的效率

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大规模重复任务直接调用LLM成本过高的问题,研究提出“装瓶”概念与BOTTLED基准,评估智能体在固定时间、算力及API预算下,自主生成如小模型或可复用程序等低成本方案的能力。测试10个模型与3项任务发现,零样本表现好不代表“装瓶”能力强,60次运行中48次低于原模型零样本95%置信下限,31次不及同等预算的小模型蒸馏基线。但在分类任务上,Opus 5保留约82%的宏F1且成本降至1/657,并恢复专用廉价模型Jev约94%的宏F1,而成本仅为其1/4。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

低成本方案生成评估基准

当面临数百万相关实例的大规模重复工作负载时,直接逐一调用大语言模型会产生极高昂的费用。为解决此问题,研究者提出了“装瓶”这一概念,即智能体将自身通用能力转化为特定任务解决方案的能力,要求在回答质量与摊销成本之间取得平衡。基于此,研究引入了BOTTLED基准,在该测试中,智能体会接收完整的无标签工作负载,并在限定的时间、计算资源及LLM API预算内完成。智能体需自主选择实现路径,例如训练小型模型或编写可复用程序。

零样本性能与降本能力错位

对十个模型及三项任务的评估揭示了一个关键现象:强大的零样本任务表现并不能可靠地转化为强大的“装瓶”能力。具备相近零样本得分的模型,在“装瓶”后的表现可能存在巨大差异。具体数据显示,在60次“装瓶”运行中,有48次的得分低于该模型自身零样本性能95%置信区间的下限。此外,有31次运行的表现不及同等token预算下两个小模型蒸馏基线中较强的那个,表明直接转化能力面临显著挑战。

特定任务下的成本大幅节约

尽管整体转化表现存在挫折,但“装瓶”在特定场景下仍能带来可观的成本节约。在查询与产品相关性分类任务中,Opus 5保留了约82%的零样本宏F1,同时将报告成本大幅降低至原来的约1/657。此外,与专为廉价重复推理构建的“系统一”模型Jev相比,Opus 5在同一任务上恢复了Jev约94%的宏F1,而其预计的全工作负载成本仅为Jev的四分之一。这表明BOTTLED基准为评估和改进智能体在处理大规模重复工作负载时投资有限资源以构建可复用方案的能力奠定了基础。

为什么值得看

揭示LLM零样本能力与自主降本增效能力的错位,为评估智能体处理大规模重复工作负载的实用化水平提供新基准。

推理模型智能体蒸馏算力API

信源1 家

  1. [1]arXiv cs.AI一手信源Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?

关键事实

  • 研究提出BOTTLED基准,评估LLM智能体在固定预算下将通用能力转化为低成本特定任务方案(“装瓶”)的能力。[1]

  • 在60次“装瓶”运行中,48次低于原模型零样本性能的95%置信下限,31次不及同等token预算的小模型蒸馏基线。[1]

  • 在查询-产品相关性分类任务中,Opus 5保留约82%的零样本宏F1,成本降至约1/657。[1]

  • Opus 5在同一任务上恢复专用廉价推理模型Jev约94%的宏F1,而预计全负载成本仅为Jev的1/4。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。