研究提出BOTTLED基准,评估LLM将能力转化为低成本方案的效率
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载低成本方案生成评估基准
当面临数百万相关实例的大规模重复工作负载时,直接逐一调用大语言模型会产生极高昂的费用。为解决此问题,研究者提出了“装瓶”这一概念,即智能体将自身通用能力转化为特定任务解决方案的能力,要求在回答质量与摊销成本之间取得平衡。基于此,研究引入了BOTTLED基准,在该测试中,智能体会接收完整的无标签工作负载,并在限定的时间、计算资源及LLM API预算内完成。智能体需自主选择实现路径,例如训练小型模型或编写可复用程序。
零样本性能与降本能力错位
对十个模型及三项任务的评估揭示了一个关键现象:强大的零样本任务表现并不能可靠地转化为强大的“装瓶”能力。具备相近零样本得分的模型,在“装瓶”后的表现可能存在巨大差异。具体数据显示,在60次“装瓶”运行中,有48次的得分低于该模型自身零样本性能95%置信区间的下限。此外,有31次运行的表现不及同等token预算下两个小模型蒸馏基线中较强的那个,表明直接转化能力面临显著挑战。
特定任务下的成本大幅节约
尽管整体转化表现存在挫折,但“装瓶”在特定场景下仍能带来可观的成本节约。在查询与产品相关性分类任务中,Opus 5保留了约82%的零样本宏F1,同时将报告成本大幅降低至原来的约1/657。此外,与专为廉价重复推理构建的“系统一”模型Jev相比,Opus 5在同一任务上恢复了Jev约94%的宏F1,而其预计的全工作负载成本仅为Jev的四分之一。这表明BOTTLED基准为评估和改进智能体在处理大规模重复工作负载时投资有限资源以构建可复用方案的能力奠定了基础。
为什么值得看
揭示LLM零样本能力与自主降本增效能力的错位,为评估智能体处理大规模重复工作负载的实用化水平提供新基准。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
