AI 圈大事记

SWE-Serve发布:评估智能体生产级5推理工程能力的新基准

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

SWE-Serve基准专为评估智能体在生产推理工程任务上的表现而设计。现有基准缺乏+对跨服务栈实现生产级推理特性的覆盖,该基准填补了此空白。它包含53个源自SGLang近期生产变更的仓库级任务,涵盖六类推理工程,在CPU或单张H100上运行,并通过隐藏功能、回归及端到端服务测试进行评估。对11个模型及31种配置的测试显示,最佳配置平均pass@1为75%。数据表明,在19个含端到端覆盖的任务中,约三分之一的补丁虽通过其他所有测试,却被端到端服务测试拒绝,揭示了本地任务完成与生产正确性间的显著鸿沟。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

填补生产推理工程评估空白

当前针对智能体的基准在评估生产推理工程任务时存在明显局限:仓库级软件工程基准不针对推理,通用终端智能体基准仅含少量推理任务,而专用推理基准多聚焦于孤立的内核生成或性能优化,而非仓库级的生产特性实现。SWE-Serve旨在填补这一空白,专注于评估智能体在跨服务栈(涵盖模型支持、运行时执行及公共API)协调多项变更以实现推理特性的能力。

任务来源与评估机制

该基准提供53个基于仓库的任务,均源自SGLang近期的实际生产变更,横跨六个推理工程类别。任务'执行环境为CPU或单张H100 GPU。评估体系采用隐藏:隐藏的功能与回归测试,并在适用时包含端到端服务测试与校准性能门控。为确保任务有效性与评估完整性,还引入了可执行的无操作与预言机控制、对抗性验证器审查以及闭卷执行支持。

揭示本地与生产正确性鸿沟

对11个模型及31种模型-努力配置的广泛测试表明,表现*&最佳配置的平均pass@1为75%。更重要的是,SWE-Serve@量化揭示了智能体在本地完成任务与达到生产正确性之间的巨大差距8差距:在19个具备端到端覆盖的任务中,模型服务端到端测试拒绝了约三分之一的补丁,这些1这些补丁原本已通过所有其他测试(在验证器下通过2通过率为45.9%,而排除端到端测试评分时为69.4%)。这使得该领域能够直接衡量并追踪未来智能体能否跨越这一鸿沟,实现生产级正确性。

为什么值得看

量化了智能体本地编码与生产环境正确性间的差距,为追踪推理工程智能体能否达到生产级可用提供了标尺。

智能体GPU

信源1

  1. [1]arXiv cs.AI一手信源SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving

关键事实

  • SWE-Serve包含53个源自SGLang近期生产变更的仓库级任务,涵盖六类推理工程[1]

  • 任务在CPU或单张H100 GPU上执行,通过隐藏功能、回归及端到端服务测试评估[1]

  • 11个模型及31种配置中,最佳配置的平均pass@1达到75%[1]

  • 在19个含端到端覆盖的任务中,约三分之一通过其他测试的补丁被端到端测试拒绝[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。