SWE-Gate基准测试揭示软件工程评估缺陷
工具AI 评分 75/100arXiv cs.AI
AI 摘要
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究人员推出SWE-Gate基准测试,评估软件工程代理在功能测试和代码审查约束合规性方面的表现。该基准基于303个真实仓库级修复案例,涵盖75个开源Python项目。实验显示,在644个通过功能测试的修复中,221个未能满足代码审查约束,表明仅评估功能性会高估代理的实际能力。
为什么值得看
揭示了当前AI代码评估基准的局限性,对软件工程AI代理开发有重要指导意义。
基准测试
信源1 家
关键事实
相关 · 工具
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
