AI 圈大事记

研究发布 VLoc Bench 基准测试代码库漏洞定位能力

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

新基准 VLoc Bench 包含 500 个真实漏洞,覆盖 6 个包生态系统和 147 个 CWE 类别。任务要求智能体在给定漏洞类型描述和只读终端访问权限下,定位代码库中的受影响文件。评估显示,最强系统的文件 F1 值仅为 0.229,38.4% 的任务没有任何模型能正确定位。研究还发现,定位能力强的系统在修复后的代码库中仍可能错误报告漏洞位置。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准测试构建细节

VLoc Bench 旨在评估智能体在完整软件仓库中定位漏洞代码的能力,而非仅仅检测或修复漏洞。该数据集包含 500 个真实世界的漏洞案例,取自 290 个不同的代码仓库,横跨 6 个包生态系统,并涵盖了 147 个不同的 CWE(通用弱点枚举)类别。每个测试任务都配对了安全修复前后的代码库快照。在存在漏洞的快照上,智能体仅接收漏洞类别的 CWE 描述和只读终端访问权限,目标是返回受影响的文件;而在已修复的快照上,智能体需要判断记录的漏洞是否已不复存在。

模型评估表现

研究在统一的智能体接口下,对 27 个语言模型和 4 个静态分析工具进行了评估。结果显示,在代码库规模的漏洞定位任务上,现有系统仍面临巨大挑战。表现最强的系统仅达到了 0.229 的文件 F1 值。此外,在所有测试任务中,有 38.4% 的任务没有任何一个被评估的模型能够给出正确的定位结果。这表明当前模型在陌生的大型代码库中精确查找安全缺陷代码的能力依然有限。

定位与修复的偏差

研究进一步揭示了漏洞定位能力与修复后行为之间的不一致性。虽然某些系统能够有效地识别出存在漏洞的文件,但在面对已经应用了补丁的代码库快照时,这些系统仍然可能报告不存在的漏洞位置,即产生误报。这一发现说明,仅仅具备在脆弱代码中定位问题的能力,并不保证系统在漏洞被修复后能够可靠地停止报告。这确立了漏洞定位作为一种独特的代码库级能力,为研究安全智能体如何搜索漏洞代码以及何时应避免报告提供了新的实验环境。

为什么值得看

首个针对代码库级漏洞定位的大规模基准,揭示了当前智能体在安全分析中的实际短板。

智能体基准测试

信源1

  1. [1]arXiv cs.AI一手信源Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale

关键事实

  • VLoc Bench 包含 500 个真实漏洞,源自 290 个代码库,覆盖 6 个包生态系统和 147 个 CWE 类别。[1]

  • 评估了 27 个语言模型和 4 个静态分析工具,最强系统文件 F1 值为 0.229。[1]

  • 38.4% 的任务没有任何评估模型能提供正确的定位结果。[1]

  • 系统在修复后的代码库上仍可能错误报告漏洞位置,表明定位能力不等于修复后的可靠性。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。