研究发布 VLoc Bench 基准测试代码库漏洞定位能力
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准测试构建细节
VLoc Bench 旨在评估智能体在完整软件仓库中定位漏洞代码的能力,而非仅仅检测或修复漏洞。该数据集包含 500 个真实世界的漏洞案例,取自 290 个不同的代码仓库,横跨 6 个包生态系统,并涵盖了 147 个不同的 CWE(通用弱点枚举)类别。每个测试任务都配对了安全修复前后的代码库快照。在存在漏洞的快照上,智能体仅接收漏洞类别的 CWE 描述和只读终端访问权限,目标是返回受影响的文件;而在已修复的快照上,智能体需要判断记录的漏洞是否已不复存在。
模型评估表现
研究在统一的智能体接口下,对 27 个语言模型和 4 个静态分析工具进行了评估。结果显示,在代码库规模的漏洞定位任务上,现有系统仍面临巨大挑战。表现最强的系统仅达到了 0.229 的文件 F1 值。此外,在所有测试任务中,有 38.4% 的任务没有任何一个被评估的模型能够给出正确的定位结果。这表明当前模型在陌生的大型代码库中精确查找安全缺陷代码的能力依然有限。
定位与修复的偏差
研究进一步揭示了漏洞定位能力与修复后行为之间的不一致性。虽然某些系统能够有效地识别出存在漏洞的文件,但在面对已经应用了补丁的代码库快照时,这些系统仍然可能报告不存在的漏洞位置,即产生误报。这一发现说明,仅仅具备在脆弱代码中定位问题的能力,并不保证系统在漏洞被修复后能够可靠地停止报告。这确立了漏洞定位作为一种独特的代码库级能力,为研究安全智能体如何搜索漏洞代码以及何时应避免报告提供了新的实验环境。
为什么值得看
首个针对代码库级漏洞定位的大规模基准,揭示了当前智能体在安全分析中的实际短板。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
