卡内基梅隆大学发布ExploitBench v0.1评测

论文AI 评分 72/100Epoch AI:研究、数据与评测待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

卡内基梅隆大学研究者推出ExploitBench v0.1,专测大语言模型智能体利用真实软件漏洞的渐进能力。该基准包含41个2024年及以后报告的Chromium V8引擎N-day漏洞,在开启堆沙箱等缓解措施的默认构建上测试。漏洞利用过程被拆解为16个确定性评分标志,分属从触及漏洞代码(T5)到控制流劫持与代码执行(T1)的五个层级,采用统一轮次预算与确定性神谕打分,依据公开排行榜的平均标志点亮率衡量智能体表现。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

阶梯式漏洞利用评估

传统安全评测常以二元成败定论,而ExploitBench v0.1引入能力阶梯概念,细致衡量智能体在漏洞利用各阶段的进展。该过程被分解为16个确定性评分标志,并归入五个层级:T5代表覆盖漏洞代码,T4代表触发崩溃,T3代表构建利用原语,T2与T1则分别对应更高级的控制流劫持与任意代码执行。这种渐进式打分能清晰暴露模型在攻防链条上的具体瓶颈。

测试对象与加固环境

当前基准聚焦Chromium V8 JavaScript与WebAssembly引擎,收录41个已在2024年及以后报告的N-day漏洞(即已有补丁的缺陷)。评测并未在裸奔环境中进行,而是针对开启了堆沙箱、ASLR及栈金丝雀等缓解机制的默认发布构建,这更贴近真实生产环境的安全防线,对智能体的利用能力提出了更高要求。

评测机制与指标计算

智能体在测试时受限于统一的交互轮次预算,且每个漏洞会使用多个随机种子运行。评分采用确定性神谕完成,排除了主观偏差。最终成绩源自公开排行榜的平均能力指标,即智能体在多个种子下点亮标志的平均比例,底层亦提供0至16分的平均标志计数供深入查阅。

为什么值得看

提供细粒度阶梯式评估,量化大模型在真实且加固环境下的漏洞利用深度,而非仅看成败。

智能体

信源1 家

  1. [1]Epoch AI:研究、数据与评测线索来自 AIHOTExploitBench v0.1:评估 LLM 智能体利用真实软件漏洞的渐进能力

关键事实

  • ExploitBench v0.1由卡内基梅隆大学研究者创建,评估大语言模型智能体利用真实软件漏洞的渐进能力[1]

  • 基准包含41个2024年及以后报告的Chromium V8引擎N-day漏洞[1]

  • 漏洞利用过程被拆解为16个确定性评分标志,分属从T5到T1的五个层级[1]

  • 测试在开启堆沙箱、ASLR和栈金丝雀等缓解措施的默认发布构建上进行[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。