AI 圈大事记

SWE-Flux基准测试揭示大模型运行时推理能力薄弱

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究团队推出SWE-Flux基准,专测大模型对代码动态执行行为的推理能力。该基准含480个实例,源自12个真实Python仓库,标准答案经插桩测试自动获取,免人工编写与大模型评判。五款大模型评估表现不佳,最高准确率仅37%。模型在局部控制流与异常等较易,但在数据流、跨过程执行及状态推理上困难重重。此外,其流水线可通过输入扰动生成新变体,近90%实例成功产出有效变体,且让模型面临更大挑战。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

动态执行推理基准构建

当前仓库级问答基准多聚焦静态理解且依赖大模型评判,执行推理基准又常局限于代码片段。为填补空白,SWE-Flux基准被提出以评估大模型对代码运行时行为的推理能力。该基准涵盖480个实例,源自12个真实Python项目。其核心优势在于标准答案的获取方式:通过插桩测试执行自动收集黄金答案,彻底规避了人工编写或大模型主观评判带来的偏差与成本。问题类型覆盖单测试与多测试场景,涉及控制流、循环、程序状态、数据流、异常及程序不变量等维度。

大模型推理能力短板剖析

对五款大模型的评估揭示该任务极具挑战性,最高准确率仅达37%。细分来看,模型在局部化行为推理上表现尚可,如程序不变量、过程内控制流、异常及简单循环。然而,一旦涉及更复杂的全局与动态行为,模型能力便急剧下降。它们在处理数据流、跨过程执行、精确的程序状态推理以及测试套件级别的聚合问题上显得力不从心,表明现有大模型在深层代码执行逻辑理解上存在显著缺陷。

输入扰动生成高难变体

研究还展示了该基准的动态扩展能力。其流水线可利用输入扰动机制生成全新的基准变体。实验表明,该机制能为近90%的选定实例成功产出有效变体。更重要的是,这些新生成的变体对受测大模型构成了更严峻的挑战,模型在其上的表现显著下滑。这一特性不仅证明了基准流水线的有效性,也为防止模型刷题、持续生成高难度评测集提供了可行路径。

为什么值得看

直击大模型写代码却不理解执行行为的痛点,提供自动化、抗刷题的代码推理评测新范式。

大模型基准测试

信源1

  1. [1]arXiv cs.AI一手信源Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

关键事实

  • SWE-Flux基准包含480个执行推理实例,覆盖12个真实Python仓库[1]

  • 基准标准答案通过插桩测试自动收集,非人工编写或大模型评判[1]

  • 五款大模型在该基准上最高准确率仅为37%[1]

  • 模型在数据流、跨过程执行及精确状态推理上表现挣扎[1]

  • 通过输入扰动生成的基准变体使评测难度显著增加,近90%实例可产出有效变体[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。