RETRACE框架从PR历史提取可复用CI修复经验,显著提升LLM修复率
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载历史修复经验对齐难题
大语言模型代理在修复软件问题时倾向于复用过往经验,但现有方法通常预设问题与解决方案已对齐。实际代码库的拉取请求历史极少呈现这种理想对齐状态:单个PR往往交织着多个持续集成故障、失败的修复尝试、被回退的代码改动以及无关变更。这种纠缠状态掩盖了具体哪项代码变更真正解决了哪个特定问题,导致历史修复记录难以直接作为可复用经验供后续修复参考。
双视角追踪与三级抽象
RETRACE框架提出一种从纠缠历史中重建问题级修复经验的方法。它融合两种视角:终点视角从最终通过测试的修订版反向推理保留的变更,开发视角沿提交历史正向追踪修复演变过程。两者通过CI执行证据进行协调对齐。恢复出的经验被表示为三个抽象层级,从具体的代码修复到可迁移的修复模式。面对新故障时,框架检索相关的问题级经验来指导修复。实验表明,结合双视角的效果始终优于单独使用任一视角。
多模型修复率提升实测
研究在CI-REPAIR-BENCH基准上进行验证,该基准包含来自101个代码仓库的565个PR级修复,覆盖12种故障类别。测试结果显示,RETRACE将mini-SWE-agent配合MiniMax-M2.5模型的Pass@1指标从19.6%提升至31.9%;配合DeepSeek-V4-Flash模型时,该指标从23.3%提升至32.8%。在匹配的子集评估中,Codex的修复通过率从15.5%跃升至27.5%。数据证实恢复问题与变更的对齐关系能使历史CI修复转化为可复用经验。
为什么值得看
解决LLM代理从混乱代码历史提取对齐修复经验的难题,实测将多模型CI修复通过率提升超12个百分点。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
