首探用编码智能体自动修剪日志代码,当前准确对齐率不足两成

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

该研究首次将日志移除视为独立软件维护任务,从Python与Java库提取并人工验证真实案例,总结出10种移除模式与11种移除原因。构建含387个实例的LogRem数据集,涵盖直接移除、基础设施移除及替换。评估四种编码智能体发现,输出虽95.6%至100.0%通过有效性校验,但仅11.1%至19.6%能如真实变更般移除目标日志且保留无关代码。智能体常漏删、多删或误改无关代码。提交信息与开发者讨论对提升对齐度帮助最大,分类指导则持续降低运行耗时,高执行成本未必然带来更高对齐度。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

日志移除模式与数据集构建

过度日志会引入运行时开销并掩盖诊断信息,但日志移除相较于生成与修改研究明显不足。该研究从Python与Java代码库中提取并人工验证日志移除实例,归纳出10种移除模式与11种移除原因,刻画真实软件变更中日志的移除方式与动机。基于此,研究构建了LogRem数据集,包含387个真实案例,覆盖直接移除日志语句、移除日志基础设施及日志替换三种类型,为评估自动化工具提供基准。

编码智能体评估与对齐度短板

研究评估了四种编码智能体的多种模型设置,将其输出与真实变更对比。结果显示,尽管95.6%至100.0%的输出通过了有效性校验,但仅11.1%至19.6%能精准移除目标日志且不破坏无关代码。智能体在各类日志移除与执行轨迹中表现差异显著,主要问题包括漏删、多删及误改无关代码。这表明当前智能体在准确判定移除范围并保留必要代码方面仍存明显缺陷。

上下文信息与执行成本的影响

研究进一步考察了不同上下文与成本因素对智能体表现的作用。提交信息与开发者讨论能带来最大的对齐度提升,而分类指导则持续降低运行耗时。此外,执行成本在不同智能体间差异巨大,但更高的耗费并未稳定转化为与真实变更更高的对齐度。整体而言,实现可靠的日志移除自动化,核心在于精准界定移除边界同时保全必要代码。

为什么值得看

揭示当前编码智能体在精准判定代码删减范围上的短板,为提升代码修改自动化可靠性提供实证依据。

智能体对齐数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Towards Automatically Pruning Logging Code with Coding Agents: How Far Are We?

关键事实

  • 从Python与Java库提取真实案例,总结出10种日志移除模式与11种移除原因[1]

  • 构建LogRem数据集,包含387个涵盖直接移除、基础设施移除及替换的真实案例[1]

  • 四种编码智能体的输出有效性通过率在95.6%至100.0%之间[1]

  • 仅11.1%至19.6%的智能体输出能如真实变更般移除目标日志且保留无关代码[1]

  • 提交信息与开发者讨论带来最大对齐度提升,分类指导持续降低运行耗时[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。