AI 圈大事记

Chronicle 实现智能体回放测试

工具AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Chronicle 是一种针对 LLM 智能体的回归测试工具,通过在非确定性边界记录不可变信封并进行回放,将记录的故障转化为测试用例。基准测试显示,记录每次仅增加 23 微秒开销,全回放零模型调用且位稳定,切点测试能准确识别错误代码并放过良性变更。该工具及基准已公开。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解决复现难题

大语言模型响应具有非确定性,导致智能体故障难以复现。故障往往依赖于非位级可复现的推理、读取变化状态的工具以及难以重复重现的多步轨迹。现有的记录与回放技术虽然能使运行可复现,但主要用于追踪或评分,无法用于测试代码变更。Chronicle 通过在非确定性边界记录智能体运行,将其作为不可变信封,并从记录中进行回放,解决了这一问题。

切点回放机制

Chronicle 的核心操作是切点回放。该机制从记录中提供选定边界的子集,并使用新代码实时执行互补子集。这种方法将记录的事故转化为可在持续集成中运行的回归测试。在包含 6 个记录故障的基准测试中,记录过程每次穿越边界仅增加 23 微秒的开销,假设模型调用为 300 毫秒,这仅占 0.008%。

测试性能表现

测试结果表明,全回放模式下不发起任何模型调用,并且在 20 次重复中保持位稳定。切点测试在所有 6 个事故中,均对错误代码失败,而对防护和良性变更通过。在对防护工具进行的变异研究中,切点测试捕获了每一个允许记录的不安全操作通过的变异体,而使用相同断言对所有边界进行存根的基线方法,则未能捕获任何变异体。

为什么值得看

解决智能体故障难复现问题,提升回归测试效率与准确性。

智能体安全基准测试

信源1

  1. [1]arXiv cs.AI一手信源Chronicle: Cut-Point Replay for Regression Testing of LLM Agents

关键事实

  • 记录每次边界穿越增加 23 微秒开销,约占 300 毫秒模型调用的 0.008%。[1]

  • 全回放不发起模型调用,在 20 次重复中保持位稳定。[1]

  • 切点测试在 6 个记录故障中,对错误代码失败,对防护和良性变更通过。[1]

  • 变异测试中,切点测试捕获所有放行不安全操作的变异体,而全存根基线捕获数为零。[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。