DeFA框架实现LLM智能体故障归因,下游任务准确率提升6-15个百分点

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型智能体执行错误与表象间隔多步的归因难题,DeFA框架被提出。它融合协议与语义依赖构建事件依赖图,追踪违规事件源头及影响生成故障传播图,结合步骤证据定位关键错误、责任主体及类别。为支持长轨迹,该框架将执行分段,用当前段详情与其余段摘要结合以获取全局上下文。在Who&When及Pro子集评测中,该方法在所有主干模型上取得最高责任主体与精确步骤准确率,并在Pro上获对齐方法中最高故障模式准确率,也适用于多模态轨迹。将其诊断反馈用于Trace2Skill的技能进化,可使下游任务准确率较原生管线提升6至15个百分点。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

故障归因与图构建机制

大模型智能体执行出错时,根本原因与可见后果间往往相隔多步,导致定位困难。DeFA框架通过依赖引导解决此问题。其先将协议关系与语义依赖整合,生成贯穿执行轨迹的事件依赖图;接着找出可能违背任务要求的事件,追踪其源头及后续效应,构建出故障传播图;最后利用步骤证据及各步骤在故障传播里的角色,判定关键错误、责任智能体与错误类别。

长轨迹分段与多模态适用

针对长执行轨迹,DeFA采用分段处理机制,将执行过程划分为多个片段。诊断时,将当前片段的详细内容与其余片段的摘要相结合,使局部诊断也能获取全局执行上下文。此外,在图像与视频轨迹上的实验表明,该框架同样适用于多模态场景的故障归因。消融实验也证实了分段、事件依赖图及故障传播图各自的作用。

评测表现与技能进化收益

在Who&When及Pro文本子集评测中,DeFA在所有被评估主干模型上均取得最高的责任智能体准确率与精确步骤准确率,并在Pro子集上获得对齐方法中最高的故障模式准确率。除诊断外,将DeFA产生的诊断反馈应用于Trace2Skill的技能进化过程,相比原生管线,下游任务准确率提升了6至15个百分点,表明其诊断结果能有效促进智能体在后续任务中的改进。

为什么值得看

解决智能体长链执行错误难定位痛点,提供可落地的自动归因与技能进化方案,显著提升下游准确率。

大模型多模态智能体对齐

信源1 家

  1. [1]arXiv cs.AI一手信源DeFA: Dependency-Guided Failure Attribution for LLM Agents

关键事实

  • DeFA框架融合协议与语义依赖构建事件依赖图,并生成故障传播图以定位关键错误、责任主体及类别。[1]

  • 为支持长轨迹,DeFA将执行分段,结合当前段详情与其余段摘要提供全局上下文进行诊断。[1]

  • 在Who&When及Pro子集评测中,DeFA在所有主干模型上取得最高责任主体与精确步骤准确率。[1]

  • 将DeFA诊断反馈用于Trace2Skill技能进化,下游任务准确率较原生管线提升6至15个百分点。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。