研究对比从执行轨迹挖掘 Agent 技能的六种配置

论文AI 评分 62/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

该论文研究了在缺乏可靠运行结果的生产环境中,如何从执行轨迹挖掘 Agent 技能。固定挖掘管线,对比了三种挖掘证据(仅成功轨迹、带标签的成败混合、无标签的成败混合)与两种技能形式(有序工作流、声明式本体)的六种组合。在 ThinkingBox-Bench 上,工作流比本体得分高 1.7 pp,无标签混合证据比仅成功证据低 3.1 pp,带标签混合比仅成功高 2.4 pp;而在 APEX-Agents 上,本体略受偏好且证据类型无显著差异。结论指出需按目标领域定制技能而非通用适配。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

生产环境技能挖掘挑战

记录程序指令的 Agent 技能正越来越多地从执行轨迹中挖掘而非人工编写。现有挖掘管线常依赖已知任务结果或反馈来指导构建,但在生产环境中,运行是否成功的可靠信息往往难以获取。为此,该研究探讨了执行轨迹采样方式、成败信息获取程度及挖掘出的技能形式如何影响下游任务表现。

六种挖掘配置对比设计

在保持挖掘管线不变的前提下,研究对比了六种挖掘证据与技能形式的组合。挖掘证据分三级:仅成功轨迹、带结果标签的成败混合轨迹、以及隐去标签的成败混合轨迹(模拟无结果信息场景)。技能形式分两类:有序的工作流计划,以及由实体、状态和策略构成的声明式本体。

跨领域评估与差异化结论

评估在 ThinkingBox-Bench 与 APEX-Agents 两个企业级基准上进行。任务级配对差异分析表明,不同配置的收益高度依赖企业领域。在 ThinkingBox-Bench 上,工作流比本体得分高 1.7 pp,带标签混合证据比仅成功证据高 2.4 pp,而模拟无结果信息的无标签混合证据比仅成功证据低 3.1 pp。相反,在 APEX-Agents 上,本体呈现适度优势,且各证据类型间无明确偏好。各领域内,任务结构相关约束导致了使用挖掘技能时的不均匀性能。

为什么值得看

揭示了生产环境下 Agent 技能挖掘的最优配置因领域而异,为构建高效技能管线提供实证依据。

论文

信源1 家

  1. [1]arXiv cs.AI一手信源Mining Agent Skills from Production Traces

关键事实

  • 对比了三种挖掘证据与两种技能形式构成的六种组合对下游任务的影响[1]

  • 在 ThinkingBox-Bench 上,工作流比本体高 1.7 pp,带标签混合证据比仅成功证据高 2.4 pp[1]

  • 在 APEX-Agents 上,本体略受偏好,不同证据类型间无明确偏好[1]

  • 结论建议针对目标领域定制技能,而非采用通用方案[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。