AI 圈大事记

DRACO方法提升长周期智能体训练效果

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

DRACO是一种新型信用分配方法,通过动态评分标准在训练中跟踪策略演变能力,在AppWorld上比基础模型提升15.9分,比使用稀疏真实奖励的GRPO提升5.3分。在Tau-Bench上,即使没有前沿评估者,仍比基础模型提升5.3分,超越真实奖励训练和其他基于评分标准的训练设置。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

动态评分与归因机制

在缺乏程序化验证器的长周期智能体训练场景中,传统的奖励信号往往难以获取。针对这一盲设环境,研究者提出了一种名为 DRACO 的方法,即基于评分标准的优势分配信用优化。该方案的核心在于利用多标准评分表作为奖励来源,并在训练过程中动态生成这些评分表,以实时追踪策略能力的演变。不同于以往仅在轨迹完成后进行一次整体评分的做法,DRACO 能够将针对特定标注步骤的评分判断,重新分配回那些实际产生影响的步骤中。这种分配过程采用闭式解进行计算,无需引入额外的训练模块或归因网络,从而直接生成了具有区分度的每步优势值,为策略优化提供了更精细的指导。

实验数据与性能对比

在 AppWorld 测试平台上的实验结果显示,该方法表现出了显著的性能提升。相较于基础模型,DRACO 实现了 15.9 个百分点的增益;即便与使用稀疏真实奖励训练的 GRPO 模型相比,其分数也高出了 5.3 个点。值得注意的是,这一成绩是在未使用任何验证器的情况下取得的。此外,在跨域的 Tau-Bench 测试中,即便没有前沿评判模型的辅助,DRACO 依然比基础模型高出 5.3 个点。这表明,无论是在同领域还是跨领域任务中,该方案在性能上均超越了基于真实奖励的训练以及其他基于评分表的训练设置,证明了其在长周期任务中的有效性。

为什么值得看

解决了长周期智能体训练中缺乏可验证奖励信号的问题,显著提升性能。

智能体

信源1

  1. [1]arXiv cs.AI一手信源DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

关键事实

  • DRACO通过动态评分标准跟踪策略演变能力,在每条轨迹完成后评分并重新分配[1]

  • 在AppWorld上,DRACO比基础模型提升15.9分,比GRPO提升5.3分[1]

  • 在Tau-Bench上,DRACO比基础模型提升5.3分,超越真实奖励训练和其他评分标准训练[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。