AI 圈大事记

TRACE框架利用合成奖励训练因果推理智能体

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究提出TRACE框架,通过在模拟器中注入干预生成合成奖励,解决复杂数据诊断推理中验证成本高的问题。在包含12种根本原因的数字广告诊断环境中,智能体需使用Python和SQL识别根因及受影响片段。实验显示,经合成奖励强化学习的Qwen3.5-35B-A3B模型在235个测试集上FullAttr@1得分达0.757,超越Claude Opus 5等提示基线及更大参数模型,且工具调用量显著减少。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

合成奖励解决验证难题

现有的可验证奖励强化学习(RLVR)在数学和代码等领域表现出色,因为这些领域存在客观且易于验证的答案。然而,在复杂数据的诊断推理中,确定异常的真正原因往往需要昂贵的专家调查,且事后仍可能模糊不清。该研究提出了一种工程化方法来解决这种验证不对称性。通过采样一个干预措施并将其注入受控模拟器,生成该干预将产生的观测数据。隐藏的干预提供了神谕标签和客观奖励,而智能体则必须调查充满噪声、混杂且分布式的证据。

TRACE环境与任务设定

研究将这一方法实例化为TRACE,这是一个数字广告诊断环境,包含12种根本原因和细粒度的细分归属。在该环境中,智能体在每个回合中使用Python和SQL进行调查,必须识别出根本原因,并在适用时确定受影响的细分分配。这种设定模拟了现实世界中诊断任务的复杂性,要求模型不仅具备推理能力,还需熟练使用工具来处理和分析数据。

实验结果与性能对比

在一个包含235个回合的保留测试集上,最强的提示基线Claude Opus 5达到了0.686的FullAttr@1分数。相比之下,监督微调将Qwen3.5-35B-A3B的分数从0.159提升至0.637,而随后的合成奖励强化学习将其进一步推高至0.757。这一成绩超越了所有评估的提示基线,包括前沿的闭源模型和提示版本的Qwen3.5-122B-A10B模型。此外,生成的策略所使用的工具调用量也显著少于提示版本的35B基础模型。

规模与训练信号的关系

研究结果表明,获取可扩展的客观训练信号可能比模型规模本身是一个更重要的约束因素。更广泛地看,基于模拟的验证可以使原本模糊的诊断推理任务适用于可扩展的强化学习。这意味着,通过精心设计的合成奖励机制,相对较小的模型在特定任务上也能实现超越更大规模模型的性能,为AI在复杂诊断领域的应用提供了新的思路。

为什么值得看

证明合成奖励可突破诊断推理训练瓶颈,小模型经RL训练能超越大模型。

ClaudeQwen智能体强化学习

信源1

  1. [1]arXiv cs.AI一手信源TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards

关键事实

  • TRACE框架通过模拟器注入干预生成合成奖励,用于训练因果推理智能体。[1]

  • 在数字广告诊断环境中,模型需识别12种根本原因及细分归属。[1]

  • 经合成奖励RL训练的Qwen3.5-35B-A3B在测试集上得分为0.757,优于Claude Opus 5的0.686。[1]

  • 训练后的策略使用的工具调用量显著少于提示基线模型。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。