研究提出FinSkillBench评估金融AI智能体技能溢价

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究团队推出金融AI智能体评测套件FinSkillBench,涵盖组合构建、风控与基本面分析三大类共12项子任务,包含2603个时点片段。对9个模型在3种资源条件下执行17820次测试发现:精心策划的技能包可将平均得分从0.366提至0.528(提升16.2点),而单次生成技能仅增0.5点且更耗token。对技能溢价拆解显示,单独提供可执行工具提分19.5点,仅给文档提5.6点,两者组合呈次可加性。数值密集型任务高度依赖工具,需流程或输出模式指引的任务更需文档,解释性任务则兼需两者。技能溢价属于模型、资源与测试系统整体属性,而非仅取决于底层模型。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

金融智能体评测套件构建

为评估金融AI智能体在投资流程中的量化执行、程序化资源调用及可审计结构化输出能力,研究团队构建了FinSkillBench评测套件。该套件覆盖投资组合构建、风险管理及基本面分析三大领域,下设12项子任务,共计包含2603个时点片段。其特色在于具备隐藏且可再生的真实基准,以及针对特定任务的确定性验证器,从而确保对智能体表现的客观衡量。

技能包与生成技能效果对比

研究对9个模型在3种资源条件下执行了17820次测试。对8个模型的配对分析表明,使用精心策划的技能包能使平均得分从0.366跃升至0.528,净增16.2点。相比之下,在单次交互中生成的技能仅带来0.5点的微弱提升,且消耗了更多的token与交互轮次。这表明在金融智能体工作流中,预先封装的高质量技能资源远比模型临时生成的技能有效。

技能溢价拆解与任务依赖性

研究进一步将技能溢价拆解为人工编写的程序化文档与可执行领域工具两部分。单独提供工具可带来19.5点的提升,单独提供文档仅增5.6点,两者结合的效果呈次可加性。这种溢价表现出强烈的工作流依赖性:数值密集型流程中可执行工具占主导;当流程或输出模式指引成为瓶颈时,文档作用更显著;解释性任务则从两者中均获益。该效应在10种评分变体及聚类自助分析中保持符号稳定,且被独立实现的第二套测试框架复现了方向性规律。

系统整体属性而非单一模型属性

独立测试框架的复现实验同时揭示,效应的具体幅度取决于工具与数据的暴露方式。因此,研究得出结论:所测得的“技能溢价”并非底层模型单独具备的属性,而是由完整模型、资源条件及测试框架共同构成的系统整体属性。这一发现提示,在优化金融AI智能体时,不应仅关注模型本身的能力迭代,更需统筹考量工具调用方式与系统环境设计。

为什么值得看

揭示金融智能体能力提升来源,证明可执行工具比文档贡献更大,为构建高效金融Agent提供实证依据。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Knowledge or Calculator? Decomposing the Skill Premium in Verifiable Financial Agent Workflows

关键事实

  • 研究提出FinSkillBench评测套件,包含2603个时点片段和12项子任务[1]

  • 精心策划的技能包将平均得分从0.366提升至0.528,增加16.2点[1]

  • 单独提供可执行工具提分19.5点,仅提供文档提5.6点,两者组合呈次可加性[1]

  • 技能溢价是模型、资源与测试 harness 系统的整体属性,而非仅取决于底层模型[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。