ChartBmkAgent实现图表QA基准按需构建

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对多模态大模型能力差距难以快速评测的问题,ChartBmkAgent从稀疏错误分类规范出发,自动构建完整的图表问答评测样本。其核心中枢Harness管控各专项Agent,并在各阶段要求提供与原错误类别对齐的证据。在300个样本测试中,多模态大模型准确率介于32.7%至84.3%间,呈现差异化的类别特征。针对三个源模型对比,定向后续评测得分为50.0%,而匹配对照组为82.2%(p=8.96×10^-6),六次跨模型对比方向一致。86.4%的生成样本经评估符合指定错误类别,证实了目标保留能力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准构建痛点与方案

多模态大语言模型发展迅速,但传统基准开发滞后,阻碍了对新发现能力差距的及时调查。图表问答包含丰富信息,适合探测感知与推理的耦合能力。现有自动化构建方法存在缺陷:目标引导系统常需预备数据或模板;从零生成系统仅保证产物有效性,无法控制合成需求与内容是否对齐外部指定的诊断目标。ChartBmkAgent旨在缩短基准开发周期,将已识别的能力差距按需转化为定向诊断证据。

Harness管控与对齐机制

该系统从稀疏的错误分类规范出发,构建完整的图表问答样本。构建过程中,中央Harness负责管控各专项Agent,要求在各个阶段提供与原始错误类别对齐的特定证据,并记录每个接受决策的依据。这种机制解决了以往方法中目标引导与生成脱节的问题,确保新生成的评测样本在需求与内容上严格对齐指定的诊断目标,从而实现针对性的能力验证与诊断数据生成。

评测数据与验证结果

在300个覆盖全分类的样本上,多模态大模型准确率分布在32.7%到84.3%之间,展现出明显的类别特征差异,表明生成样本能有效揭示能力差别。在针对三个源模型的对比中,定向后续评测得分为50.0%,匹配对照组为82.2%(p=8.96×10^-6),且全部六次跨模型对比方向一致,证明其具备定向验证能力。此外,多个评估模型对样本是否测试了指定错误类别进行评估,86.4%的样本满足该标准,为目标保留提供了实证依据。

为什么值得看

解决现有基准开发滞后问题,实现从已识别能力差距到定向诊断数据的按需自动化生成。

大模型多模态对齐

信源1 家

  1. [1]arXiv cs.AI一手信源ChartBmkAgent: Harness-Governed Multi-Agent Construction of Chart QA Benchmarks from Sparse Error-Taxonomy Specifications

关键事实

  • ChartBmkAgent从稀疏错误分类规范自动构建完整的图表问答评测样本[1]

  • 中枢Harness管控专项Agent并要求各阶段提供与原错误类别对齐的证据[1]

  • 300个样本测试中多模态大模型准确率介于32.7%至84.3%且类别特征各异[1]

  • 定向后续评测得分50.0%对比对照组82.2%(p=8.96×10^-6),六次跨模型对比方向一致[1]

  • 86.4%的生成样本经多个评估模型验证符合指定错误类别[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。