研究提出Knossos基准与Ariadne框架,提升图表拓扑提取
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
当前视觉语言模型在识别图表元素上能力渐强,但完整提取实体间关系仍待探索。研究提出Knossos基准,含横跨6领域的19200张图表及超24万节点与近44万边,通过符号生成实现图与标注精确对齐。同时提出Ariadne框架,将提取任务分解为节点盘点与源条件边预测。实验表明,在Knossos上训练可显著提升较小开源模型提取能力,Ariadne在同等监督下优于单步提取,取得最高平均Edge F1,且在真实外部基准上超越未适配基线。代码与基准已开源。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载图表拓扑提取新基准
科学、工程等领域常用结构图表示复杂系统关系。尽管视觉语言模型在识别图表元素上进展显著,完整提取实体及全部关系仍显不足。为此,研究构建了Knossos基准,涵盖6个不同领域的19200张图表,包含245179个节点与439740条边。该基准采用符号生成流程,确保渲染图表与完整拓扑、关系类型及连接器几何标注间实现精确对齐,为大规模监督训练与系统评估奠定基础。
Ariadne解耦框架设计
针对完整拓扑提取的建模挑战,研究提出Ariadne结构化框架。该框架将提取任务解耦为两步:首先进行节点盘点提取,随后执行源条件边预测。实验证明,在同等监督条件下,这种结构化分解相比单步提取方式具有额外优势。Ariadne在Knossos基准的评估方法中达到了最高的平均Edge F1分数,同时其两种骨干变体在真实世界外部基准上也超越了未适配的对应基线模型。
对开源VLM的提升效果
研究通过大量实验验证了所提方法的有效性。结果表明,利用Knossos基准数据进行训练,能够显著增强较小规模开源视觉语言模型在完整拓扑提取任务上的表现。这意味着该基准不仅提供了评测标准,也具备作为训练数据源切实提升模型能力的价值。相关代码与基准数据已公开可用。
为什么值得看
提供大规模图表拓扑提取基准与结构化解耦框架,显著提升开源VLM的图关系抽取性能。
对齐开源模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
