QRAKEN神经符号管线提升Text2SPARQL准确率,较最强基线相对提升超…

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

QRAKEN是一种免训练、不依赖本体的神经符号管线,通过经验图证据而非模式期望来约束大模型生成。其离线蒸馏器生成TTQL紧凑描述,在线引导大模型并经确定性检查迭代修正。在CK25挑战赛上,搭配GPT-4.1 mini与GPT-5.4分别取得0.643与0.652的严格F1,较最强重算参赛者相对提升30%和32%。消融显示TTQL模式贡献最大,比仅用形状基线高0.31,比SHACL高64%。使用两个本地35B 4-bit开源模型零边际成本即可匹配最强参赛者。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

管线架构与TTQL生成

QRAKEN旨在解决大模型在陌生RDF知识图谱上生成有效但曲解数据模型的SPARQL查询问题。该管线免训练且不依赖本体,分为离线与在线两阶段。离线蒸馏器生成TTQL,这是一种紧凑描述,涵盖已填充的多跳模式、条件频率、路径条件字面量示例及类属性共现矩阵。在线阶段,TTQL引导大模型生成查询,同时通过确定性语法、词汇和数据模型检查提供诊断,支持迭代修正,拒绝共现矩阵不支持的三元组模式。

CK25挑战赛评测表现

在首届Text2SPARQL挑战赛CK25上,基于QLever快照的匹配条件重算显示,QRAKEN搭配GPT-4.1 mini与GPT-5.4分别取得0.643±0.026和0.652±0.012的严格F1。相比最强重算参赛者,相对增益达30%和32%,优于使用同系列基础模型的系统。消融实验表明TTQL模式是主要驱动因素,比仅形状基线高0.31严格F1;修正循环作为低成本安全网发挥作用。与自动派生SHACL相比,TTQL严格F1高出64%,证实经验模式超越模式暴露的价值。

开源模型匹配与局限

在零边际成本条件下,使用两个本地35B 4-bit开源权重模型运行同一管线,其表现即可匹配最强重算参赛者,且TTQL相对形状基线和SHACL基线的优势依然存在。不过,当前结果仅基于单一且相对较小的基准测试,提供的是初步经验信号。该方案的主要局限在于,在非常开放的跨域图谱上进行整体TTQL注入仍面临挑战。

为什么值得看

提供免训练方案解决大模型在陌生知识图谱上生成失真查询的痛点,且零边际成本开源模型可媲美顶尖系统。

GPT大模型蒸馏开源模型

信源1 家

  1. [1]arXiv cs.AI一手信源Natural Language Questions as an Interface for Knowledge Graphs: QRAKEN Graph Distillation and Semantic Self-Healing

关键事实

  • QRAKEN是免训练、不依赖本体的神经符号管线,通过经验图证据约束大模型生成。[1]

  • 在CK25挑战赛上,搭配GPT-4.1 mini和GPT-5.4的严格F1分别为0.643和0.652,相对提升30%和32%。[1]

  • TTQL模式比仅用形状基线高0.31严格F1,比自动派生SHACL高64%严格F1。[1]

  • 使用两个本地35B 4-bit开源模型零边际成本可匹配最强重算参赛者。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。