AI 圈大事记

新研究提出KGQA中SLM推理路径评估法

论文AI 评分 62/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对小语言模型结合知识图谱问答时各阶段耦合导致难以定位推理失败的问题,研究引入THESEUS框架,将冻结的SLM作为局部动作策略,在每跳仅从合法动作中选择并决定是否停止,剥离了参数更新与自由生成。采用Path Edit Distance衡量路径保真度,结合Hits@1评估答案准确率。在Kinship与MQuAKE-ST数据集上,同等规模模型在两项指标上表现差异显著,甚至指向不同最优模型;单条提示轨迹对导航的影响也因模型而异,表明需超越终点准确率评估SLM图推理。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

KGQA评估耦合问题

小语言模型与知识图谱结合进行问答时,端到端流程将图访问、搜索、导航、推理及答案生成等阶段混为一体。这种强耦合导致难以判定模型能否忠实执行问题隐含的推理路径,且无法将失败准确归因于导航失误或其他环节缺陷。为解决此问题,研究需将导航能力从复杂管线中单独剥离出来进行评测。

THESEUS框架解耦评测

研究采用THESEUS导航与可追溯框架,将冻结的现成SLM作为局部动作策略。在每一跳中,环境向模型暴露合法的出图动作,模型仅选择一个可执行图动作并决定是否停止。该设定排除了任务特定参数更新、模型控制束搜索及自由形式答案生成,从而在受控环境下将导航能力独立出来。评测指标方面,采用Path Edit Distance作为主要轨迹度量衡量路径保真度,并结合Hits@1评估终端答案准确率。

实验揭示指标分歧

在Kinship与MQuAKE-ST知识图谱问答数据集上的实验表明,同等规模的本地模型在答案准确率与路径保真度上存在显著差异,两项指标有时会偏好不同模型。这种依赖模型的行为同样延伸至提示环节:单条演示轨迹对导航的改善或恶化完全取决于具体模型。这些结果证明,仅依赖终点准确率不足以衡量SLM图推理能力,必须引入路径保真度评测。

为什么值得看

揭示仅看答案准确率无法衡量SLM图推理能力,为KGQA评测与模型选择提供新路径指标。

数据集

信源1

  1. [1]arXiv cs.AI一手信源The Path Matters: Evaluating Small Language Models Beyond Answer Accuracy in KGQA

关键事实

  • 研究提出在KGQA中需超越答案准确率,评估小语言模型的推理路径保真度[1]

  • 采用THESEUS框架将冻结SLM作为局部动作策略,隔离图访问与自由生成等耦合阶段[1]

  • 使用Path Edit Distance作为轨迹度量,结合Hits@1评估终端答案准确率[1]

  • 在Kinship和MQuAKE-ST数据集上,同等规模模型在准确率与路径保真度上差异显著,两项指标有时偏好不同模型[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。