AI 圈大事记

研究指临床LLM正确答案推理不可靠,仅23.3%引用概念具因果必要性

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对临床大模型,研究提出ESI、CFS和PSS三项指标量化解释与决策的因果偏离。对6个模型在150道医学题的测试表明,仅23.3%的引用临床概念具因果必要性。正确答案的CFS(0.212)反而低于错误答案(0.398),答案一致性负向预测CFS(Spearman r=-0.466),模型对答案达成共识时引用概念重合度仅8.8%。这证明准确率、一致性与共识无法作为临床决策安全的可靠信号。该文获ICETCI 2026最佳论文。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

临床LLM推理忠实度缺陷

临床大语言模型虽在医学考试中取得高准确率,但给出正确答案并不代表其解释提及了真正驱动决策的概念。研究指出,准确率、答案一致性与模型共识这三项常用于衡量模型表现的指标,实际上无法作为临床决策支持系统的可靠安全信号,因为它们掩盖了模型推理过程与输出结果之间的脱节。

三项因果评估新指标

为量化这一忠实度差距,研究引入三个轻量且可直译的指标:解释稳定性指数ESI衡量重复查询下的推理一致性;因果忠实度分数CFS通过概念消融测试引用概念是否真正驱动预测;扰动稳定性分数PSS测量对保留语义的改写的鲁棒性。这些指标基于行为而非机制,通过概念消融检验输出的反事实敏感度。

评估数据与反直觉结论

对6个大模型在150道MedQA-USMLE题目的900次观测显示,仅23.3%被引用的临床概念具备因果必要性。反直觉的是,正确答案的CFS(0.212)低于错误答案(0.398),答案一致性负向预测CFS(Spearman r=-0.466),且模型对答案达成共识时,引用的推理概念重合度仅8.8%。这表明高准确与高一致可能伴随更不可靠的推理。

为什么值得看

揭示临床LLM正确答案背后推理不可靠,为医疗AI安全评估提供全新因果检验视角。

大模型量化安全论文

信源1 家

  1. [1]arXiv cs.AI一手信源Right Answer, Wrong Reason: Accuracy, Consistency, and Consensus Are Misleading Indicators of LLM Faithfulness in Clinical Decision Support

关键事实

  • 研究提出ESI、CFS和PSS三项轻量级指标,用于量化临床大模型解释与实际决策的因果偏离。[1]

  • 在150道MedQA-USMLE题目上评估6个大模型,发现仅23.3%的引用临床概念具因果必要性。[1]

  • 正确答案的CFS为0.212,低于错误答案的0.398;答案一致性负向预测CFS,Spearman r为-0.466。[1]

  • 模型对答案达成共识时,引用的推理概念重合度仅有8.8%。[1]

  • 该研究获ICETCI 2026会议最佳论文奖。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。