研究指临床LLM正确答案推理不可靠,仅23.3%引用概念具因果必要性
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对临床大模型,研究提出ESI、CFS和PSS三项指标量化解释与决策的因果偏离。对6个模型在150道医学题的测试表明,仅23.3%的引用临床概念具因果必要性。正确答案的CFS(0.212)反而低于错误答案(0.398),答案一致性负向预测CFS(Spearman r=-0.466),模型对答案达成共识时引用概念重合度仅8.8%。这证明准确率、一致性与共识无法作为临床决策安全的可靠信号。该文获ICETCI 2026最佳论文。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载临床LLM推理忠实度缺陷
临床大语言模型虽在医学考试中取得高准确率,但给出正确答案并不代表其解释提及了真正驱动决策的概念。研究指出,准确率、答案一致性与模型共识这三项常用于衡量模型表现的指标,实际上无法作为临床决策支持系统的可靠安全信号,因为它们掩盖了模型推理过程与输出结果之间的脱节。
三项因果评估新指标
为量化这一忠实度差距,研究引入三个轻量且可直译的指标:解释稳定性指数ESI衡量重复查询下的推理一致性;因果忠实度分数CFS通过概念消融测试引用概念是否真正驱动预测;扰动稳定性分数PSS测量对保留语义的改写的鲁棒性。这些指标基于行为而非机制,通过概念消融检验输出的反事实敏感度。
评估数据与反直觉结论
对6个大模型在150道MedQA-USMLE题目的900次观测显示,仅23.3%被引用的临床概念具备因果必要性。反直觉的是,正确答案的CFS(0.212)低于错误答案(0.398),答案一致性负向预测CFS(Spearman r=-0.466),且模型对答案达成共识时,引用的推理概念重合度仅8.8%。这表明高准确与高一致可能伴随更不可靠的推理。
为什么值得看
揭示临床LLM正确答案背后推理不可靠,为医疗AI安全评估提供全新因果检验视角。
大模型量化安全论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
