AI 圈大事记

研究揭示临床大模型准确率不等于可靠性,人口统计学扰动致超两成答案改变

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对六款大模型在150道医学题上的测试表明,仅凭准确率无法衡量临床可靠性。在反事实有效性测试中,仅25.3%的尝试有效;添加人口统计学前缀后,20.3%的对比出现答案改变,并触发3128个刻板印象标记。MedGemma 27B准确率与反事实有效性均居首,但其准确率仍高于反事实有效性,证明答对不代表反事实可靠。OpenBioLLM答案改变最多,GLM刻板印象标记最多。因无临床医生验证,结果仅作安全筛查,不证明可临床部署。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

临床大模型评测新方法

该研究对六款大语言模型在150道医学执照考试题上进行了两种自动化扰动测试。反事实有效性测试要求模型做出最小且合理的临床改变,使得另一个选项成为正确答案;人口统计学鲁棒性测试则在相同病例上添加六种人口统计学前缀,并将输出与无前缀基线进行对比。结果显示,900次反事实尝试中仅228次有效;5400次人口统计学对比中,1097次答案发生改变,自动化评判识别出3128个刻板印象证据标记,其中1932个属于广泛的“其他”类别。

各模型表现差异对比

MedGemma 27B以87.1%的准确率和63.3%的反事实有效性位居首位,同时其答案改变率最低(16.0%),平均解释人口统计学不谐度得分也较低(0.169)。然而,其准确率依然高于反事实有效性,表明正确作答并不能保证在反事实任务上表现可靠。OpenBioLLM的答案改变率与不谐度得分最高,GLM的刻板印象标记率最高。这证明准确率、反事实有效性、答案稳定性、不谐度与刻板印象证据捕捉了评测的不同侧面。

临床部署适用性限制

研究强调,由于所有评判均通过自动化方式进行,且缺乏临床医生的验证,当前结果仅能作为模型的安全筛查依据,并不能确立任何模型在真实医疗场景中的临床可部署性。该论文已被AIKP 2026会议接收。

为什么值得看

揭示临床大模型仅看准确率的严重缺陷,提供反事实与人口统计学维度的量化评测方法与数据。

大模型安全

信源1 家

  1. [1]arXiv cs.AI一手信源Beyond Accuracy: Counterfactual Fragility and Demographic Bias in Clinical Evaluation of LLMs

关键事实

  • 六款大模型在150道医学题上的反事实有效性测试中,仅25.3%的尝试有效[1]

  • 添加人口统计学前缀后,20.3%的对比出现答案改变,触发3128个刻板印象标记[1]

  • MedGemma 27B准确率87.1%与反事实有效性63.3%均居首,但准确率仍高于反事实有效性[1]

  • OpenBioLLM答案改变率与人口统计学不谐度最高,GLM刻板印象标记率最高[1]

  • 因评判全自动化且无临床医生验证,结果仅支持安全筛查,不确立临床可部署性[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。