研究揭示临床大模型准确率不等于可靠性,人口统计学扰动致超两成答案改变
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对六款大模型在150道医学题上的测试表明,仅凭准确率无法衡量临床可靠性。在反事实有效性测试中,仅25.3%的尝试有效;添加人口统计学前缀后,20.3%的对比出现答案改变,并触发3128个刻板印象标记。MedGemma 27B准确率与反事实有效性均居首,但其准确率仍高于反事实有效性,证明答对不代表反事实可靠。OpenBioLLM答案改变最多,GLM刻板印象标记最多。因无临床医生验证,结果仅作安全筛查,不证明可临床部署。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载临床大模型评测新方法
该研究对六款大语言模型在150道医学执照考试题上进行了两种自动化扰动测试。反事实有效性测试要求模型做出最小且合理的临床改变,使得另一个选项成为正确答案;人口统计学鲁棒性测试则在相同病例上添加六种人口统计学前缀,并将输出与无前缀基线进行对比。结果显示,900次反事实尝试中仅228次有效;5400次人口统计学对比中,1097次答案发生改变,自动化评判识别出3128个刻板印象证据标记,其中1932个属于广泛的“其他”类别。
各模型表现差异对比
MedGemma 27B以87.1%的准确率和63.3%的反事实有效性位居首位,同时其答案改变率最低(16.0%),平均解释人口统计学不谐度得分也较低(0.169)。然而,其准确率依然高于反事实有效性,表明正确作答并不能保证在反事实任务上表现可靠。OpenBioLLM的答案改变率与不谐度得分最高,GLM的刻板印象标记率最高。这证明准确率、反事实有效性、答案稳定性、不谐度与刻板印象证据捕捉了评测的不同侧面。
临床部署适用性限制
研究强调,由于所有评判均通过自动化方式进行,且缺乏临床医生的验证,当前结果仅能作为模型的安全筛查依据,并不能确立任何模型在真实医疗场景中的临床可部署性。该论文已被AIKP 2026会议接收。
为什么值得看
揭示临床大模型仅看准确率的严重缺陷,提供反事实与人口统计学维度的量化评测方法与数据。
大模型安全
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
