Doctorina 医疗 AI 诊断准确率超医生
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载实验设计与对比对象
该研究旨在评估临床 AI 系统在自适应信息收集后的诊断与管理能力。实验设置了 150 个合成波兰语初级保健咨询案例,将 Doctorina 系统与 8 名医生以及 4 个独立的前沿语言模型进行对比。研究涵盖了诊断选择、诊断检查以及初步治疗等多个维度的评估,以全面衡量不同主体在医疗流程中的表现。
诊断准确率表现
在 Top-1 诊断一致性方面,Doctorina 达到了 82.0%,而医生仅为 57.0%,两者相差 25.0 个百分点。在主要或参考鉴别诊断一致性上,Doctorina 的表现同样优于医生,达到了 97.3%,相比之下医生为 85.0%。数据表明,Doctorina 在初步诊断的准确度上具有显著优势,且在第二次执行中复现了这一结果。
检查与治疗能力
除了诊断环节,研究还评估了后续的检查与治疗方案。在 149 对病例中,Doctorina 的归一化检查得分为 89.4,治疗得分为 83.7;医生的这两项得分分别为 66.9 和 61.2。这表明 Doctorina 的优势不仅限于诊断选择,还延伸到了诊断检查和初始治疗的质量上,能够提供更高质量的医疗决策建议。
模型间横向对比
在所有六个对比组中,Doctorina 拥有最高的诊断点估计值。Kimi K3 模型在诊断方面排名第二。而在管理评估(即检查与治疗)方面,Claude Opus 5 领先,且 Opus、Doctorina 和 Kimi 的管理估计值非常接近。这展示了不同 AI 模型在医疗任务各环节中的差异化表现。
为什么值得看
AI 在复杂医疗场景下的诊断与管理能力全面超越人类医生,验证了临床 AI 的应用潜力。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
