AI 圈大事记

Doctorina 医疗 AI 诊断准确率超医生

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究在 150 个波兰语初级保健合成咨询中,对比了 Doctorina 系统、8 名医生及 4 个前沿语言模型。Doctorina 的 Top-1 诊断一致率达 82.0%,高于医生的 57.0%;在主要或参考鉴别诊断一致性上,Doctorina 达 97.3%,医生为 85.0%。在检查与治疗评分方面,Doctorina 的归一化得分分别为 89.4 和 83.7,均显著优于医生的 66.9 和 61.2。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

实验设计与对比对象

该研究旨在评估临床 AI 系统在自适应信息收集后的诊断与管理能力。实验设置了 150 个合成波兰语初级保健咨询案例,将 Doctorina 系统与 8 名医生以及 4 个独立的前沿语言模型进行对比。研究涵盖了诊断选择、诊断检查以及初步治疗等多个维度的评估,以全面衡量不同主体在医疗流程中的表现。

诊断准确率表现

在 Top-1 诊断一致性方面,Doctorina 达到了 82.0%,而医生仅为 57.0%,两者相差 25.0 个百分点。在主要或参考鉴别诊断一致性上,Doctorina 的表现同样优于医生,达到了 97.3%,相比之下医生为 85.0%。数据表明,Doctorina 在初步诊断的准确度上具有显著优势,且在第二次执行中复现了这一结果。

检查与治疗能力

除了诊断环节,研究还评估了后续的检查与治疗方案。在 149 对病例中,Doctorina 的归一化检查得分为 89.4,治疗得分为 83.7;医生的这两项得分分别为 66.9 和 61.2。这表明 Doctorina 的优势不仅限于诊断选择,还延伸到了诊断检查和初始治疗的质量上,能够提供更高质量的医疗决策建议。

模型间横向对比

在所有六个对比组中,Doctorina 拥有最高的诊断点估计值。Kimi K3 模型在诊断方面排名第二。而在管理评估(即检查与治疗)方面,Claude Opus 5 领先,且 Opus、Doctorina 和 Kimi 的管理估计值非常接近。这展示了不同 AI 模型在医疗任务各环节中的差异化表现。

为什么值得看

AI 在复杂医疗场景下的诊断与管理能力全面超越人类医生,验证了临床 AI 的应用潜力。

信源1

  1. [1]arXiv cs.AI一手信源Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

关键事实

  • Doctorina Top-1 诊断一致率 82.0%,医生为 57.0%。[1]

  • Doctorina 检查与治疗得分分别为 89.4 和 83.7。[1]

  • 研究基于 150 个波兰语初级保健合成咨询案例。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。