AI 圈大事记

Jev模型可低成本评估AI放射报告临床事实性

论文AI 评分 62/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Jev作为System One决策模型,用于评估AI生成放射报告与医生参考报告间的事实差异。其双向检查可捕捉无依据声明与遗漏。单问题配置在RadEvalX与RadEvalExpert上Kendall相关系数分别达0.573和0.398,优于匹配条件下的开放NLI评判器。每句仅用1个支持问题,与7个问题保持相近专家一致性,且节省43-45%输入token。百对报告评判成本低于3美分。在受控错误测试中,其检测假阴性的AUROC为0.977。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

模型评估机制与成本

Jev被研究作为评估AI生成放射报告与医生参考报告间一致性的低成本评判器。该模型采用双向检查机制,验证每条陈述是否被另一报告支持,从而识别无依据的声明与异常遗漏。在成本与效率方面,每条陈述仅使用1个支持问题,即可达到与7个问题相近的专家一致性水平,同时节省43-45%的评判输入token。依据文档记录的API价格,每百对报告的评判成本不足3美分,展现出极高的实用性。

性能对比与错误检测

在性能表现上,Jev的单问题配置在RadEvalX数据集上取得0.573的Kendall相关系数,在RadEvalExpert上达到0.398,该表现超越了在匹配分解与聚合条件下的开放自然语言推理评判器。此外,在单独的受控错误测试中,Jev对假阴性错误的检测AUROC高达0.977。研究也指出,本地RadMatch在两个专家数据集的临床显著错误及共享RadEvalExpert子集的总错误上实现了更强一致性,表明更复杂的评估方法在特定场景下仍有其价值。

为什么值得看

提供低成本、高准确度的医疗报告事实性评判方案,解决AI生成报告遗漏或捏造异常的核心评估痛点。

API

信源1

  1. [1]arXiv cs.AI一手信源Can Jev Judge Radiology Reports? Evaluating a System One Model for Clinical Factuality

关键事实

  • Jev单问题配置在RadEvalX和RadEvalExpert上与专家错误计数的Kendall相关系数分别为0.573和0.398[1]

  • 每句1个支持问题与7个问题保持相近专家一致性,且减少43-45%评判输入token[1]

  • 按文档API价格,百对报告评判成本低于3美分[1]

  • 在受控错误测试中,Jev检测假阴性的AUROC达0.977[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。