研究推出电子病历检索动态基准BRIE
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对现有临床大模型评测集维护成本高且易过时的问题,研究团队提出一种从纵向病历笔记自动生成问答对的框架。19名临床医生验证该生成器,构建出可持续更新的BRIE评测集。对9个大模型及5种推理策略的测试表明,前沿系统常遗漏关键临床信息,尤其在需跨文档综合时。该基准支持生成反映医生推理差异的多个答案以做鲁棒评估,并持续更新内容防数据泄露。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载动态基准构建与验证
随着大语言模型深入电子病历系统,其安全性与实用性亟需严格评测。然而既有基准多依赖人工构建,更新代价高昂,且随技术演进极易失效。为此,研究团队开发出一种可扩展框架,能够基于纵向病历笔记自动产出问答对。为保障生成质量,十九位临床医生对该生成器进行了验证,最终形成名为BRIE的评测数据集。该数据集具备持续可维护性,打破了传统静态评测集的局限。
临床大模型表现缺陷
研究利用BRIE对九个大语言模型及五种推理策略展开评测。结果暴露出当前顶尖系统的显著不足:它们在回答问题时频繁遗漏关键临床信息。这一现象在需要跨越多份文档及多次就诊记录进行信息综合的复杂问题上尤为突出。这表明现有模型在处理真实临床场景的长链条、分散信息时,仍存在严重的能力短板。
BRIE的独特评估优势
由于基准生成器本身经过了临床验证,BRIE能提供传统静态评测无法支持的评估维度。一方面,针对同一临床问题,它能生成多个反映医生推理差异的参考答案,从而实现更鲁棒的模型性能评估;另一方面,其内容可被持续刷新,有效防止模型因训练数据泄露而获得虚高分数。该成果证明,可扩展的基准生成机制能为快速演进的医疗环境中的临床大模型提供严谨且紧跟时代的评测。
为什么值得看
揭示当前临床大模型跨文档信息综合的严重缺陷,提供防过时与防泄露的动态评测新范式。
大模型模型评测
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
