研究评估先心病分割模型的分布外泛化能力
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对先天性心脏病分割任务,研究首次进行了系统性的分布外泛化评估。实验对比了多种架构与训练策略,发现模型在分布内表现优异但在跨数据集测试中性能显著下降。其中,nnU-Net 在验证集上 Dice 达 0.77,但在目标队列中跌至 0.51;SwinUNETR 表现出更强的鲁棒性,达到 0.67。引入少量目标域标注数据后,SwinUNETR 变体分数回升至 0.76 以上。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载分布外性能评估
先天性心脏病诊断与手术规划依赖患者特定的 3D 解剖模型,但手动分割耗时费力。尽管深度学习方法能实现自动化,现有评估多局限于分布内数据,忽略了扫描仪、协议、机构及成像模态差异带来的临床分布偏移。该研究利用 ImageCHD 作为保留目标队列,开展了首个针对先心病分割任务的系统性分布外泛化评估,旨在揭示模型在真实临床环境下的鲁棒性。
架构与策略对比
研究对比了代表性分割架构在混合 CT 和 CMR 训练、仅 CT 训练、自监督预训练及有限目标域适应下的表现。结果显示,分布内性能无法准确预测跨队列鲁棒性。nnU-Net 虽在验证集上取得 0.77 的 Dice 分数,但在目标队列中大幅下滑至 0.51。相比之下,SwinUNETR 展现了更好的泛化能力,在目标队列中达到 0.67 Dice。此外,MAE 和 JEPA 预训练策略带来的提升有限,表明在此场景下,架构选择对鲁棒性的贡献大于测试的预训练策略。
少量数据微调效果
实验进一步探索了引入有限目标域监督的效果。当仅使用 11 个标注的 ImageCHD 病例进行适应时,所有 SwinUNETR 变体的 Dice 分数均超过 0.76。这一发现表明,即使只有极少量的目标域数据,也能显著改善模型在分布外环境下的表现。研究结论支持将显式的跨数据集测试作为先心病分割评估的关键组成部分,以避免常规分布内评估掩盖临床相关的泛化失败。
为什么值得看
揭示医学 AI 模型在临床真实场景下的泛化短板,强调跨数据集测试的必要性。
数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
