AI 圈大事记

Fathom-Vaidya医疗推理框架发布,30B模型超越GPT-5

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Fathom-Vaidya提出针对医疗大模型的双阶段训练框架,结合合成数据与基于评分准则的强化学习。第一阶段用MedBullets数据与规则引导RL提升诊断推理;第二阶段构建5.3k合成多轮场景及多维评分准则增强临床交互推理。该方法在MedXpertQA基准上带来超10%提升,其30B参数模型在HealthBench-Hard取得50.1%准确率,超越GPT-5(thinking)等闭源基线,证明该训练机制可系统性提升医疗LLM的推理能力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

双维度医疗推理挑战

在医疗领域部署大语言模型需兼顾两类相辅相成的推理能力:一是诊断推理,即基于临床数据推断患者病情的收敛性证据驱动任务;二是临床医疗推理,即在多轮交互中沟通、规划与适应的广泛导航判断,此类场景常无单一标准答案。现有基准测试(如HealthBench与MedXpertQA)揭示当前模型在这两方面均存在持续弱点,在复杂诊断场景与以患者为中心的上下文对话中表现不佳。

基于评分准则的序列训练法

为解决上述缺陷,Fathom-Vaidya引入了序列训练框架,核心是合成数据与基于评分准则的强化学习。训练分两步:首先针对诊断推理,利用MedBullets衍生问题,配合规则与评分准则引导的RL进行优化;随后转向临床推理,生成了5.3k个合成多轮交互场景,每个场景均配备多维评分准则,以全面评估模型响应质量。

性能表现与闭源对比

该训练方法带来了显著的量化提升。在MedXpertQA基准上,模型性能获得了超过10%的增幅。更具标志性的是,其30B参数规模的模型在HealthBench-Hard这一高难度子集上达到了50.1%的准确率,成功超越了包括GPT-5(thinking)在内的多个专有闭源基线模型。这表明,通过定向合成数据集与评分准则训练,能够系统性地增强医疗大模型在诊断与交互临床推理上的表现。

为什么值得看

30B小模型在医疗硬核基准上反超GPT-5,为垂直领域LLM利用合成数据与规则RL突破规模瓶颈提供实证。

GPT大模型强化学习

信源1

  1. [1]arXiv cs.AI一手信源Fathom-Vaidya: Advancing Medical Reasoning with Rubric-Based Rewards

关键事实

  • Fathom-Vaidya采用双阶段训练框架,结合合成数据与基于评分准则的强化学习提升医疗推理[1]

  • 第一阶段使用MedBullets衍生问题与规则引导RL改善诊断推理,第二阶段用5.3k合成多轮场景改善临床推理[1]

  • 该方法在MedXpertQA基准上取得超10%的性能提升[1]

  • 其30B参数模型在HealthBench-Hard上达到50.1%准确率,超越了GPT-5(thinking)等闭源基线[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。