K-Bench 高风险心理健康对话基准发布
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
K-Bench 是一个针对高风险心理健康对话的临床校准基准,涵盖自杀、自虐等场景。测试包含 200 个多轮案例,评估了来自 14 家提供商的 33 个基础模型共 125 种配置。合成患者对话与真实人机对话分布高度重合。GPT-4o 评判员与临床共识的一致率达 94.2%。头部模型在支持性对话与风险评分上表现优异,治疗性提示能提升弱模型性能,而增强推理未带来平均改善。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准构建与测试范围
K-Bench 旨在评估大型语言模型在演变中的高风险心理健康对话里的安全性。该基准经过临床校准,测试材料受到保护以防直接优化。研究团队构建了一个包含 200 个多轮小插曲的固定队列,这些案例涵盖了自杀、自残、家庭暴力、药物滥用以及无风险展示等多种场景。分析显示,合成生成的患者对话与真实的人类与 AI 对话之间存在实质性的分布重叠,这确保了测试环境的真实性与挑战性。
模型评估与临床一致性
此次评估覆盖了来自 14 个提供商的 33 个基础模型,共计 125 种模型配置。为了验证评估的准确性,研究使用了冻结的 GPT-4o 作为评判员。在基于 151 份临床医生评分转录本的 6,751 个合格项目对比中,GPT-4o 与临床共识达到了 94.2% 的精确一致性。结果表明,领先的头部模型能够结合强有力的支持性对话与超过 95 分的综合风险评分,但在风险探索方面,表现较差的配置之间存在显著差异。
提示策略与性能影响
研究还探讨了不同提示策略对模型表现的影响。结果显示,治疗性提示能够产生特定于配置的增益,且这种增益主要集中在表现较弱的模型上。相比之下,提升推理能力并未带来平均性能的改善。K-Bench 结合了更广泛的临床覆盖范围和配置规模的比较,并提供了持续更新的公共排行榜,该排行榜的运营测试材料已受到保护,防止模型针对特定测试集进行过拟合。
为什么值得看
首个针对高风险心理健康对话的临床级基准,填补了 LLM 安全评估空白。
GPT
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
