研究构建哥伦比亚法律基准,揭示大模型事实正确率不足0.45
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准构建与评测设计
为评估大语言模型在美国以外国家法律系统的可靠性,研究团队针对哥伦比亚法律构建了一个专家验证基准。该基准包含1042个评测条目,横跨十个不同的法律领域,并设计了封闭多选、半开放以及开放IRAC三种题型。数据构建采用了人在回路的流水线,并经过多阶段专家审查。研究评测了15个当前主流的专有和开源权重模型,并针对不同题型使用了适配的评测指标。
评测结果与可靠性脱节
评测结果显示,模型在封闭选择题上的准确率差异较大,从0.577到0.905不等,其中Gemini 3.1 Pro达到最高的0.905。然而,在自由文本法律回答中,所有模型的事实正确率均未超过0.45。更严重的是,模型回答的相关性与正确性之间存在负相关(Spearman rho = -0.46),这意味着模型能可靠地生成看似切题的回答,却经常包含事实错误,这对非专业用户尤为危险。此外,模型引用的法律规范中仅约一半正确,其余皆为错误或虚构。
指标关联与改进方向
研究发现封闭题准确率与自由文本正确率之间存在强排名相关性(rho = 0.94),表明廉价的多选题筛选可有效预测模型在自由文本上的排名,但会高估其绝对可靠性。在评分机制上,独立的基于量表的LLM裁判与盲测人类专家评分均能复现自由文本的排名(rho >= 0.88)。可靠性随法律领域系统性变化,且与问题复杂度呈倒U型关系。研究结论指出,当前模型处理哥伦比亚法律任务仍需专家监督,将回答基于权威来源接地是提升可靠性的可行路径。
为什么值得看
揭示大模型在非美法律系统中严重的高相关性低正确率脱节现象,为法律AI落地提供关键可靠性警示。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
