研究构建哥伦比亚法律基准,揭示大模型事实正确率不足0.45

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究者构建了针对哥伦比亚法律系统的专家验证基准,含1042题覆盖10个法律领域及3种题型。对15个模型的评测显示,封闭题准确率在0.577至0.905(Gemini 3.1 Pro最高)之间,但自由文本事实正确率无一超过0.45。模型回答相关性与正确性呈负相关(rho=-0.46),常显得合理却事实错误;引用的法规约一半错误或不存在。封闭题与自由文本排名高度相关(rho=0.94),廉价多选题可预测排序但会高估绝对可靠性。结论是当前模型需专家监督,基于权威来源接地是提升可靠性的方向。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准构建与评测设计

为评估大语言模型在美国以外国家法律系统的可靠性,研究团队针对哥伦比亚法律构建了一个专家验证基准。该基准包含1042个评测条目,横跨十个不同的法律领域,并设计了封闭多选、半开放以及开放IRAC三种题型。数据构建采用了人在回路的流水线,并经过多阶段专家审查。研究评测了15个当前主流的专有和开源权重模型,并针对不同题型使用了适配的评测指标。

评测结果与可靠性脱节

评测结果显示,模型在封闭选择题上的准确率差异较大,从0.577到0.905不等,其中Gemini 3.1 Pro达到最高的0.905。然而,在自由文本法律回答中,所有模型的事实正确率均未超过0.45。更严重的是,模型回答的相关性与正确性之间存在负相关(Spearman rho = -0.46),这意味着模型能可靠地生成看似切题的回答,却经常包含事实错误,这对非专业用户尤为危险。此外,模型引用的法律规范中仅约一半正确,其余皆为错误或虚构。

指标关联与改进方向

研究发现封闭题准确率与自由文本正确率之间存在强排名相关性(rho = 0.94),表明廉价的多选题筛选可有效预测模型在自由文本上的排名,但会高估其绝对可靠性。在评分机制上,独立的基于量表的LLM裁判与盲测人类专家评分均能复现自由文本的排名(rho >= 0.88)。可靠性随法律领域系统性变化,且与问题复杂度呈倒U型关系。研究结论指出,当前模型处理哥伦比亚法律任务仍需专家监督,将回答基于权威来源接地是提升可靠性的可行路径。

为什么值得看

揭示大模型在非美法律系统中严重的高相关性低正确率脱节现象,为法律AI落地提供关键可靠性警示。

Gemini大模型

信源1 家

  1. [1]arXiv cs.AI一手信源Do Large Language Models Know Colombian Law? A Reliability Benchmark for the Colombian Legal System

关键事实

  • 构建了包含1042个条目的哥伦比亚法律系统专家验证基准,覆盖10个法律领域和3种题型[1]

  • 15个模型在封闭题准确率介于0.577到0.905之间,自由文本事实正确率均未超过0.45[1]

  • 模型回答相关性与正确性脱节,Spearman rho为-0.46,常显得合理但实际错误[1]

  • 模型引用的法律规范中约一半是错误的或根本不存在的[1]

  • 封闭题准确率与自由文本正确率排名强相关(rho=0.94),多选题可预测排序但高估绝对可靠性[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。