GANDR 双智能体系统提升法律回答可验证性
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
GANDR 系统采用双智能体架构,由起草者生成结构化法律回答,批评者逐项审计声明与引文来源的一致性。在 185 项法律基准测试中,该系统严格准确率达 70.8%,领先最强基线 11.3 个百分点。其优势源于起草者配置与协议锚定提交规则,移除该规则会导致准确率下降 22.7 点。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载双智能体架构设计
GANDR 系统引入了双智能体协作机制以解决法律回答的可验证性问题。系统中的起草者负责以结构化的法律推理格式撰写答案,而批评者则模拟人类验证者的视角,对每个声明及其引用的来源进行审计。这种设计旨在确保每一项结论都有据可查,避免现有管道中整体评分掩盖局部引文伪造或匹配不严的问题。
基准测试表现
在包含 185 个项目的法律基准测试中,GANDR 在所有主要指标上均排名第一。该系统达到了 70.8% 的严格准确率,比表现最强的基线模型高出 11.3 个百分点,且这一结果具有统计学显著性。测试环境控制了变量,所有六个系统共享同一个骨干模型、检索表面和引文指令,凸显了架构设计的有效性。
关键组件贡献分析
研究分析了系统性能提升的来源,发现优势主要归功于起草者的配置以及协议锚定提交规则。实验显示,如果移除该提交规则,系统的严格准确率将大幅下降 22.7 个百分点。此外,在三个不同的骨干模型上,GANDR 依然保持了 3.2 到 6.5 个百分点的领先优势,证明其性能提升并非依赖重写,而是源于核心架构设计。
人工验证与审计能力
针对法律领域的高标准要求,研究将 GANDR 的审计结果与两名受过法律训练的标注员进行了对比。作为二分类检测器,审计机制标记缺乏支持声明的 F1 分数达到 0.84,显示出较高的可靠性。不过,其四分类裁决标签与人工的一致性较弱,目前仅作为参考建议使用。相关代码可根据请求获取。
为什么值得看
解决了高风险领域模型回答的幻觉与引文不可查问题,建立了逐项声明的验证标准。
智能体基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
