RAGScope协议实现低成本RAG幻觉分流,CPU单例耗时6.22毫秒
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载协议设计与性能基准
RAGScope协议专为RAG系统生成答案的风险路由设计,利用任务输入、检索上下文及答案文本评估局部证据门控。协议整合了上下文分组拆分、折叠范围预处理、分组Bootstrap区间、部署操作点、端到端运行时及源偏移压力测试。增强版RAGScope-E在RAGTruth三个任务上的池化分组交叉验证中,AUROC达到0.798,平均精度(AP)为0.660。其池化AP较ROUGE-L高出0.034,95%上下文分组区间为[0.002, 0.064],但AUROC提升不显著,且ROUGE-L在数据到文本任务上依然更强。
运行效率与审核预算
在运行速度方面,RAGScope-E在CPU上每样本仅需6.22毫秒,而对比的DeBERTa-NLI与HHEM设置每样本分别耗时145.75毫秒和223.07毫秒,展现出显著的低延迟优势。在审核预算分配上,当设定最高10%审核预算时,RAGScope-E能达到0.748的精度;若直接接受风险最低的50%输出,其剩余不忠实率仅为0.141。这表明廉价证据门控可作为有效的路由组件,将强验证器保留给昂贵的尾部案例。
跨源校准与部署边界
针对14900个样本的HaluBench压力测试揭示了该协议的部署边界:域内校准的门控AUROC可达0.879,但跨源校准平均AUROC骤降至0.466。通过目标专属校准,每源使用100个标签可将AUROC恢复至0.675,200个标签可恢复至0.685。这说明廉价门控虽具实用路由价值,但学习型校准必须在目标域内进行验证与适应,跨域直接部署存在性能崩塌风险。
为什么值得看
提供极低延迟的RAG输出风险分流方案,并揭示校准必须适应目标域,对RAG工程落地极具参考价值。
信源1 家
关键事实
RAGScope-E在RAGTruth任务池化分组交叉验证中AUROC达0.798,AP为0.660,AP比ROUGE-L高0.034。[1]
RAGScope-E在CPU上单例耗时6.22毫秒,对比DeBERTa-NLI的145.75毫秒和HHEM的223.07毫秒。[1]
在10%审核预算下RAGScope-E精度为0.748,接受最低风险50%输出时剩余不忠实率为0.141。[1]
HaluBench压力测试中,域内校准AUROC为0.879,跨源校准平均仅0.466,目标域每源百标签校准可恢复至0.675。[1]
该论文被2026 IEEE ICTAI会议接收,提交于2026年9月30日。[1]
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
