新基准PHRBench评估大模型幻觉后推理行为

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型系统中幻觉信息会传播并影响后续推理的问题,PHRBench被提出以在行为层面评估幻觉后推理(PHR)。该基准覆盖4个领域与18个大模型,通过幻觉遵从、幻觉规避及启发式修正三种模式刻画推理轨迹,将成功修正并得出正确答案定义为有洞察力轨迹。在4820个受控实例中发现成功恢复较罕见且伴随更频繁的信念更新,幻觉提示属性对恢复成功具有显著预测信号,轻量级预测器AUROC达0.847。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

幻觉后推理评估缺口

在多阶段大模型系统中,一旦产生幻觉信息,此类错误内容会沿系统链路传播,并成为后续推理步骤的上下文基础。过往针对幻觉后推理的研究多聚焦于最终结果变动与整体推理动态的表征,缺乏在响应层面探究模型如何消解幻觉前提的深入理解。为填补此空白,研究者提出了PHRBench,旨在提供一个受控环境,从行为结构化视角审视大模型遭遇幻觉后的推理表现。

基准设计与评估维度

PHRBench的评估范围横跨4个领域,对18个大语言模型进行了测试。该基准摒弃了仅依赖最终答案正确性来评判的做法,转而独立刻画每条推理轨迹。具体通过三个维度进行衡量:幻觉遵从、幻觉规避以及启发式修正。若模型能成功修正错误前提并最终推导出正确答案,该轨迹即被定义为具有洞察力。整个评估过程建立在4820个受控实例之上,确保了行为观测的严谨性。

核心发现与恢复预测

基于大规模受控实例的观测显示,模型从幻觉前提中成功恢复的情况相对罕见,且这种成功恢复往往伴随着推理轨迹中更为频繁的信念更新。此外,研究揭示了幻觉提示本身的属性对能否成功恢复包含大量预测信号。利用这些信号,一个轻量级预测器在预测成功恢复任务上取得了0.847的AUROC。这些结论提供了理解大模型消解错误上下文行为的新视角,并指出了成功恢复最可能发生的条件。

为什么值得看

揭示大模型处理错误上下文的行为模式及恢复条件,为构建更鲁棒的多阶段LLM系统提供行为学依据。

大模型幻觉

信源1 家

  1. [1]arXiv cs.AI一手信源PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

关键事实

  • PHRBench是一个用于行为层面评估大模型幻觉后推理(PHR)的受控基准。[1]

  • 该基准覆盖4个领域,评估了18个大语言模型,包含4820个受控实例。[1]

  • 通过幻觉遵从、幻觉规避和启发式修正来独立刻画推理轨迹。[1]

  • 成功恢复较罕见,且与推理轨迹中更频繁的信念更新相关。[1]

  • 幻觉提示属性对成功恢复有显著预测信号,轻量级预测器AUROC达0.847。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。