AI 圈大事记

研究揭示视觉语言模型置信度校准存在盲点

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究发现,经过校准的视觉语言模型即便在自我纠正后给出错误答案,仍可能报告高置信度。这是因为模型的口头置信度与推理轨迹内容在很大程度上相互独立。现有的校准训练反而可能加剧这种脱节,且 ECE 和 AUROC 等指标无法检测此问题。为此,研究团队提出了轨迹基础评分(TGS)及 TGS-Bench 测试集,以评估模型对正确与错误轨迹的置信度区分能力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

置信度与轨迹脱节

研究指出,经过校准的视觉语言模型存在一种现象:即便模型在生成过程中自我纠正、重新检查,最终却得出了错误答案,它依然可能报告很高的置信度。这种现象的根源在于,在这些模型及所评估的校准方法中,口头表达的置信度在很大程度上是独立于推理轨迹的。这意味着模型对自己答案的信心高低,并不取决于其推理路径的具体内容。

现有评估的局限

为了探究这一问题,研究人员通过内容变化、Token 掩码以及模型自身的犹豫标记三个互补视角进行了分析。结果显示,置信度对推理轨迹的实际内容缺乏足够的敏感性。更令人担忧的是,校准训练有时反而会加剧这种置信度与轨迹之间的断裂。目前常用的评估指标,如期望校准误差(ECE)和曲线下面积(AUROC),均无法有效检测出这一缺陷。

提出 TGS 评估方案

针对现有评估体系的盲点,该研究提出了轨迹基础评分(TGS)。TGS 包含两种形式:TGS-self 用于比较模型在获取和不获取自身轨迹时的置信度差异;TGS-pair 则用于测试模型是否会给正确的轨迹分配比错误轨迹更高的置信度,这种比较涵盖了视觉、推理和答案三个维度。

TGS-Bench 测试集

为了支持上述评估,研究团队发布了 TGS-Bench。这是一个模型无关的测试套件,跨越了 10 个基准测试,其中包含受控的优质与劣质轨迹对。实验表明,传统的校准排名与基于轨迹基础的排名存在分歧,这暴露了当前评估实践中存在的盲点,即模型可能在传统指标上表现良好,却无法正确区分自身推理过程的优劣。

为什么值得看

揭示了现有模型评估指标的盲点,提出新方法检测模型是否真正理解其推理过程。

基准测试

信源1

  1. [1]arXiv cs.AI一手信源The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

关键事实

  • 视觉语言模型的口头置信度与推理轨迹内容在很大程度上相互独立。[1]

  • 现有的 ECE 和 AUROC 指标无法检测置信度与轨迹脱节的问题。[1]

  • 研究提出了 TGS-self 和 TGS-pair 两种轨迹基础评分形式。[1]

  • TGS-Bench 是一个包含 10 个基准测试的模型无关套件。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。