研究揭示视觉语言模型置信度校准存在盲点
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究发现,经过校准的视觉语言模型即便在自我纠正后给出错误答案,仍可能报告高置信度。这是因为模型的口头置信度与推理轨迹内容在很大程度上相互独立。现有的校准训练反而可能加剧这种脱节,且 ECE 和 AUROC 等指标无法检测此问题。为此,研究团队提出了轨迹基础评分(TGS)及 TGS-Bench 测试集,以评估模型对正确与错误轨迹的置信度区分能力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载置信度与轨迹脱节
研究指出,经过校准的视觉语言模型存在一种现象:即便模型在生成过程中自我纠正、重新检查,最终却得出了错误答案,它依然可能报告很高的置信度。这种现象的根源在于,在这些模型及所评估的校准方法中,口头表达的置信度在很大程度上是独立于推理轨迹的。这意味着模型对自己答案的信心高低,并不取决于其推理路径的具体内容。
现有评估的局限
为了探究这一问题,研究人员通过内容变化、Token 掩码以及模型自身的犹豫标记三个互补视角进行了分析。结果显示,置信度对推理轨迹的实际内容缺乏足够的敏感性。更令人担忧的是,校准训练有时反而会加剧这种置信度与轨迹之间的断裂。目前常用的评估指标,如期望校准误差(ECE)和曲线下面积(AUROC),均无法有效检测出这一缺陷。
提出 TGS 评估方案
针对现有评估体系的盲点,该研究提出了轨迹基础评分(TGS)。TGS 包含两种形式:TGS-self 用于比较模型在获取和不获取自身轨迹时的置信度差异;TGS-pair 则用于测试模型是否会给正确的轨迹分配比错误轨迹更高的置信度,这种比较涵盖了视觉、推理和答案三个维度。
TGS-Bench 测试集
为了支持上述评估,研究团队发布了 TGS-Bench。这是一个模型无关的测试套件,跨越了 10 个基准测试,其中包含受控的优质与劣质轨迹对。实验表明,传统的校准排名与基于轨迹基础的排名存在分歧,这暴露了当前评估实践中存在的盲点,即模型可能在传统指标上表现良好,却无法正确区分自身推理过程的优劣。
为什么值得看
揭示了现有模型评估指标的盲点,提出新方法检测模型是否真正理解其推理过程。
基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
