AI 圈大事记

研究提出稀疏神经元定位五步诊断法,揭示幻觉神经元非唯一

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型可解释性中稀疏探测定位神经元(如幻觉神经元)的声明,该研究提出包含特征相关性、自举稳定性等五步诊断协议。在TriviaQA等三个数据集上对Gemma 3 4B与MedGemma 4B的测试表明,幻觉检测可复现且具因果效应,Gemma 3 4B的AUROC差距均优于MedGemma 4B。但诊断显示所选神经元并非唯一局部化:22个神经元中19个与其他特征高度相关,自举稳定性中等,稀疏与稠密排名重叠弱。稀疏预测结构可与非唯一神经元选择共存,需常规诊断区分检测与定位声明。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

稀疏探测诊断协议

大模型机制可解释性常依赖稀疏探测定位少量神经元,声称其能检测并因果影响事实回忆、安全对齐及幻觉等行为。此类声明对模型审计与行为引导影响重大,却极少针对高维相关特征空间中L1正则化探测的已知失效模式进行检验。为此,该研究提出五步诊断协议作为稀疏神经元定位声明的最低标准,涵盖特征相关性、自举稳定性、稀疏与稠密排名分歧、干预基线及跨数据集评估。

检测效果与模型对比

研究在TriviaQA、BioASQ和NQ-Open数据集上,使用开源大模型对幻觉神经元进行了调查。结果显示检测在模型与数据集间均可复现,且在TriviaQA和BioASQ上超出了原报告的AUROC差距。对比模型表现,Gemma 3 4B在匹配数据集上始终优于MedGemma 4B,两者在TriviaQA上的AUROC差距分别为+0.311与+0.235,在BioASQ上为+0.474与+0.455,在NQ-Open上为+0.128与+0.112。在n=500及五种随机种子下的因果验证也显示出超越同层随机基线的统计显著效应。

神经元定位非唯一性

尽管检测指标有效,诊断结果却表明所选神经元并非唯一局部化。在Gemma 3 4B的三种设置中,22个选定的幻觉神经元有19个与其他特征的Pearson |r|大于0.7,自举选择仅呈现中等稳定性,且稀疏与稠密排名重叠度弱。这证明稀疏预测结构能与非唯一的神经元选择共存。因此,在机制可解释性中,必须进行常规诊断验证,以区分检测声明与定位声明。

为什么值得看

揭示稀疏探测定位神经元的非唯一性陷阱,为机制可解释性评估提供必须的诊断验证标准。

大模型幻觉数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Hallucination Neurons and Where to Find Them: An Investigation into the existence of Hallucination Neurons

关键事实

  • 提出五步诊断协议:特征相关性、自举稳定性、稀疏与稠密排名分歧、干预基线及跨数据集评估[1]

  • Gemma 3 4B在TriviaQA、BioASQ、NQ-Open上的AUROC差距分别为+0.311、+0.474、+0.128,均优于MedGemma 4B[1]

  • 22个选定幻觉神经元中19个与其他特征的Pearson |r| > 0.7,自举稳定性中等,稀疏与稠密排名重叠弱[1]

  • 稀疏预测结构可与非唯一神经元选择共存,需常规诊断验证区分检测与定位声明[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。