研究提出稀疏神经元定位五步诊断法,揭示幻觉神经元非唯一
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载稀疏探测诊断协议
大模型机制可解释性常依赖稀疏探测定位少量神经元,声称其能检测并因果影响事实回忆、安全对齐及幻觉等行为。此类声明对模型审计与行为引导影响重大,却极少针对高维相关特征空间中L1正则化探测的已知失效模式进行检验。为此,该研究提出五步诊断协议作为稀疏神经元定位声明的最低标准,涵盖特征相关性、自举稳定性、稀疏与稠密排名分歧、干预基线及跨数据集评估。
检测效果与模型对比
研究在TriviaQA、BioASQ和NQ-Open数据集上,使用开源大模型对幻觉神经元进行了调查。结果显示检测在模型与数据集间均可复现,且在TriviaQA和BioASQ上超出了原报告的AUROC差距。对比模型表现,Gemma 3 4B在匹配数据集上始终优于MedGemma 4B,两者在TriviaQA上的AUROC差距分别为+0.311与+0.235,在BioASQ上为+0.474与+0.455,在NQ-Open上为+0.128与+0.112。在n=500及五种随机种子下的因果验证也显示出超越同层随机基线的统计显著效应。
神经元定位非唯一性
尽管检测指标有效,诊断结果却表明所选神经元并非唯一局部化。在Gemma 3 4B的三种设置中,22个选定的幻觉神经元有19个与其他特征的Pearson |r|大于0.7,自举选择仅呈现中等稳定性,且稀疏与稠密排名重叠度弱。这证明稀疏预测结构能与非唯一的神经元选择共存。因此,在机制可解释性中,必须进行常规诊断验证,以区分检测声明与定位声明。
为什么值得看
揭示稀疏探测定位神经元的非唯一性陷阱,为机制可解释性评估提供必须的诊断验证标准。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
