研究指数据归因中规格失配是影响排序分歧根源
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有训练数据影响评估器常给出不兼容的样本排序,以往多归因于近似误差。该研究指出,更根本的分歧源于规格失配:影响评估依赖于目标行为、施加的干预及反事实训练过程,尤其在需用代理(如查询损失、逻辑分值)替代目标行为时。作者将影响形式化为反事实被估量,区分了规格失配与近似误差,并推导出局部分解以揭示行为信号、训练信号与参数响应的交互。实验表明,不同规格下的精确被估量会产生不同排序,且规格选择显著影响归因质量。行为对齐的规格能识别出默认基于损失或相似度的规格所掩盖的特定训练样本。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载排序分歧的根源剖析
在评估训练样本对模型行为的影响时,现有各类影响评估器经常给出相互冲突的样本排序结果。以往研究通常将这种不兼容性归结为算法的近似误差。该论文提出,更深层且根本的分歧来源是“规格失配”。影响评估本质上取决于三个要素:被归因的目标行为、对每个训练样本施加的干预,以及将干预映射为模型响应的反事实训练过程。当目标行为难以直接观测而必须采用可处理的替代指标(如查询损失、逻辑分值或边际)时,这些规格选择显得尤为关键。
反事实被估量与局部分解
作者将数据影响形式化为一种反事实被估量,从而在概念上清晰区分了不同被估量之间的规格失配,与针对固定被估量进行估计时产生的近似误差。基于此形式化,研究推导出一种局部分解方法,直观展示了行为信号、训练信号以及反事实参数响应这三者之间的交互机制。受控实验证实,即便在完全精确估计的情况下,不同的规格设定依然会导致样本排序产生差异;而近似误差则随着扰动偏离线性化点而逐渐增大。
规格选择对归因质量的影响
在噪声标签检测与大语言模型归因任务上的实验表明,规格选择对最终的归因质量具有显著影响,尤其是行为代理的选取。采用与目标行为对齐的规格,能够有效识别出那些对特定目标起作用的训练样本,而这些关键样本在默认的基于损失或基于相似度的规格下往往被掩盖。这一发现确立了规格分析作为解释和比较不同数据影响评估器时不可或缺的首要步骤。
为什么值得看
揭示数据归因评估器排序分歧的根源,为比较和解释数据影响提供必须的规格分析步骤。
对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
