TICDA方法实现表格模型上下文数据单次前向归因

行业AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

表格基础模型(TFM)依赖上下文标注样本做预测,但劣质或冗余样本会损害性能。现有归因法不适用:重采样需组合量前向传播,梯度法依赖参数更新而上下文学习无此步骤。TICDA从TFM潜变量嵌入训练的线性代理中直接测度单样本影响,单次前向完成且开销极低。在四项任务中综合最优:查标签错、精简上下文保精度降推理成本、跨模型迁移归因分、支撑高效主动学习获取策略。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

TFM上下文归因痛点

表格基础模型通过上下文标注样本做预测而不更新参数,但各样本对特定预测的影响尚不明确。实际应用中,上下文常由可用标注数据拼凑,易混入误标、冗余或低质样本从而拉低表现。传统数据归因方法无法平移至该场景:基于重采样的DemoShapley需组合级前向传播,计算极贵;基于梯度的影响函数需算训练点对模型参数的作用,而上下文学习根本不更新参数。

TICDA原理与优势

TICDA通过在TFM潜变量嵌入上训练线性代理模型,直接测度上下文中各样本的边际影响。该方法仅需单次前向传播即可完成归因,计算开销可忽略不计。相比传统方法,它绕开了无参数更新的限制与组合爆炸的计算瓶颈,为理解与优化表格模型的上下文构成提供了高效工具。

四项任务验证效果

实验表明TICDA在四类任务中达成最佳综合权衡:一是检测标注错误;二是精简上下文,在保持预测精度的同时降低推理成本;三是生成可跨不同TFM迁移的归因分数;四是为高效主动学习提供数据获取策略。这证实了其在样本质量审查与推理效率优化上的实用价值。

为什么值得看

解决表格模型上下文学习无参数更新的归因难题,单次前向低成本剔除劣质样本并降推理开销。

信源1 家

  1. [1]arXiv cs.AI一手信源TICDA: Tabular In-Context Data Attribution

关键事实

  • TICDA从TFM潜变量嵌入训练的线性代理中直接测度上下文样本影响,仅需单次前向传播且开销极低。[1]

  • 重采样法需组合量前向传播,梯度法依赖参数更新,两者均不适用于TFM上下文学习归因。[1]

  • TICDA在查标签错、精简上下文保精度降推理成本、跨模型迁移归因分、支撑高效主动学习四任务中综合最优。[1]

相关 · 行业

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。