研究提出激活对齐法,提升表格模型上下文学习效率

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对表格基础模型在推理时需处理全部训练样本导致成本过高的问题,研究提出激活对齐法。该方法利用完整上下文指导仅接收部分上下文的“学生”模型,通过在合成无标签数据上训练轻量线性变换,将学生模型的中间激活映射向全量上下文的“教师”模型靠拢。训练该对齐器无需GPU,在普通硬件上数秒至数分钟即可收敛。在TabArena的38个分类数据集上,对TabPFN-3与TabFM两模型测试表明,各上下文预算下对齐学生模型均获统计显著提升,低数据场景下可恢复近半数教师模型的预测优势。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

表格模型ICL推理成本困境

表格基础模型通过上下文学习进行预测,需将带标签的训练样本作为上下文输入。与传统分离训练和推理的模型不同,此类模型每次前向传播均须处理全部训练样本,致使单次预测代价高昂。若削减输入的训练样本数量虽能降低推理开销,却会严重损害模型表现。如何在压缩上下文以提速的同时保住性能,成为亟待解决的矛盾。

激活对齐法运作机制

为避免丢弃上下文信息,该研究提出激活对齐法,让模型在仅观测部分上下文时习得全量上下文下的行为模式。具体做法是:在合成无标签数据上训练一个轻量级线性变换,把受限于部分上下文的“学生”模型的中间激活,映射向拥有完整上下文的“教师”模型的中间激活。此对齐过程计算开销极低,无需GPU参与,在普通硬件上数秒至数分钟即可完成收敛。

评测表现与性能恢复

研究基于TabArena基准的38个分类数据集,选用TabPFN-3与TabFM这两款领先的表格基础模型进行验证。结果显示,在各种上下文预算设定下,经过对齐处理的学生模型相较未对齐基线均取得广泛的统计显著提升。尤其在低数据量场景中,该对齐手段能挽回将近一半由教师模型享有的预测优势,实现了紧凑上下文的推理速度与逼近全量上下文性能的有效折中。

为什么值得看

无需GPU即可大幅降低表格模型ICL推理成本,并在低数据下恢复近半数性能,极具实用价值。

对齐GPU数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Closing the Context Gap: Activation Alignment for Tabular In-Context Learning

关键事实

  • 提出激活对齐法,通过轻量线性变换将部分上下文学生模型的中间激活向全量上下文教师模型对齐。[1]

  • 训练对齐器无需GPU,在普通硬件上数秒至数分钟收敛。[1]

  • 在TabArena的38个分类数据集上对TabPFN-3和TabFM评估,均获统计显著提升。[1]

  • 低数据场景下,对齐方法可恢复近半数教师模型的预测优势。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。