Kenny Peng等人提出语言模型原子特征可测试理论

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Kenny Peng、Jon Kleinberg与Nikhil Garg发表论文,提出语言模型存在原子特征的理论。其核心洞见为“恢复原则”:不断扩大的稀疏字典(如SAE)能依次找回训练数据中最普遍原子的前缀。该原则导出三项预测:小SAE的特征会被所有大SAE共享、不同数据训练的SAE共享双方共有特征、足够大的SAE能同时找回父子特征。在规模从512至131072的SAE及两个大型嵌入模型上的实验证实了这些预测,反驳了SAE特征随规模增大而分裂的传统观点,表明扩大SAE规模具有潜力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

原子特征与恢复原则

Kenny Peng、Jon Kleinberg与Nikhil Garg针对语言模型表示提出了存在原子特征的可测试理论。该理论的核心洞见是“恢复原则”:在存在原子特征的模型中,随着稀疏字典(如稀疏自编码器SAE)尺寸的不断增加,它们能够依次找回训练数据中最普遍原子的一个递增前缀。这一原则将字典大小与数据中原子特征的恢复程度直接关联,为理解表示空间的结构提供了新视角。

三项可测试预测及实验验证

基于恢复原则,论文推导出三项可测试的预测:第一,小规模SAE中的许多特征会被所有更大规模的SAE所共享;第二,在不同数据上训练的SAE会共享在两种数据中都很普遍的特征;第三,足够大的SAE能够同时找回父特征与子特征。研究者在规模从512至131072的SAE以及两个大型嵌入模型上进行了实验,结果证实这三项预测均成立。

对传统观点的反驳与实践意义

传统观点认为,SAE的特征是不稳定的,随着字典尺寸的增加会发生“分裂”。但该研究的实验结果与这一共识相悖,表明特征在规模扩大时保持稳定。从理论层面看,结果展示了基于原子特征构建表示科学理论的前景;从实践层面看,结果支持了扩大SAE规模的可行性,暗示更大规模的SAE能够更完整地捕捉模型表示中的特征结构。

为什么值得看

反驳SAE特征随规模增加而分裂的旧共识,为基于原子特征构建表示理论及扩大SAE规模提供实证支撑。

论文

信源1 家

  1. [1]arXiv cs.AI一手信源A Testable Theory of Atomic Features

关键事实

  • 论文提出语言模型存在原子特征的理论及“恢复原则”,即扩大的稀疏字典能找回训练数据中最普遍原子的递增前缀。[1]

  • 理论给出三项预测:小SAE特征被大SAE共享、不同数据训练的SAE共享共有特征、足够大的SAE找回父子特征。[1]

  • 在规模从512到131072的SAE及两个大型嵌入模型上的实验验证了上述预测。[1]

  • 实验结果反驳了SAE特征随规模增大而不稳定分裂的传统观点,支持扩大SAE规模。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。