Kenny Peng等人提出语言模型原子特征可测试理论
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Kenny Peng、Jon Kleinberg与Nikhil Garg发表论文,提出语言模型存在原子特征的理论。其核心洞见为“恢复原则”:不断扩大的稀疏字典(如SAE)能依次找回训练数据中最普遍原子的前缀。该原则导出三项预测:小SAE的特征会被所有大SAE共享、不同数据训练的SAE共享双方共有特征、足够大的SAE能同时找回父子特征。在规模从512至131072的SAE及两个大型嵌入模型上的实验证实了这些预测,反驳了SAE特征随规模增大而分裂的传统观点,表明扩大SAE规模具有潜力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载原子特征与恢复原则
Kenny Peng、Jon Kleinberg与Nikhil Garg针对语言模型表示提出了存在原子特征的可测试理论。该理论的核心洞见是“恢复原则”:在存在原子特征的模型中,随着稀疏字典(如稀疏自编码器SAE)尺寸的不断增加,它们能够依次找回训练数据中最普遍原子的一个递增前缀。这一原则将字典大小与数据中原子特征的恢复程度直接关联,为理解表示空间的结构提供了新视角。
三项可测试预测及实验验证
基于恢复原则,论文推导出三项可测试的预测:第一,小规模SAE中的许多特征会被所有更大规模的SAE所共享;第二,在不同数据上训练的SAE会共享在两种数据中都很普遍的特征;第三,足够大的SAE能够同时找回父特征与子特征。研究者在规模从512至131072的SAE以及两个大型嵌入模型上进行了实验,结果证实这三项预测均成立。
对传统观点的反驳与实践意义
传统观点认为,SAE的特征是不稳定的,随着字典尺寸的增加会发生“分裂”。但该研究的实验结果与这一共识相悖,表明特征在规模扩大时保持稳定。从理论层面看,结果展示了基于原子特征构建表示科学理论的前景;从实践层面看,结果支持了扩大SAE规模的可行性,暗示更大规模的SAE能够更完整地捕捉模型表示中的特征结构。
为什么值得看
反驳SAE特征随规模增加而分裂的旧共识,为基于原子特征构建表示理论及扩大SAE规模提供实证支撑。
论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
