研究提出Grokking谱理论:权重衰减驱动特征学习
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
该论文为神经网络中泛化远晚于训练拟合的Grokking现象提供了定量理论。研究指出,对于使用L2权重衰减与平方损失的齐次网络,记忆化后留存的残差会反馈至神经正切核(NTK)动态,使残差驱动的核增长与权重衰减相竞争。该机制推导出Grokking时间尺度受学习率与权重衰减乘积控制,且存在临界衰减值使特征学习对数级变慢甚至阻止拟合。在模加法实验中,齐次MLP与单块Transformer均验证了该相几何与泛化时间缩放律预测。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载Grokking的谱理论机制
Grokking表现为训练数据拟合与泛化提升之间存在显著延迟。该研究提出,此过程中网络从固定的神经正切核(NTK)机制转向任务相关核特征方向持续演化的机制。对于使用平方损失与L2权重衰减的齐次网络,记忆化完成后仍保留有限残差,且目标分量中较小的NTK特征值对应较大残差比例。这些残差反馈至NTK动态,投影到任务相关谱方向后,形成残差驱动的核增长与权重衰减相竞争的简化系统,从而定量解释了延迟泛化的产生。
关键预测与实验验证
该理论系统给出三项核心预测:Grokking时间尺度由学习率与权重衰减的乘积决定;特征学习在临界衰减值附近呈对数级变慢,超过该值则无法泛化;更强的衰减会完全阻止拟合。在模加法任务中,齐次MLP在训练精度饱和后,NTK中持续涌现任务对齐的傅里叶结构。通过84乘90网格的受训网络实验,成功恢复了预测的相几何及泛化时间关于学习率与权重衰减的逆乘积缩放律。单块Transformer虽违反严格齐次性,但在42乘45网格实验中展现出相似的宏观相结构与相同的过渡时间缩放律。
为什么值得看
从机制层面解释了Grokking现象的成因与相结构,给出了学习率及权重衰减的定量缩放律。
对齐论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
