SoftServe:可扩展拟牛顿法优化深度学习

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对拟牛顿法在深度学习中受限于非凸性和参数量巨大的问题,SoftServe提出无需线搜索的优化族。它从变分目标推导正定曲率估计,构造对角和Kronecker分解变体以保持正定并适配大网络,用稳定的耦合Newton-Schulz迭代替代矩阵分解,实现GPU友好的矩阵乘法。在病态问题(如RNN、物理信息扩散模型等)上,其损失常低于Adam、Muon和SOAP基线。

为什么值得看

提供可扩展至大网络的拟牛顿法,在病态任务上优于Adam等基线,为深度学习优化提供新路径。

GPU

信源1 家

  1. [1]arXiv cs.AI一手信源SoftServe: A Scalable Quasi-Newton Method for Deep Learning

关键事实

  • SoftServe是一种为深度学习设计的可扩展拟牛顿方法族[1]

  • 该方法无需线搜索或临时曲率修正,从变分目标推导正定曲率估计[1]

  • 开发了按构造保持正定的对角和Kronecker分解变体以适配大规模神经网络[1]

  • 使用稳定的耦合Newton-Schulz迭代替代昂贵的矩阵分解,实现GPU友好的矩阵乘法[1]

  • 在严重病态问题上常获得比Adam、Muon和SOAP更低的损失[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。