研究提出Matrix AdaGrad优化算法,利用矩阵结构提升训练稳定性
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有自适应优化器主要针对向量参数,未显式利用矩阵结构。Wenpeng Zhang等人提出基于在线镜像下降的通用框架,通过引入行与列方向的矩阵近端函数,推导出Row-AdaGrad与Column-AdaGrad。其自适应缩放由累积的行或列梯度范数决定,在结构化梯度下,遗憾界比逐元素AdaGrad更紧。矩阵分解与深度网络实验表明,该算法对齐矩阵结构后,能提升大学习率与深层网络下的优化稳定性及可训练性。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载矩阵自适应优化框架
当前主流自适应优化方法如AdaGrad和Adam主要针对向量参数设计,未显式利用权重矩阵的结构特性。尽管近期有矩阵感知优化器展现了结构化优化的优势,但缺乏类似AdaGrad的通用理论框架来推导矩阵自适应机制。该研究构建了针对矩阵参数的在线镜像下降通用框架,通过引入自适应近端函数,基于在线遗憾最小化原则,为推导矩阵自适应优化提供了理论路径。
算法推导与遗憾界对比
在上述框架下,研究者引入了行方向与列方向的矩阵近端函数,并分析由此产生的遗憾权衡,推导出Row-AdaGrad与Column-AdaGrad两种算法。这两种算法的自适应缩放分别由累积的行梯度范数或列梯度范数决定。理论证明,在具备结构化梯度的条件下,这类矩阵感知算法的遗憾界可以严格优于逐元素处理的AdaGrad。
实验验证与训练优势
在矩阵分解与深度神经网络训练任务上的实验验证了该算法的有效性。结果表明,将自适应缩放与矩阵结构对齐能带来显著收益,具体表现为在采用更大学习率以及构建更深层网络时,优化过程的稳定性与可训练性均得到明显提升。
为什么值得看
为矩阵参数提供更紧的遗憾界,显著改善深层网络与大学习率下的训练稳定性。
对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
