研究揭示高UTD下SAC价值发散机制并提出早期预警
论文AI 评分 62/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
提高更新数据比(UTD)会通过表征坍缩和Q值幅度增长两种方式破坏离轨评判器。在宽度2048无归一化的SAC中,表征坍缩可存活,而Q值增长才是致命的。在训练第15k步,Q值的早期增长速率能有效预测后续训练崩溃(在Walker2d和Ant上AUC分别达0.78和0.98),据此提前终止可节省约十分之一的Walker2d计算量且保持净正收益。加入LayerNorm虽能降低该速率并消除Walker2d上的崩溃预警,但会降低回报。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载高UTD下SAC评判器失效机制
提升更新数据比(UTD)会引发离轨评判器的塑性损失,具体表现为表征坍缩和Q值幅度增长两种形式。在采用宽度2048且无归一化的缩放评判器的软执行者-评论者(SAC)算法中,研究发现表征坍缩并不会致命:在UTD比为16的HalfCheetah环境中,即便大多数单元处于休眠状态,评判器仍能继续学习,且训练监控不会触发警报。相比之下,Q值幅度的增长才是导致训练发散的关键因素。
基于Q值早期增长的预警机制
在同一高UTD的SAC配置下,不同运行初始状态相近,但到第15k步时,评判器Q值对数幅度的早期增长速率能够有效排列各次运行被监控标记的先后顺序。在被标记的运行中,第15k步的Q值中位数比标记阈值低超百倍,但其增长速率已能高度预测后续崩溃。在UTD比为4时,Walker2d和Ant环境下的样本外AUC分别达到0.78和0.98。休眠率则不具备此预测能力。基于该速率提前终止运行,可节省约十分之一的Walker2d验证集计算量,且整体保持净正存活收益。
LayerNorm对训练动态的影响
引入LayerNorm的评判器会改变上述训练动态。它能降低Q值的早期增长速率,并在UTD比为4时消除Walker2d环境下的崩溃标记,但代价是会降低最终回报。这表明虽然LayerNorm能抑制Q值发散带来的训练不稳定,但同时也限制了算法能达到的性能上限。
为什么值得看
为高UTD强化学习训练不稳定提供可操作的早期预警指标,能显著节省计算资源。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
