新框架HAO解决全同态加密下强化学习多项式发散问题

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

全同态加密(FHE)用于云端强化学习(RL)时,非线性操作的多项式近似会因Bellman drift产生严重发散。本文提出同态优势算子(HAO)稳定框架,将零均值中心化投影直接用于时序差分目标,消除驱动发散的状态价值基线,且不增加非线性乘法深度或需密文自举。在加密CartPole等实验中,HAO智能体实现0%边界突破,而正则化与基线分别在5个种子中3个及83.8%回合突破边界;HAO还将表格域最优策略准确率提升18.0个百分点,并在加入DP-SGD式高斯噪声时保持稳定。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

FHE强化学习发散难题

在云端为智能系统部署隐私保护机器学习时,全同态加密(FHE)是保障数据机密性的有效计算方案。然而,将FHE应用于强化学习(RL)需用多项式近似替换非线性操作,这会因一种名为Bellman drift的递归误差现象而发生灾难性发散,严重阻碍了FHE在RL中的实际应用。

HAO框架核心机制

为防止多项式近似发散,本文提出同态优势算子(HAO)稳定框架。该框架将基于优势的价值估计中的零均值中心化投影,直接适配到时序差分(TD)目标上。此线性投影能够消除驱动Bellman drift的均匀状态价值基线,在维持各状态动作排序的同时,无需增加额外的非线性乘法深度,也避免了开销高昂的密文自举操作。

实验评估与效果对比

研究采用三层实验方法评估HAO:表格MDP、使用真实CKKS密码操作的加密CartPole环境,以及具有密集连续特征的20节点物流路由基准。结果表明,HAO将网络预激活严格限制在安全多项式近似域内。在所有随机种子下,HAO智能体边界突破率为0%;仅用正则化(L2权重衰减与梯度裁剪)在5个种子中3个突破边界,未稳定基线在83.8%的回合突破。此外,HAO在表格域将最优策略准确率提升18.0个百分点,且在裁剪梯度中加入DP-SGD式高斯噪声时仍保持稳定。

为什么值得看

解决FHE在RL部署中的核心发散难题,实现零边界突破与策略准确率大幅提升,对隐私保护云端RL落地极具价值。

智能体强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Homomorphic Advantage Operator: Stabilizing Reinforcement Learning Under Fully Homomorphic Encryption Constraints

关键事实

  • HAO框架通过将零均值中心化投影应用于TD目标,消除导致Bellman drift的状态价值基线。[1]

  • HAO不增加额外非线性乘法深度,且避免了昂贵的密文自举操作。[1]

  • 实验中HAO智能体实现0%边界突破,正则化方法在5个随机种子中3个突破边界,未稳定基线在83.8%回合突破边界。[1]

  • HAO在表格马尔可夫决策过程中将最优策略准确率提升18.0个百分点。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。