PPO-HRAP融合机制先验优化风险控制交易
论文AI 评分 62/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对强化学习交易难以兼顾收益与回撤控制的问题,PPO-HRAP算法将近端策略优化与可解释的机制先验相融合。智能体接收含VIX条件回撤惩罚等复合奖励,执行PPO输出与机制目标暴露的混合动作。在2020至2022年SPY测试中,该算法年化收益8.48%,夏普比率0.6447,最大回撤由买入并持有的34.10%降至18.47%。在QQQ与DIA单次跨资产测试中,其总收益与夏普比率均居首。局限在于换手率高且跨资产稳健性仅限单次验证。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载算法设计与奖励机制
强化学习应用于交易时常面临上行参与和回撤控制难以兼顾的困境,仅追求利润的策略易在向上漂移资产中偏向被动多头,而激进风险惩罚则易在波动期过于保守。PPO-HRAP提出一种混合机制感知策略,将近端策略优化与可解释的机制先验相结合。智能体同时观测市场特征与投资组合状态变量,接收的奖励由投资组合对数收益、VIX条件回撤增加惩罚、目标暴露偏差及换手成本共同构成,最终执行PPO执行器输出与机制衍生目标暴露间的混合动作。
SPY回测表现与稳健性
在预留的2020至2022年SPY测试窗口中,PPO-HRAP实现27.62%总收益、8.48%年化收益、0.6447夏普比率、0.8588索提诺比率及0.4592卡尔马比率。其将最大回撤从买入并持有策略的34.10%显著压降至18.47%。在五种SPY随机种子下,算法保持稳定,平均总收益为0.2725正负0.0109,平均夏普比率为0.6219正负0.0565。
跨资产测试与局限性
在QQQ与DIA上的单次跨资产测试进一步表明,该方法在所报告的三种资产中总收益与夏普比率均排名第一。结果表明,将学习动作与波动率感知机制先验混合是改善风险调整交易行为的实用途径。然而当前策略仍存在换手成本过高的局限,且除SPY外的跨资产稳健性目前仅限于单次运行证据,尚待进一步验证。
为什么值得看
提供将机制先验融入RL以平衡收益与回撤的实用方法,在多资产测试中风险调整收益居首。
智能体强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
