>> 银河证券-银河金工组合优化系列报告:基于深度学习预测与强化学习优化的指数增强策略-260706
| 上传日期: |
2026/7/7 |
大小: |
3859KB |
| 格式: |
pdf 共34页 |
来源: |
银河证券 |
| 评级: |
-- |
作者: |
马普凡,刘璐 |
| 下载权限: |
无限制-登录即可下载 |
|
|
核心观点 基于深度学习预测+强化学习优化的指数增强策略框架,从K线到权重一键生成决策结果:本文将指数增强问题拆分为连续衔接的八个环节:原始数据输入、统一清洗与标签构造、K线衍生特征工程、时序编码、截面关系聚合、多标签预测、强化学习组合优化以及执行与回测评估。本框架的核心优势在于以最基础的K线数据作为输入值,可一键实现收益风险信号预测和个股权重决策,为投资实践提供有效参考。 强化学习模型应用于组合优化问题,静态配置转化为动态决策:承接前序报告中深度学习模型预测的收益风险信号,我们将预测信号、基准权重、已有持仓、换手成本与跟踪误差约束共同纳入状态空间;动作空间定义为连续权重调整信号,经裁剪与Softmax映射为可执行的主动配置权重;奖励函数综合考量超额收益、因子暴露收益、跟踪误差惩罚、换手惩罚与集中度约束,使模型在追求长期超额收益的同时控制风险与交易成本,最大化组合综合表现。 PPO模型逐年滚动训练,双窗口+双门槛质量诊断筛选训练结果:PPO模型采用Actor-Critic架构,Actor输出连续动作分布、Critic估计状态长期价值,其核心优势在于通过裁剪替代目标函数限制新旧策略偏离幅度,提升训练稳定性。训练PPO模型时采用逐年滚动方式,沪深300以最近2-4年数据为纯训练集、最近一年为验证集,在验证集上划分双窗口、通过平均奖励与累计超额收益双门槛进行模型质量诊断,并对多个候选模型按验证集表现进行Softmax加权集成,以增强策略泛化能力。 Banach自融资投影保障组合价值:在PPO模型输出目标权重后,我们引入Banach不动点迭代求解调仓后组合规模,使组合价值、目标权重与交易成本相互一致,避免资金不自洽问题。PPO模型训练阶段默认交易成本为0,避免交易成本重复扣除;在回测阶段统一扣除真实交易成本。 深度学习预测+强化学习优化框架在沪深300、科创50等主流宽基指数表现较优:将以上指数增强框架分别应用于沪深300、科创50指数成分股,每年滚动训练深度学习与强化学习模型并预测下一年信号结果,在2020年7月31日至2026年5月29日回测区间内,沪深300指数增强策略实现年化收益率5.11%、年化超额收益4.26%;在2021年7月30日至2026年5月29日回测区间内,科创50指数增强策略实现年化收益率15.09%、年化超额收益12.52%。两个策略均在获得超额收益的同时降低了最大回撤幅度,且科创50增强结果相比凸优化显著改善,验证了深度学习预测+强化学习优化框架的有效性。 风险提示:报告结论基于历史价格信息和统计规律,但二级市场受各种即时性政策影响易出现统计规律之外的走势,所以报告结论有可能无法正确预测市场发展,报告阅读者需审慎参考报告结论。基金历史收益不代表未来业绩表现,文中观点仅供参考,不构成投资建议。
|
|