做市场中性组合,像一边踩油门、一边扶正方向:既想从选股中赚钱,又不能把收益变成对大盘涨跌的押注。AlphaZeroBeta把这两件事交给同一个深度强化学习模型——让神经网络根据反复决策的奖惩学习持仓策略。它追求 alpha(剔除市场影响后的超额收益),同时让 beta(组合随市场涨跌的程度)接近零。
它最值得记录的增量,是把风险调整后的超额收益、与基准的相关性和交易成本合进同一个奖励函数。换句话说,模型不能只追逐漂亮的账面回报,还要为市场暴露和换手付出“代价”。其 CNN-GRU 策略网络负责提取市场特征并记住时间变化,再通过 Recurrent PPO 训练;论文还采用滚动向前测试,即只用过去训练,再到随后时期检验,以贴近真实部署。
作者称,在覆盖 2014—2024 年、七个股票指数的回测中,该模型比基线取得更高的 Sharpe ratio(单位风险对应的收益),同时保持接近零的基准相关性和有竞争力的回撤。不过这些结论目前来自论文作者的回测,材料未披露具体数值,仍不足以判断优势有多大。