像拿几天路况训练自动驾驶:系统起初会防着堵车,但如果训练中默认“今天的路况整天不变”,它看得越久,越敢认定自己已经摸透环境。用有限历史数据训练交易策略也有这个问题。常见做法是在每条模拟路径开始时随机抽取一组参数,却不告诉策略;但策略能从后续数据反推参数,不确定性随时间消失,原本的稳健性也会退化。
Mueller 等人提出“平稳歧义”:让策略对隐藏状态的不确定程度不随时间系统性下降。具体做法是使用联合平稳的 Markov 模拟器——未来只取决于当前状态的随机系统——并在正式决策前提供一段预热观察,使策略从一开始就面对较稳定的不确定性。作者在衍生品对冲实验中称,这样训练的策略能持续抵御波动率等潜在因素变化,并在真实市场数据上优于不确定性逐渐消失的训练方式;论文未在所给材料中披露这一优势的具体幅度。