债券组合不能只在起点配一次。利率一变,长债价格可能下跌;今天卖不卖,又会影响明天的持仓和交易成本。这篇论文把银行债券组合写成马尔可夫决策过程(MDP)——根据当前收益率曲线和持仓,逐期决定买卖,并用向后推演求出预期终值财富最高的策略。它属于强化学习所处理的多期决策范式,但论文采用动态规划,并非训练深度学习模型。
作者模拟发现,相比静态均值—方差组合,动态策略在六个月期的平均和中位终值财富高出0.7至4.0个百分点,十二个月期高出2.7至9.0个百分点;交易成本越高,累计换手约下降六分之五。值得注意的是,优势主要来自收益,而非更小的回撤或尾部风险,因为目标函数只追求预期财富。模型也未纳入存款流出、负债、会计分类和监管流动性约束,因此更适合视作银行资产端滚动调仓的可检验框架,而不是完整的资产负债管理方案。以上结果均为作者模拟所得。