你请人替八只篮子分配资金,传统做法是先猜每只篮子未来能赚多少,再把预测交给另一个人决定仓位。问题是,第一步里看似很小的预测误差,到了第二步可能变成很大的押注。KellyBoost想把这道接力题改成一道题:让模型直接回答“钱该怎么分”,并按最终的财富增长来训练。
Jiayu Li在arXiv论文《KellyBoost: Growth-Optimal Portfolio Construction with Gradient-Boosted Trees》中,把这套思路放进了XGBoost——一种把许多浅决策树依次叠加、让后面的树纠正前面错误的机器学习方法。论文的价值不只在于搭起技术桥梁,也在于诚实展示了桥的另一端:模型越忠实地追求完整Kelly仓位,样本外表现反而可能越差。本文数字和结论均来自作者论文及其回测,尚无独立复现。
不再先猜收益
Kelly准则选择让长期财富对数增长率最大的仓位。它重视复利,但对收益分布的估计误差很敏感,估错一点,就可能押得太重。
KellyBoost使用一个多输出XGBoost模型。模型先为每项资产给出一个任意分数,再用Softmax把这些分数转成非负、总和为1的权重。换句话说,它天然形成只做多、全额投资的组合。论文的八个资产腿中包含现金,因此“全额投资”不等于必须把钱全部压在风险资产上。
设模型给出的权重为 ,各资产在持有期内的收益向量为 。每条训练数据的损失是:
就是整个组合的收益。最小化这项损失,相当于最大化财富的对数增长。传统流程需要“预测收益—估计协方差—优化仓位”三步;KellyBoost没有中间收益预测,也不另设组合优化器。特征、预测误差和仓位选择都在同一个财富目标下权衡,这就是端到端组合学习。
树模型为何以前做不了这件事
神经网络通常靠反向传播训练,可以沿着最终投资目标一路计算调整方向。梯度提升树不走这条路。XGBoost要使用自定义损失,需要知道损失相对于模型输出的梯度,以及Hessian——描述损失曲率、帮助确定更新步幅的二阶信息。
作者为Kelly损失推导了闭式梯度、解析的对角Hessian和完整Hessian,并用有限差分核对导数实现。直观地说,如果某项资产当期跑赢整个组合,模型会提高它的相对分数;调整力度还会考虑当前权重和财富增长。这让树不必借用“哪项资产涨得最好”之类的替代任务,而能直接训练经济目标。
论文同时提供约两百行、只依赖NumPy的参考引擎。不过,“闭式推导”和“有限差分通过”只能说明公式与实现彼此一致,不能证明策略在未来市场有效。
它比替代目标好,但不是全场最好
作者用2003年至2026年的公开市场数据建立测试床,覆盖八类资产、最长7,871个候选特征。参数和特征只在截至2012年的开发区间选择;2013年至2026年作为未参与开发的评估区间,按约21个交易日重新决策一次。
最有针对性的比较,是固定模型类型,只更换训练目标:一边直接优化对数增长,另一边把每期表现最好的资产当作分类标签。后者会丢掉收益幅度——领先20个基点和领先20个百分点,在分类任务里都是同一个答案。
在“树或MLP”与“搜索特征或手工特征”组成的四组对照中,增长目标四次都胜过分类替代目标。四组汇总后,每个20日决策期的对数增长差为 $+0.18$,95% bootstrap区间为 $[-0.11,+0.50]$。区间仍跨过零,作者因此没有把它写成统计上已确认的优势。增长目标在四组中换手率也都较低,所以计入论文设定的交易成本后,差距没有被侵蚀,反而扩大。
但换一个问题,答案就不同了。主回测中,KellyBoost年化收益为6.2%,年化波动率23.9%,Sharpe为0.30,最大回撤为-46.2%。传统的两阶段LightGBM预测加优化器分别为8.2%、20.9%、0.40和-40.4%,在这段样本里整体更好。所有主要方法与KellyBoost的成对bootstrap区间都跨过零,因此这些名次不能视为确定结论。
更准确地优化,也会更准确地犯错
论文最值得关注的地方,恰恰是这次失利。KellyBoost会忠实寻找条件化的完整Kelly配置,而完整Kelly对估计误差敏感,容易形成集中仓位。两阶段方法先做平方误差收益预测;月度收益难以预测时,预测值会向零收缩,优化器因而给出更温和、更多元的组合。流程中的“接缝”在这里反而成了一层意外的正则化——也就是限制模型押注过猛的力量。
消融实验把这个机制展示得更清楚。精确Hessian在开发区间的选择得分为4.19,接近常数曲率版本1.43的三倍;部署后却是常数版本更好,年化收益8.3%、最大回撤-23.6%,而精确版本分别为6.2%和-46.2%。常数曲率让更新步子偏小,权重更靠近均匀配置。它没有更准确地完成Kelly目标,却因此少受估计误差伤害。
所以,KellyBoost证明的是:梯度提升树可以直接学习增长目标,而且精确二阶优化确实能把这个目标优化得更好。它没有证明完整Kelly目标适合未经收缩地部署。对量化研究而言,这个区分很重要:模型有没有学会,与它学会的东西是否值得实盘执行,是两道题。
局限与未知
- 评估期约13.6年,但月度决策数量仍少;论文报告的主要置信区间均跨过零,方法间差异尚不能排除抽样波动。
- 回测基于八个资产腿和特定公开数据流程。论文虽提供代码、数据与脚本,但目前没有第三方复现,不能外推到其他市场或实盘环境。
- 结果显示完整Kelly配置容易集中。论文提供风险厌恶参数,但主流程选择了接近对数效用的设定;如何按投资者偏好确定收缩强度,仍是部署前必须另做的决定。