像让一群人共同判断风险:如果每个人看的材料几乎一样,人数再多,也可能一起犯错。随机森林也是如此——它让许多决策树投票,但树之间越相似,互相纠错的空间越小。这项工作改造了 Bagging(反复有放回抽样、分别训练模型再汇总结果):用 Dirichlet 分布生成一组随机样本权重,并以一个浓度参数调节每棵树看到的数据差异,目标是在不削弱单棵树的同时降低树间相关性。
作者提出两种版本:DM 按随机概率重新抽样,DW 保留全部训练样本、只改变各样本权重。实验覆盖 15 个公开分类数据集,每种方法使用 200 棵树和相同基础设置,并在相同数据划分上运行 10 次。以 adult 数据集为例,标准随机森林的分类准确率为 0.8491,DM 为 0.8561,DW 为 0.8567;作者称两种方法整体上常能超过对照方法,额外运行时间可忽略。不过,现有结果仍是受控基准测试,尚不能说明它在真实业务数据上也会稳定占优。