预测明天销量是100件,还不够决定该备多少货:真正有用的是,80%的情况下会落在哪个范围。问题在于,这个范围该参考模型训练时留下的误差,还是参考它预测陌生数据时的失手?前者便宜但可能显得过于乐观,后者更接近上线场景,却要反复回到历史时点做预测,可用数据也更少。
这篇论文给出了一个反直觉的结果。作者用 M4 竞赛的14,407条月度序列,测试 Theta、指数平滑和 ARIMA 三类点预测模型,并比较四种误差后处理方法。他们没有直接照搬训练内残差,而是用各模型自身的误差尺度,校正不同预测期限的不确定性。在12种“模型—方法”组合中,训练内校准有11种胜过样本外校准,而且预测期越长,优势通常越明显。按 CRPS——衡量整条概率分布质量的分数,越低越好——所有后处理方案平均都优于传统基准,最高改善4.6%。这说明,训练内误差未必该丢掉;经过尺度修正,它可能用更低计算成本给现有点预测补上更可靠的概率范围。不过,最佳做法仍随基础模型和预测期限变化。