你在周一交卷,周五老师改正了题目中的错误。几个月后,有人拿周五的题目重做,再把成绩与你周一的成绩相比。对方确实答得更准,但这场比赛并不公平:他看到了你当时没有的信息。
预测回测也会发生这种“时间穿越”。回测(backtesting)是假装回到过去,在多个历史时点重新预测,再与后来发生的结果比较。它最重要的纪律是:每一步只能使用当时已经公布的信息。Johannes Bracher 和 Sebastian Funk 的新论文复核了一项 COVID-19 住院预测研究,结论是:一个看似明显击败 CDC 基线的系统,几乎全部优势都可能来自违反了这条纪律。
这项判断目前来自 Bracher 和 Funk 的单篇 arXiv 论文。它针对 Aygün 等人 2026 年发表于 Nature 的案例重新分析,并使用了原作者应请求分享的复现材料;供稿未包含原论文回应或独立复核。
11% 的领先是怎么来的?
Aygün 等人提出的 ERA(Empirical Research Assistance)把大语言模型与树搜索结合起来,自动生成面向量化目标的软件。其中一个案例回顾性预测了 2024/25 season 的美国 COVID-19 住院情况,覆盖 52 个州和地区,预测未来 0 至 3 周。
原研究报告,ERA 的 Google Retrospective 方法把平均 WIS 从 CDC Forecast Hub ensemble 的 29.1 降到 25.9,改善 11%。WIS(Weighted Interval Score)是这项研究采用的预测评分,数值越低代表表现越好。CDC ensemble 则是集合多个团队预测的综合结果,也是这里的现实世界基线。
问题不在评分怎么算,而在模型看到了哪一版历史。
疫情监测数据发布后经常会被修改。迟到的报告会补进来,错误会被纠正,分类口径也可能变化。因此,今天下载到的“2024 年数据”,可能比预测者在 2024 年当周看到的版本完整得多。这叫数据修订。
如果回测直接使用季末整理好的最终数据,模型即使没有读取未来结果,也获得了当时不存在的线索。这就是信息泄漏——评测无意间把未来信息塞进了模型输入。
把修订幅度拆开,优势就露出来了
Bracher 和 Funk 发现,ERA 的领先主要集中在数据后来被大幅修改的时段。
最醒目的日期是 2024 年 12 月 28 日。该时点的平均 WIS 从 CDC ensemble 的 73 降至 49,单独贡献了总性能差距的 28%。论文指出,节日期间的数据尤其容易发生修订。
研究者随后挑出最后一个可用数据点修订最强的 9 个预测实例。它们只占全部 1430 个实例的一小部分,却贡献了总 WIS 差距的 20%。在这些实例中,Google Retrospective 的平均 WIS 为 88,CDC ensemble 为 189,相差超过一倍。
这并不一定说明前者更会预测。CDC ensemble 当时只能根据不完整、后来被证明不可靠的实时数据作答;Google Retrospective 在回测中使用的却是事后整合数据。两边拿到的“试卷”不同。
更系统的分组结果也呈现同一模式。研究者按照最后一个数据点后来的修订幅度,把样本分成五组。在相对修订不超过 1% 的样本中,两种方法的相对 WIS 为 1.00,几乎完全持平;当修订达到 25% 或以上时,相对 WIS 降到 0.69,也就是 Google Retrospective 显示出 31% 的改善。按绝对修订幅度分组,结论同样如此:修订越强,回测中的优势越明显。
因此,两位作者认为,原研究报告的 11% 改善几乎都可由信息泄漏解释。ERA 能与 CDC ensemble 打平仍然值得注意,但这和“明显击败”是两件不同的事。
真正公平的回测,需要保存过去
解决办法听起来朴素:不要用今天的数据库假装回到昨天。
严格回测需要实时数据快照(vintage data),也就是保存每个发布日期当时可见的数据版本。若预测日期是 12 月 28 日,模型就只能读取截至当天发布的快照,不能读取之后补齐和纠正的记录。论文也建议,新模型最好参加前瞻性评测:在现实时间里提交预测,让所有参赛者面对相同的信息条件。
这项提醒不只适用于疫情。Bracher 和 Funk 将它视为对 AI-assisted predictive modelling——用 AI 协助建立预测模型——的警示:凡是输入数据会在发布后修订,回顾性评测都可能出现同类漏洞。不过,这是从疫情案例向其他领域作出的风险提示,并非论文已经逐一验证了所有预测场景。
它没有证明 ERA 无效
这篇复核刻意区分了“回测设计有问题”和“方法本身没有能力”。据 Bracher 和 Funk 转述,ERA 后来经过较大修改,以 Google SAI Ensemble 的形式参加了 2025/26 season 的实时预测,并在涉及三种疾病的榜单中居首。新版本使用 ensemble(把多个模型的结果组合起来),而不是此前的模型选择,赛季间的相对表现也可能变化,因此这项结果不能反过来证明旧回测公平,但说明方法本身不应被一次评测漏洞一笔抹杀。
局限与未知
- 当前指控与量化复核来自 Bracher 和 Funk 这一独立信源;原研究作者是否接受其解释,材料中尚无正式回应。
- 复核把性能差距与数据修订联系起来,证据包括极端实例和分组结果,但材料没有提供置信区间或统计显著性检验。
- 对其他预测领域的影响目前是机制层面的警告。是否造成同等幅度的偏差,仍需逐个数据集和评测流程检查。
这篇论文最重要的提醒很简单:回测不是把旧日期填进程序,而是要重建旧日期的信息边界。模型可以知道很多,但评测者必须确保它不知道未来。