想象一场预测比赛:你先用全班这次考试的成绩排座次,再拿同一批成绩检验座次是否“预测准确”。高分未必说明你会预测,也可能只是答案被用过两遍。Ni、Medda 和 Okhrati 研究的正是这种排名幻觉:排名要靠整批观测相互比较;当真实结果既参与构造排名,又参与评价预测,共享数据会额外制造关联。
论文把评分拆成真正想测的预测关联,以及“重复使用参照数据”产生的交互项,并给出检验这部分交互的方法。最醒目的结果来自北京空气质量档案:按作者基于该档案经验分布的计算,七个已训练预测模型的预期共享评分中,91.4% 至 94.5%可由交互项解释。换句话说,榜单上的大部分亮眼表现可能来自评分结构,而非对新数据的预测能力。
作者建议用独立数据完成训练、评估和验证,并把整条轨迹——同一对象跨多个时点的一串观测——作为抽样单位。另一项配对类别—对照的零效应实验中,改用不同参照后,1,000个面板里的拒绝次数从402次降到41次。它提醒模型榜单和预测竞赛:样本外评估不只是形式要求,参照数据是否被重复使用,也会直接改变结论。