像等体检结果时不停刷新页面:看得越勤,越可能撞上一个偶然的“正常”。数据流也一样。若每来一批数据就用普通检验检查一次协变量平衡——校正后两组在年龄、地区等特征上是否足够相似——即使校正并不合格,也可能被过早宣布成功。
Seungjin Choi 提出一种可随时查看的确认程序。使用者先固定要检查的特征及容许误差,再用置信序列——一组在所有查看时点同时有效的区间——持续圈定目标人群的真实特征均值。只有当每个仍然可能的均值都落入容许范围,程序才确认平衡并允许停止。论文证明,只要至少一项特征实际超出容差,整个监控期间曾经误报平衡的概率,都不超过预先设定的水平。
这个保证只覆盖事先选定的特征和容差,并不等于校正处处正确。若原始数据量有限,还须收紧确认范围,把加权后均值本身的不确定性算进去。它的价值很直接:数据可以边到边验,但频繁查看不再偷偷增加假阳性。