一个数据点偏得离谱,就一定该删吗?未必。Ting、Gorbachev 和 Shen 提出,异常检测不该只看一个值有多罕见,而要看它会不会实质改变实验结论。论文举例:在含约 100 万个近似正态分布观测的实验中,一个偏离均值 10 个标准差的点极其少见,却只让 z 检验统计量增加 0.01——也就是把假阳性率从 5%推到约 5.1%。它很扎眼,但影响很小。
作者的方法直接估算候选异常点会把假阳性率推高多少。假阳性率指实际上没有效果,却被实验误判为“有效”的概率。方法先把数据随机分组,再用 A/A 实验——把处理组和对照组视作没有真实差异——建立误报基准,并比较保留与替换候选异常点后的检验结果。这样,筛选门槛可以对应实验者真正关心的风险,例如是否能接受误报率从 5%升到 7%。代价是方法依赖随机分组,并假定移除异常点后中央极限定理近似可用、处理效应较小。