看到 A/B 测试第一次“显著”,就像球刚过线便吹终场哨:结果看似明确,规则却悄悄变了。p 值是在“两个版本其实没有差别”的前提下,出现当前这么极端或更极端数据的概率。0.05 的门槛只保证在预先约定、固定时点检验时,长期约有 5% 的无效实验被误判;每天查看一次,等于反复给随机波动过线的机会。
Mila Sudarikova 用模拟量出了差距:A、B 两组真实转化率都为 10%,每天各来 1,000 名访客,连续运行 30 天,共模拟 60,000 次。只在最后一天检验,假阳性率为 5.0%;每天检验并在 p 值首次低于 0.05 时停表,假阳性率升至 27.7%。查看 2、5、10 次时,这一比例也依次升到 8.3%、14.0% 和 19.1%。这些数字来自作者的模拟,未代表真实业务中的统一比例。
关键不是禁止中途看,而是把“何时看、何时停”写进统计设计。序贯检验会预先设置随时间变化的判定门槛,既允许提前发现明显效果,也控制整段实验的误报率。提前计算样本量同样不能自动为反复偷看开绿灯。