让同一个人先后接受两种处理,再比较自己的两次结果,看起来比找两组人更稳:许多固定的个人差异被抵消,测量也更精确。但 Liu 与 Zhang 指出,这种“自身对照实验”要识别平均处理效应,仍有一个关键前提:两种处理顺序的平均遗留效应必须相等。遗留效应,就是第一次处理继续影响第二次结果。它不必完全为零,但若两种顺序受影响的程度不同,合并两期数据得到的其实是处理效应再加上一半的遗留效应差距。
更反直觉的是,先检验有没有遗留效应、检验未拒绝后再合并数据,也不可靠。论文证明,在温和条件下,这项检验的统计功效——发现真实差异的能力——低于只用第一期数据检验处理效应;据此选择分析方法,置信区间通常还会覆盖不足。尤其当合并数据确实更精确、也就是这种设计最值得采用时,覆盖不足恰好会出现。作者因此仍支持自身对照设计,但建议研究者事先说明识别假设,并报告结论对遗留效应差距有多敏感。