假设一份健康调查里,年龄已经填了,但后续化验值空着。完整案例分析会把这一整行删掉,连年龄这条有用信息也不要。Bolouri 的论文研究的正是这种代价:估计平均处理效应——处理对人群的平均影响——时,完整案例法究竟浪费了多少信息。
论文考察两个按顺序收集、且可能缺失的混杂变量。混杂变量会同时影响是否接受处理和最终结局,比如年龄既影响用药选择,也影响康复。作者在“缺失随机”(给定已观测信息后,缺失不再取决于未观测值本身)的框架下证明:若顺序缺失法与完整案例法都成立,后者的效率损失可精确写成一个非负量;只要中间变量在第二阶段缺失处仍提供额外信息,损失就严格大于零。也就是说,删掉半完整记录会扩大估计波动,并非只是少用几个人。
更关键的是,如果第二阶段是否缺失取决于这个中间变量,完整案例法可能不再只是精度较差,而会产生持续偏差。作者也提醒,理论上的效率优势未必直接变成有限样本中的更窄区间:其 Gaussian 压力测试出现明显区间覆盖不足,甚至反转了精度排序。