体检表里,有人漏填收入,有人缺血压,还有人收入填了、血压却空着。现实数据常这样东缺一块、西缺一块。论文研究的正是“非单调缺失”:缺失没有固定顺序。在 MAR(给定已经看到的信息后,缺失概率不再取决于那个没看到的值)条件下,作者为非参数极大似然估计建立了渐近理论,也就是判断样本增多后,估计能否逼近真相、误差如何缩小。
最值得注意的是密度估计结果。作者称,只要再满足自然的正值条件,用有限高斯混合构成“筛子”——让候选模型随样本增加而逐步变丰富——就能在任意给定的 Hölder 平滑度下,达到完整数据时的极小极大收敛速度,仅多一个对数因子;缺失本身只进入常数,不改变速度。换句话说,杂乱缺失会让估计更吃力,却未必改变它随数据量改善的基本节奏。实际计算可用直接处理不完整数据的 EM 算法近似完成;不过这些结论依赖 MAR 与正值条件,不能覆盖所有缺失机制。