假设医生会根据病情变化调整用药,而病情记录偏偏缺了几次。研究者想知道:这种治疗平均有没有效果?麻烦在于,缺掉的记录不仅影响我们怎么看病情,也可能改变谁看起来接受了什么治疗。此时,随手把空格补上,或者只分析记录完整的人,都可能把答案推向不同方向。
Ben Swallow、Lars Brestrich 和 Victor Velasco-Pardo 在一项 2026 年 7 月提交至 arXiv 的模拟研究中,专门考察这个问题:当时变混杂与缺失数据同时出现时,不同缺失值处理方法会怎样影响平均处理效应估计。研究覆盖 48 种情景,每种重复模拟 500 次。需要先说明,本文可获得的材料只披露了论文摘要,没有分情景数值、置信区间、代码或完整结果表。因此,下文能讲清比较框架和总体发现,但不能判断差异究竟有多大、是否稳定。
难点不只是“表格里有空白”
这项研究关心的是平均处理效应,也就是 ATE(Average Treatment Effect):同一目标人群如果全部接受处理,与全部不接受处理,平均结局会相差多少。现实中,一个人只能接受其中一种安排。研究者看不到另一条人生路径,只能依靠研究设计和统计假设,构造那个没有发生的“反事实”。
纵向观察研究让这件事更棘手。所谓时变混杂,是指混杂因素会随时间变化:它既影响下一次是否接受治疗,也影响最终结局,而且还可能被此前的治疗反过来影响。比如,病情变化会影响医生下一步是否加药,也会影响患者的预后;但病情本身又可能因为此前用药而改变。
现在再加入缺失数据。问题就不再是“填哪个数字比较像”,而是“为什么这个数字没有被记录”。如果缺失可以由已经观测到的信息解释,通常更容易校正;如果未记录的真实值本身会影响它是否缺失,也就是 MNAR(Missing Not At Random,非随机缺失),单靠现有数据往往无法识别缺失背后的规律。
四种补法,放进同一套压力测试
研究者生成合成数据,在 48 种情景下改变四类因素:缺失机制、缺失比例、缺失发生的位置,以及样本量。缺失被放入处理变量和结局变量中。这里的“位置”很重要:少了一次治疗记录,与少了最终结局,并不是同一种信息损失。
研究比较了四种常见做法:
-
Stratified hot deck imputation(分层热卡插补):先把相似记录分组,再从同组已有记录中找一个值填入。
-
Single mode imputation(单次众数插补):用最常出现的类别填补缺失值。做法直观,但每个空格只得到一个固定答案。
-
MICE(Multiple Imputation with Chained Equations,链式方程多重插补):通过一组相互连接的模型,多次生成可能的完整数据,再综合多次分析结果。它承认缺失值存在不确定性,而不是假装自己恢复了唯一真值。
-
Complete-case analysis(完整案例分析):只保留所有相关变量都不缺失的记录,其余样本不进入分析。
插补并不是把丢失的真值找回来。它只是根据已观测数据填入一个或多个合理值。如果模型遗漏了时间顺序、治疗史或缺失原因,偏差仍会一路进入最终的因果估计。
完成缺失值处理后,研究使用 logistic regression(逻辑回归,一种估计二元结果概率的模型)结合 propensity score weighting(倾向评分加权)估计 ATE。倾向评分可以理解为:根据已有特征,估计每个人接受处理的可能性,再通过加权让处理组和未处理组更可比。
研究用三类指标评价结果。Coverage(覆盖率)看区间估计在重复实验中有多少次包含真实效应;absolute bias(绝对偏差)看估计值离真实值多远;empirical standard error(经验标准误)看重复模拟所得估计有多大波动。
真正决定结果的,是“为什么缺”和“怎么补”
据论文摘要汇总,性能主要由缺失机制和处理方法驱动。MICE 总体上取得了更好的覆盖率和更低的偏差。这个结论有方法推荐意味,但摘要没有说明它好多少,也没有证明它在全部 48 种情景中都占优。因此,更准确的理解是:在这套合成数据设定里,MICE 的总体表现较好,而不是“MICE 在时变混杂下总是最佳”。
缺失发生的位置同样重要。这提醒我们,缺失数据不能只用一个总比例概括。两份数据都可能缺失 20%,但如果一份主要缺治疗记录,另一份主要缺结局,最终估计受到的影响可能不同。论文摘要没有给出各位置对应的具体结果,因此还无法进一步比较。
研究还报告,缺失比例和样本量主要影响 positivity violations(正值性违背)。正值性要求:在研究关心的各种特征组合下,人们都要有接受和不接受处理的可能。如果某类人几乎必然接受某种处理,就很难从数据中找到可比对象。模拟中的正值性问题在 MNAR、高缺失率和小样本情景下最明显。不过,这只是该模拟设置中的联系,不能写成适用于所有研究的普遍规律。
摘要还称,倾向评分模型能够较充分地控制轻度至中度混杂造成的 exchangeability violations(可交换性违背)。可交换性要求,在完成调整后,处理组与未处理组在影响结局的因素上足够可比。强混杂则带来覆盖率的小幅下降。由于摘要没有给出“充分”和“小幅”的数值定义,也没有展示不同情景的例外,这部分只能视为方向性的汇总。
为什么值得关注
真实世界因果分析常把两个问题分开处理:先决定如何填补缺失值,再用一套因果方法估计效果。这项研究的价值,是把两步放回同一个系统里检查。缺失值处理不是分析前的清洁工作。它会改变样本构成、处理概率和可比性,因而可能直接改变 ATE。
48 种情景、每种 500 次重复,也让研究者能观察同一种方法在不同条件下是否稳定,而不是只看一次分析的结果。它提出的核心提醒很朴素:选择缺失值方法时,不能只问“哪个算法常用”,还要问缺失为什么发生、发生在哪里,以及剩余数据是否仍支持处理组与未处理组之间的比较。
局限与未知
-
研究使用合成数据,结论依赖数据生成过程、二元变量设定、缺失机制和倾向评分模型规格,不能直接外推到真实观察性研究。
-
当前材料未提供分情景数值、置信区间、代码或完整结果表,无法判断 MICE 的优势有多大、是否稳定,以及哪些情景可能例外。
-
MNAR 通常不能仅凭观测数据验证。相关模拟结果尤其依赖研究者预先设定的缺失规律,而这套规律与真实世界是否吻合,摘要没有回答。