你要招聘一名司机,于是在熟悉的道路上安排考试。真实路况当然比纸面试题更可信。但如果路线只允许一种开法,或者评分规则恰好照着某位候选人的习惯设计,第一名还能代表上路后的最佳选择吗?
因果推断也有类似难题。研究者需要比较不同方法能否从观察数据中找回某种处理的真实效果,可现实数据的真相通常不可见。Plasmode simulation(Plasmode 仿真)提供了一条折中路线:从真实队列重采样协变量,有时连处理变量也一起重采样,再用人为指定的模型重新生成结局。这样既保留真实数据的相关结构和复杂度,又因为效果由研究者注入,可以核对答案。
M. Ehsan Karim 在这篇论文中提醒:这种考试能暴露一个方法在哪里失败,却不能仅凭胜出证明它适合目标人群。作者把问题拆成两个互相独立的设计轴:regularity(正则性)和 projection(投影)。以下结果均来自这篇 arXiv 论文,尚无独立信源交叉验证。
第一重陷阱:真实处理会让考试越界
因果比较依赖 overlap(重叠性):在相同协变量条件下,每个人都要有一定机会接受或不接受处理。说得直白些,如果某类人必然接受处理,我们就看不到这类人不接受处理时会怎样。
一种常见 Plasmode 做法叫 sample-treatment:重采样真实记录时,把原有处理状态一起带过来。问题在于,当协变量非常细、每种组合几乎只对应一个人时,每个组合也就只带着一种处理状态。模拟数据的处理概率会逼近 0 或 1,重叠性随之消失。此时,IPW(逆概率加权)、AIPW(增广逆概率加权)和 TMLE(目标最大似然估计)所依赖的理论条件不再成立。
论文在一个真实队列仿真中报告,sample-treatment 下,使用 Super Learner——把多种机器学习模型组合起来的学习器——估计辅助模型时,TMLE 的区间覆盖率只有 0.29,AIPW-SL 为 0.58;名义目标是 0.95。覆盖率是指重复实验中,置信区间包含真值的比例。
换成 generate-treatment,即从一个人为限制在安全范围内的处理概率重新生成处理后,两者都回到 0.94。把协变量合并成较粗的分层,也让 TMLE 从 0.29恢复到 0.95。这说明问题并非“所有 Plasmode 都不可靠”,而是细粒度协变量与真实处理重采样共同制造了边界情形。
值得注意的是,使用参数化辅助模型的方法在 sample-treatment 下仍接近名义覆盖率:g-computation(用结局模型推算两种处理下平均结果)为 0.95,IPW 为 0.96,使用 logistic 辅助模型的 TMLE 为 0.93。但这不等于 IPW 普遍更强。作者的解释是,刚性的参数模型没有追踪到接近确定性的处理分配,因此暂时避开了边界,而不是模拟数据重新满足了理论条件。
Cross-fitting(交叉拟合,即把训练辅助模型和计算最终估计量的数据分开)只能修复一部分。另一组实验中,它把 TMLE 的覆盖率从 0.31提高到 0.50,把 AIPW-SL 从 0.59提高到 0.80,仍未回到名义水平。
第二重陷阱:出题人可能已经写好了赢家
即使修复重叠性,排名仍可能失真。这就是 projection。
Plasmode 必须指定一个 outcome model(结局生成模型)来制造答案。如果某个估计量采用了相同形式的模型,它就在考试中“正确得理所当然”。这不是作弊,而是出题方式带来的结构性优势。换一个现实机制,优势可能立即消失。
论文展示了清楚的排名翻转。在重叠性完好的 generate-treatment 设置中,当分析模型与结局生成模型匹配时,g-computation 的均方根误差为 0.013,优于 AIPW 的 0.018和 TMLE 的 0.016。加入分析模型遗漏的效应修饰和非线性后,g-computation 的误差升至 0.028,反而落后于 AIPW 的 0.019和 TMLE 的 0.015。
换句话说,基准并非只是在测谁更会推断,也在测谁更像出题用的模型。更逼真的协变量分布不能自动消除这种偏向。
怎样做一场更诚实的考试
作者提出 regular-plasmode algorithm。核心不是消除所有人为选择,而是把选择公开:从设有明确上下界的 propensity(倾向得分,即接受处理的概率)重新生成处理;用 standardization(标准化,即在已知生成机制下对个体结果求平均)重新计算边际真值;同时报告重叠、混杂强度和结局模型复杂度等难度坐标。
重新计算真值尤其重要。论文研究的是二元结局下的边际风险差,而注入 logistic 模型的处理系数表示条件 log-odds ratio。两者不是同一个量。直接拿注入系数给边际估计量打分,会凭空制造“偏差”。
这套做法能保证基准内部的比较落在相关理论条件之内,却仍不能保证排名迁移到真实人群。作者因此给出一句克制但重要的判断:Plasmode 是过滤器,不是担保书。
为什么值得关注
这项工作划清了基准证据的边界。如果一个估计量宣称在某类数据生成过程——即协变量、处理和结局共同产生的完整机制——中普遍可靠,那么只要合规的仿真找到一次失败,就足以反驳这个普适主张。
反过来,一种方法在单个仿真中获胜,只说明它适应该仿真的难度和生成模型。要把胜利推广到目标人群,还需要额外证明两边对各估计量同样困难;而论文指出,这种“难度迁移”无法仅靠基准数据验证。尤其在两个方法表现接近时,数据分布的小变化就可能改变名次。
因此,真正有信息量的问题不是“谁拿了第一”,而是:测试覆盖了哪些条件,哪些方法在这些条件下被明确击穿,以及获胜者是否只是碰巧匹配了出题规则。
局限与未知
- 实证部分只使用一个队列、一个目标量、一种注入效应和一套学习器组合,尚需多场景验证。
- 论文聚焦二元结局的 logistic Plasmode,没有处理随时间变化的处理、删失或生存分析。
- 作者尚未给出可由数据直接计算的“难度能否迁移到目标人群”诊断;这也正是“不能封王”的关键缺口。