你想知道戒烟会让体重增加多少。可现实中,我们不能让同一个人既戒烟、又不戒烟,再比较两个结果。研究者只能比较不同的人,并尽量排除年龄、性别、原有体重和吸烟史等差异。麻烦在于,同一份数据交给 AIPW、TMLE 和 DML 三套热门方法,软件有时会报出不同数字。到底是理论有分歧,还是软件设置没对齐?
M. Ehsan Karim 的这篇教程用一个共同的“有效影响函数”串起三套方法,再用开放的 NHEFS 数据逐项核对。它没有提出新估计器或新定理,贡献更像一次工程对账:统一问题、模型和数据切分之后,看差异还剩多少。
本文事实均来自这一篇论文及其配套代码,尚无独立信源交叉验证;文中的数值只适用于该数据和指定设置。
三条路线,其实在解同一道题
研究目标是平均处理效应(ATE)——假想同一总体人人戒烟时的平均体重变化,减去人人继续吸烟时的平均变化。要从观察数据估计它,需要三个前提:实际观察结果能对应清楚定义的处理;控制已测量特征后,两组足够可比;每类人都有可能戒烟,也有可能不戒烟。最后一项叫 positivity,也就是“重叠性”。
三套方法都需要先估计两个辅助模型,也称 nuisance models。倾向得分模型预测一个人在给定特征下戒烟的概率;结果模型预测给定戒烟状态和个人特征时的体重变化。这两个模型不是研究终点,却决定了最终调整是否可靠。
连接三种方法的是有效影响函数(EIF)。影响函数可以理解为:每条观测会把最终估计往哪个方向拉、拉多少。有效影响函数则是在给定统计框架内,能够达到最低渐近方差的那一个。它把结果模型给出的初步预测,与按倾向得分加权的预测误差组合起来。
这也带来“双重稳健性”:结果模型正确时,倾向得分模型即使有误,估计仍可能一致;反过来也一样。两边同时错,保障才会失效。这里的“稳健”不是说任何机器学习模型都能随便选,而是一个有明确条件的统计性质。
AIPW、TMLE、DML到底差在哪
AIPW 最直接。它先用结果模型算一个答案,再把有效影响函数中的加权残差作为修正项加回去。
TMLE 不直接把修正项贴到答案上。它根据倾向得分,对初始结果模型做一次有方向的微调,直到有效影响函数的样本均值为零,再从更新后的模型读出结果。两者走法不同,瞄准的是同一个方程。
DML——双重或去偏机器学习——在这项 ATE 分析里并不是第三种组合公式。它仍使用 AIPW 的正交得分,重点是交叉拟合:把数据分成若干份,用一部分训练辅助模型,再到未参与训练的那部分计算得分。这样可以减少灵活模型在训练数据上“自己给自己打分”造成的偏差。
论文因此把方法拆成两个维度:一边是“一步修正”与“定向更新”两种组合规则;另一边是全样本拟合、普通交叉拟合和双重交叉拟合三种训练方案。二乘三,正好得到六个双重稳健估计器。所谓双重交叉拟合,是让倾向得分模型和结果模型分别在互不重叠的数据折上训练。
把配置对齐,名字就没那么重要
论文分析了 1,566 名 NHEFS 参与者,其中 403 人戒烟,1,163 人继续吸烟。目标是估计 1971 至 1982 年间,戒烟对体重变化的平均影响。
作者先检查重叠性。估计倾向得分的范围为 0.044 至 0.759;预设截断区间是 0.025 至 0.975,没有任何观测需要截断。这说明在这份样本中,两组有较好的共同支持,适合用来核对三条路线。
为公平比较,作者让各方法共享同一个 Super Learner 候选库。Super Learner 是一种集成方案:让多个候选模型通过交叉验证竞争,再把预测表现较好的模型加权组合。该库包含样本均值、普通回归、弹性网、随机森林和多元自适应回归样条。各方法还使用相同的数据折和同一倾向得分截断规则。
在这些条件下,手工构建的六个双重稳健估计结果落在 3.32 至 3.42 kg。只看全样本版本,AIPW 为 3.32 kg,95% 置信区间为 2.50 至 4.14 kg;TMLE 为 3.33 kg,区间为 2.50 至 4.15 kg。两者只差 0.01 kg,远小于各自置信区间的宽度。
接着,作者比较自建实现与 tmle、AIPW、DoubleML、tmle3 软件包。使用各自默认设置时,结果扩大到 3.32 至 3.49 kg。匹配学习器库和数据折,并通过重复切分平均掉单次划分的随机波动后,三个共享学习器库的实现相差不超过 0.01 kg。
这组结果支持一个实用判断:在这份重叠良好的数据上,软件间的差距主要随辅助模型库、数据折和重复次数变化,而不是随 AIPW、TMLE 或 DML 的名称变化。不过,这只是单项实证核对,不能据此排除截断规则、定向更新方式、标准误计算等实现细节在其他场景中的影响。
真正应该先问的是:数据允许比较吗
论文把重叠性诊断放在估计器选择之前。道理很朴素:如果某类人几乎一定戒烟,另一类人几乎一定不戒烟,数据中就没有相应的对照。三种方法可以重新加权、修正预测或交叉拟合,却不能凭空制造缺失的比较对象。
论文用一个无重叠案例展示了失败情形:当违反的是理论上的 positivity,且没有额外外推假设时,原总体的 pooled ATE 无法识别,三类估计器的有限样本答案也可能明显分化。若只是有限样本中的近似重叠不足,结论还取决于目标总体如何定义,不能一概而论。
为什么值得关注
这篇教程最有价值的地方,不是宣布三种方法“完全一样”,而是把理论差异、实现差异和工作流差异拆开。对实践者来说,看到不同软件报出不同答案时,应先核对研究目标、辅助模型、数据折、重复次数和截断规则,再讨论估计器标签。
它也给出了一条更重要的优先级:先检查数据里有没有可信的对照,再选择计算路线。论文提供开放的 R 代码,可复现文中全部数字。
局限与未知
- 结论来自一篇教程及其单一实证分析,3.32–3.49 kg 和 0.01 kg 都不是普遍性能保证。
- “剩余差异主要来自学习器库、folds 和重复次数”是这次对账的解释,不能排除其他软件实现细节。
- 三者共享有效影响函数,只限于相同 estimand、识别假设和相应实现框架;不能泛化为所有 AIPW、TMLE 与 DML 天然等价。