假设一项健康研究里,状态较差的人更容易失访。研究者要估计治疗效果,既要补上看不见的结局,也要判断谁接受了治疗、谁的结局能被观察到。问题在于:把后两件事预测得更准,最终的因果效应反而可能估得更差。模型可能过度关注那些很会预测“是否治疗”、却几乎无助于解释结局的变量,由此产生极端权重,放大有限样本中的波动。
Johan de Aguas 提出的协作式 Targeted learning(先拟合辅助模型,再围绕目标因果效应专门修正)不要求倾向模型在所有方向上还原完整机制。它用交叉拟合产生的“伪结局”——专门编码结局模型残余偏差的训练信号——学习低维的治疗与缺失表示,让模型重点修正真正会传导到目标效应的误差。论文给出的关键结论是:即使结局模型和倾向模型都有偏差,只要倾向部分与这些特定误差方向对齐,估计方程仍可保持无偏。作者称模拟实验显示有限样本偏差下降,但原文未给出可在此概括的统一幅度。