如果医生发现,某种治疗在年轻患者和年长患者身上的效果似乎不同,结论未必真来自年龄。病情严重程度可能记录不全,却同时影响医生选药和患者结局;随访中又有人失联,只留下“至少活到这一天”的不完整记录。此时,普通模型很容易把隐藏偏差画成一条漂亮的个体化治疗曲线。
Zijun Gao、Kyounggeui Hong、Leyi Ma、Qianli Wu、Zachary Izzo 和 Ruishan Liu 提出的 Negative Control Causal Survival Forests(NC-CSF),试图同时处理这三个问题:看不见的混杂、被删失的结局,以及因人而异的治疗效果。论文目前来自同一份 arXiv 原文,模拟和临床结果尚无独立复现,以下效果数字均为作者报告。
森林看到差异,却未必看见原因
生存分析研究的是“事件多久发生”,事件可以是死亡、复发或急性肾损伤。现实中,研究结束时有人尚未发生事件,也有人提前失联。研究者只知道事件时间超过某个值,这叫右删失。
因果生存森林(causal survival forests,CSF)用许多决策树寻找治疗效果随患者特征变化的模式,不要求研究者先写死一条简单公式。它适合估计异质性治疗效应(HTE)——也就是同一种治疗对不同人是否作用不同。
但许多现有方法依赖一个强假设:所有同时影响治疗选择和结局的因素都已记录。观察性研究往往做不到。比如病情严重程度只被粗略记录,医生可能据此选用更强治疗,而病情本身也影响生存。森林能切出细致人群,却可能把这个未测混杂误认成治疗差异。
用“本不该有作用”的变量照出偏差
NC-CSF 的关键,是把负对照(negative control)接进森林。负对照是按科学常识不应产生目标因果作用、但会受到相似隐藏因素影响的变量。论文使用两类代理:一种与潜在混杂有关、但不受治疗影响;另一种与治疗选择有关、但不直接影响结局。治疗前测量有时可以扮演这类角色。
直观地说,研究者看不见隐藏混杂本身,却可能看见它留下的两道影子。方法用“桥函数”把这些代理变量与潜在的治疗、结局机制连接起来,再只依靠可观测数据构造训练损失。负对照不是一台自动去偏机器;只有代理确实携带足够信息,并满足相应的排除和识别假设时,这座桥才站得住。
删失则通过经过删失校正的伪结局处理。模型还使用 cross-fitting——把估计辅助模型和估计治疗效果的数据分开轮换,以降低过拟合——并加入 Neyman orthogonalization。后者可以理解为给最终估计加一层缓冲:倾向评分、删失机制和桥函数等辅助量估得稍有偏差时,一阶误差尽量不直接传到治疗效果上。论文证明其得分对这些 nuisance functions(服务于主目标的辅助函数)具有局部正交性,并给出局部双重稳健性质。
数字说明了什么
作者在不同混杂强度、代理质量、协变量维度和删失机制下做了模拟;删失实验固定约 35% 的删失率。共同配置的汇总结果中,NC-CSF 估计限制平均生存时间(RMST,即只累计到指定期限的平均生存时长)时,RMSE 为 0.0994;去掉负对照桥、其余流程保持一致的 Censored Baseline 为 0.1662。按表中数值计算,误差约低 40%。估计指定时点生存概率时,两者 RMSE 分别为 0.0613 和 0.0788,约低 22%。
这个“匹配消融”比跨软件比较更有解释力,因为它保留相同的预处理、删失校正和森林家族,只拿掉负对照桥。与外部方法中表现最强的 grf R-CSF 相比,NC-CSF 的 RMST RMSE 从 0.1211 降至 0.0994,生存概率 RMSE 从 0.0686 降至 0.0613。它仍未追上能直接看见潜在混杂的合成数据 Oracle:后者两项 RMSE 分别为 0.0516 和 0.0361。
临床数据给出的不是治疗处方
在 ACTG175 HIV 数据上,作者分析了 1,083 人的 ddI 单药与 ZDV+ddI 联合治疗。NC-CSF 拟合出更明显的年龄差异:年轻参考人群的 RMST 增量略为负,到中年转正;重新运行的 R-CSF 则在展示年龄范围内一直为正。作者强调,年轻人的负值不能直接解释为 ZDV 有毒,逐年龄估计的区间也较宽,因此这里只能视为探索性比较,不能据此制定治疗规则。
在含 5,735 名重症住院患者的右心导管数据中,NC-CSF 给出的 30 天生存平均治疗效应为 -0.0433,95% 置信区间为 [-0.0649, -0.0217],方向与表中其他估计一致。不过该数据没有因果真值,作者把它定位为一致性检查,而非准确性证明。
论文还报告了 MIMIC-IV 中 tacrolimus 与 CYP3A 抑制剂的分析:NC-CSF 在已知药物相互作用组中识别出更强的肾损伤风险信号,在惰性对照组中未发现清晰效应。供稿原文的相关表格数值缺失,因此不能进一步判断效应大小和区间。
为什么值得关注
这项工作的价值不在于宣称“森林解决了隐藏混杂”,而在于把三个通常分开处理的问题放进同一训练框架。它既保留森林寻找人群差异的灵活性,又让删失校正和负对照信息直接参与分裂与拟合。作者还提供端到端 Python 实现,并处理辅助函数估计与 clipping(把极端估计截在合理范围内)等有限样本细节;但材料未独立确认代码仓库的公开可用性和复现状态。
局限与未知
- 负对照是否有效,无法仅凭观测数据检验。代理变量太弱、桥函数问题病态或设定错误时,正交化只能减轻误差传播,不能凭空恢复隐藏信息。
- 当未观测因素本身也改变治疗效果时,NC-CSF 的目标一般是加权异质性效应,不一定等于通常所说的条件平均治疗效应(CATE)。
- 理论结果覆盖固定或独立学习出的“诚实”亚组,但不证明递归生长的森林一定恢复唯一正确的人群划分;真实数据结果也缺少可观测的因果真值。