医院不会给每个人做同样的检查。症状更明显、风险更高的人,往往更容易进入下一轮检测。于是,研究者最后拿到的结果并不是普通的“有些数据没填”,而是一份经过筛选的样本。若直接比较长期新冠患者与其他人的检测结果,差异可能来自筛选规则,而不是真实关联。
这篇论文以 RECOVER 成人和儿童观察队列为例,讨论两阶段抽样——先收集便宜的辅助信息,再据此挑选部分人接受昂贵检测。成人队列尤其复杂:参与者会在多次随访中反复获得入选机会,31 项检测分别受当次辅助变量、资格条件和此前是否已检测影响。
作者提出用逆概率加权修正:一个人越不容易被抽中,一旦进入样本,就获得越大的分析权重。其框架还把失访、检测完成率差异,以及长期新冠组与对照组的基线差异一并纳入。核心提醒很朴素:只要“谁被检测”不是随机的,分析就必须重建这套选择过程;把它当成普通缺失,可能直接扭曲总体比例和组间关联。