Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER H 44 约 1 分钟

选择性抽样,不能当成普通缺失

检测对象若由症状等信息筛选,直接分析会偏;逆概率加权可补偿这种选择。

医院不会给每个人做同样的检查。症状更明显、风险更高的人,往往更容易进入下一轮检测。于是,研究者最后拿到的结果并不是普通的“有些数据没填”,而是一份经过筛选的样本。若直接比较长期新冠患者与其他人的检测结果,差异可能来自筛选规则,而不是真实关联。

这篇论文以 RECOVER 成人和儿童观察队列为例,讨论两阶段抽样——先收集便宜的辅助信息,再据此挑选部分人接受昂贵检测。成人队列尤其复杂:参与者会在多次随访中反复获得入选机会,31 项检测分别受当次辅助变量、资格条件和此前是否已检测影响。

作者提出用逆概率加权修正:一个人越不容易被抽中,一旦进入样本,就获得越大的分析权重。其框架还把失访、检测完成率差异,以及长期新冠组与对照组的基线差异一并纳入。核心提醒很朴素:只要“谁被检测”不是随机的,分析就必须重建这套选择过程;把它当成普通缺失,可能直接扭曲总体比例和组间关联。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 数据板块