一项试验招了 1000 人,但关键检查又贵又慢,预算只够做 400 份。最省事的办法是随机挑 400 人。可如果常规化验、既往病历等便宜信息已经覆盖全员,能不能把有限名额更多留给那些“结果较难预测”的人?
Wang 等人的预印本研究的正是这件事:利用全员可得的辅助变量,自适应地决定测量谁的主要结局,同时让负责抽样的统计人员看不到治疗分组。作者希望减少昂贵测量,又不破坏随机试验的推断。不过,目前证据全部来自同一篇预印本;效果数字出自作者的模拟与重抽样研究,并非前瞻性临床试验的独立验证。
先随机测一批,再把钱花在难题上
这里有两层随机。随机对照试验(RCT)先随机分配治疗,使两组大体可比;这篇论文再从参与者中做概率抽样,只给其中一部分人测量昂贵结局。
辅助变量是全员容易取得、又能预测主要结局的信息,比如常规化验、既往病历、便宜的检测或较早出现的短期结果。论文给出的示例是:1000 人按 1∶1 分到两个治疗组,昂贵结局的预算约为 400 份。研究者先随机抽 150 人完成测量,用这批数据训练两个“工作模型”:一个预测结局,另一个估计预测误差还剩多大。
第二个模型很关键。抽样系统不是单纯寻找“预测结果最高”的人,而是寻找“现有信息仍难以预测”的人。某人的预测很不确定,入样概率可能设为 0.80;另一人的预测很稳定,概率可能是 0.20。随着已测结局增加,两个模型还可以在预先安排的节点重新拟合,再调整下一批人的抽样概率。
这有点像老师用有限时间抽查作业:不是只看成绩最好的或最差的学生,而是多检查那些仅凭平时表现最难判断的人。但临床试验多了一条硬约束:每个人被测量的概率必须已知且不为零,实际采用的概率也要完整记录。
少测的人,怎样代表全部人?
揭盲——也就是试验结束后公开谁接受了哪种治疗——之后,作者用 augmented inverse probability weighting(增广逆概率加权)估计两组平均结局。
它分两步。第一步,模型为每位参与者提供一个预测值。第二步,用真正接受昂贵测量的人校正这些预测。逆概率加权的意思是:越不容易被抽中的人,一旦入样,就代表更多相似的人。例如入样概率为 0.2,其校正权重会比入样概率为 0.8 的人更大。
据论文作者的理论结果,只要抽样遵守其设定——包括随机抽取,抽样概率已知、正确记录且不为零——即使工作模型写得不对,估计量对“假如所有人都测了结局时得到的治疗差异”仍然无偏。模型好坏主要影响精度,而不是靠模型本身保证有效性。
如果抽样规则随着数据积累反复更新,普通的独立抽样分析不再直接适用。作者使用 martingale central limit theorem(鞅中心极限定理,一类处理按顺序产生、每一步都依赖既有信息的随机过程工具)来建立大样本近似,并据此构造 Wald interval——用估计值加减若干个标准误得到的置信区间。前提是每套规则都要在用于下一批参与者之前固定,不能看到其尚未测量的结局后再改规则。
盲法不是装饰,也不是免费午餐
负责选择测量对象的人看不到治疗分组。这样可以避免按已知组别或初步疗效有意改变采样,也更符合盲法试验的运行方式。两个治疗组只在最后揭盲后比较。
代价是抽样可能没那么高效。如果两组的结局波动程度不同,知道分组的抽样者原本可以为两组设置不同概率;盲法设计只能共用一套规则。另一个损失来自条件治疗效应,即治疗效果可能随辅助变量而变:合并两组训练预测模型,会把一部分组间差异当成难以解释的残差。
论文把这两类损失拆开。残差方差不等造成的损失即使在总体治疗效应为零时也可能存在;条件治疗效应造成的损失在零效应附近是二阶项,也就是效应很小时增长得更慢。作者还指出,学习抽样规则本身也有成本:方差损失通常随残差方差模型的误差线性变化;若最优抽样概率没有触及上下限,损失可呈二次关系。
这也解释了为什么初始样本不能太小或太大。太小,模型没学稳;太大,预算已经被简单随机抽样花掉,后来再聪明地分配也来不及。模拟中,这种取舍形成了 U 形曲线。以总测量比例 40% 为例,当试验规模为 500、初始样本仅占 2.5%(12 个结局)时,自适应方案在三个设置中都不如简单随机抽样。论文给出的较好区间随试验规模变化:2000 至 8000 人时,初始样本占 5% 至 10%表现较好;272 人的数据示例中则是 10% 至 20%。
数字说明了什么
作者做了三组模拟,分别考察异方差结局、异质治疗效应和工作模型设错。每组模拟包含 5000 次重复,先测量 10%的参与者,最终预期测量 40%。与同预算的简单随机抽样相比,一次更新的相对效率分别为 1.34、1.13 和 1.12;加入第二次更新后,分别升至 1.40、1.16 和 1.13。
换算成更直观的测量数量,论文摘要总结称:自适应抽样效率提高 12%–34%,达到相同精度时少测量 10%–26%的结局。模拟中的区间覆盖率接近名义水平;正文表格报告的覆盖率为 0.947–0.956,但“接近名义水平”不能脱离这些模拟设置理解。
作者还用一项抗真菌药物随机试验的公开数据做重抽样研究。数据示例纳入 272 名在第 4 次访视有结局记录的参与者,以前三次访视的甲剥离状态、缺失指标和访视时间等作为辅助变量。作者报告,自适应方案把抽样方差降低了 39%。这里降低的是由抽样带来的方差,不等于总方差、测量成本或所需样本量都下降了 39%。
为什么值得关注
这项工作的吸引力不在于“用 AI 猜掉没做的检查”,而在于把预测和概率抽样分工:预测负责把有限测量投向更有信息量的人;已知抽样概率和加权校正负责保住总体比较。模型不准会浪费效率,却不必直接把偏差带进治疗效果估计。
它还照顾了试验运行中的现实边界。抽样者保持盲法;规则可以只更新一次,便于说明和审计;也可以把连续概率四舍五入成少数几个档位,方便执行。论文的理论允许这种预先确定、可记录的概率规则。
局限与未知
- 所有效果证据来自作者自己的模拟和重抽样分析,尚无材料显示该设计已在前瞻性试验中得到独立复现或同行评议验证。
- 收益依赖辅助变量的预测能力、测量预算、概率是否被上下限截断,以及模型能否从初始样本中学稳。多更新一次不保证更好;在模型设错的模拟中,第二次更新几乎没有改善效率。
- 论文的无偏结论针对完整数据治疗差异,并依赖其概率抽样与概率记录等条件。它不能简化成“少测一些,任何情况下都不损失精度”。