你把两位背景相近的人配成一组,一人接受干预,一人作为对照。实验结束时,其中一人联系不上了。常见做法是把整对都删掉:失访者没有结果,留下的那个人也因无法完成组内比较而被舍弃。Simon Heß 与 Patrick W. Schmidt 的这篇论文认为,如果失访与处理状态、潜在结果都相互独立,这个“单例”仍有信息,不必跟着消失。
这件事值得看,是因为它触及配对实验的一处现实矛盾。配对随机实验先把相似对象组成一对,再随机决定谁接受处理,目的正是减少无关差异、提高估计精度。可一旦发生失访——受试者退出或无法追踪——常用分析又会删除不完整配对,主动放弃仍可观察的数据。论文试图在保留配对优势的同时,把这些单例重新纳入推断。
本文的效果与方法论断均来自这篇 arXiv 论文,尚无独立团队的同行评审、复现或实证案例交叉印证。
两种常用办法,各丢了一部分信息
论文先指出,实践中常见的两个选择其实是“假二选一”。
第一种是 paired t-test,也就是配对 t 检验。它只比较完整配对内部的处理组与对照组差异。这样能利用“二人原本相似”这一设计信息,却必须删除所有单例。论文指出,在有失访时,用配对固定效应回归实现这种分析,也会自动丢掉不完整配对,进一步减少样本,降低统计功效和估计精度。统计功效指真实效果存在时,检验成功发现它的概率。
第二种是 two-sample t-test,即双样本 t 检验。它把所有仍有结果的人分成处理组和对照组,直接比较两组平均值。单例保住了,但原来的配对关系被忽略。换句话说,它把精心配好的实验,当成普通随机分组来分析。论文认为,这种做法通常会给出偏保守的标准误,浪费配对带来的效率。
作者的核心判断是:完整配对和单例不是只能二选一。前者提供精度更高的“配对内比较”,后者虽然失去搭档,仍能通过不同配对之间的比较提供信息。
关键不是留下多少,而是怎样合并
论文把可观察数据拆成两部分。完整配对中的处理效果,可以通过同一对内两人的结果之差估计。因为两人原本相似,这种比较能消掉不少配对层面的差异。单例则无法做组内相减,只能把留下的处理组单例与对照组单例放在一起,做跨配对比较。
这两种估计都指向平均处理效应,但精度不同。作者因此提出“最优加权估计量”:精度高的部分权重大,噪声大的部分权重小。它采用逆方差加权——方差越小,说明估计越稳定,获得的权重越大。可以把它理解为汇总两支测量队伍的结果:一支有更好的测量工具,另一支工具普通但带回了额外样本,合理做法不是解散其中一支,而是按可靠程度合并两边的信息。
权重取决于失访率和配对质量。论文用配对内相关性衡量匹配质量:一对对象的结果越相近,完整配对的比较越有价值。研究者可以用处理前的基线结果估计这种相关性;没有基线数据时,论文也讨论了从处理后数据估计,或根据先导研究预先设定合理数值。可行版本会用样本估计未知参数,并在样本增大时接近知道真实参数的“oracle”版本。
置换检验把实验设计带回分析
仅有更好的估计量还不够,作者又把它放进随机化推断。随机化推断是按照实验最初的随机分配规则,反复重新排列处理标签,由此构造“如果处理没有作用,会看到怎样的结果分布”。完整配对中的标签只在一对内部交换;单例部分则在保持处理组与对照组数量平衡的条件下重新分配。
论文证明,在 sharp null——每个受试者都完全没有处理效应的“尖锐零假设”——之下,两种置换程序都能在有限样本中精确控制检验尺寸。检验尺寸可以简单理解为:没有效果时,方法误报有效的概率。这里的“精确”不依赖大样本近似,但有一个关键前提:失访必须独立于处理分配;相关证明还以已实现的潜在结果和失访格局为条件。
实际计算时还有一处容易忽略的细节。如果权重由样本估计,每次置换处理标签后都要重新估计方差和权重。若始终沿用原始分配下算出的权重,论文明确指出,sharp null 下的精确控制会被破坏。
它声称赢在哪里?
论文在一个明确设定中比较四种方法:配对 t 检验、双样本 t 检验、以普通均值差为统计量的随机化推断,以及采用最优加权估计量的随机化推断。功效推导采用成对样本来自共同总体、配对内随机分配、失访独立,以及恒定处理效应下的局部备择等条件。
作者用一个无失访时配对 t 检验功效为 90%、包含 200 对对象的基准设定,讨论弱、中、强三种匹配质量。弱匹配时,各方法起点相近,随着失访增加,删除单例的配对 t 检验功效下降较快。匹配较强时,配对本来很有价值;但失访增加后,单纯删除不完整配对会浪费数据,普通均值差又不能充分利用剩余完整配对。论文称,最优加权随机化推断在这些比较中同时保住两类信息。
更强的结论是:在论文设定的恒定效应与功效比较口径下,这套方法对任意失访水平都在功效上优于配对 t 检验和双样本 t 检验。这里的“任意”不能读成适用于所有现实失访机制。它来自论文的理论模型与渐近功效推导,不是跨数据集验证出的普遍经验规律。
对应用研究者而言,方法的吸引力还在于实现成本。作者证明,最优加权估计量可以写成一次加权最小二乘回归:完整配对使用配对固定效应,单例进入单独的截距部分,并按各自的信息精度赋权。因此,标准统计软件即可实现,不必另造一套分析系统。
为什么值得关注
这篇工作的意义,不只是“多留几行数据”。它把三个经常被混在一起的问题拆开:失访是否破坏因果识别、剩余数据该如何组合,以及检验是否遵守原来的随机分配机制。
如果失访确实独立,那么删除单例主要是效率问题,新方法试图用加权解决;置换检验则负责尊重实验设计并控制误报。但如果处理本身导致某些人更容易退出,或者失访与本来会出现的结果有关,问题就不再只是少用了数据,而是观察到的人已经不能代表原样本。作者也建议,把这套依赖较强独立性假设的点估计,与允许非随机失访的保守分析或界限方法并列报告。
局限与未知
- 核心结论依赖失访独立于处理状态和潜在结果。处理诱发失访、结果相关失访等情形不能直接套用,因果效应本身可能已无法按同一方式识别。
- 精确的有限样本尺寸控制只针对 sharp null;它不等于对平均处理效应等复合零假设也有同样保证。论文对更弱零假设的处理涉及学生化随机化推断与渐近论证。
- “最优”和功效上的全面占优成立于论文明确规定的目标、加权方式和数据生成设定。文中给出理论功效示例,但材料没有提供真实实验复现或独立验证,是否优于更大分层的实验设计也仍是开放问题。