给几十万名接受过干预的人各找一个背景相近的未干预者,像在巨型通讯录里逐个寻找“最像的人”:计算量很快膨胀,更麻烦的是,找不到对象的人会被悄悄删掉,最终结论回答的已不是最初那群人。Keming Hu、Yingpei He 提出的 Centroid-Referenced Mahalanobis Matching(CRM),想同时处理这两个问题。
CRM 不做全局逐对搜索,而把每个人压到两条参照坐标上:一条是 Mahalanobis distance——综合变量尺度及相关性,衡量其离处理组中心多远;另一条是 Fisher coordinate,标出其沿处理组与对照组平均差异方向的位置。方法再把二维平面划格,在同一格内抽取对照者,让对照组复现处理组的分布。关键不只是提速:CRM 会在匹配前报告“短缺比例”,把哪些处理对象因缺少相似对照而不受数据支持直接摆出来,并把这种重叠不足与单纯名额不足造成的剔除分开。
作者将 CRM 的价值定位在大规模计算与目标人群诊断,而非全面胜过现有方法;论文称,中等规模模拟中,一些逐对匹配和加权方法的平衡表现反而更好。