给几种疗法的患者重新加权后,各组平均年龄一样,不代表年龄结构真的相近:一组可能年轻人和老人都多,另一组集中在中年。协变量平衡就是在估计疗效前,检查各组的年龄、病情等原有特征是否已经可比。这项工作把检查范围从平均数扩大到整段经验分布——样本中不超过每个数值的比例,而且可同时比较任意多组。
作者将三种检验扩展到加权多组场景:KS 盯住分布间的最大差距,Cramér–von Mises 累计整体差距,Anderson–Darling 对尾部差异更敏感。方法先做总体检验,判断是否至少一组不同;若发现问题,再进行两两比较,并提供四种多重比较校正,减少组数增加带来的误报。
论文模拟还提示一个实用细节:多组总体检验的检出能力始终低于对应的两组情形。作者解释,这并非差异被稀释,而是加入更多组会扩大无差异时的统计量分布。因此,若研究者已经怀疑某个具体组失衡,事后两两检验往往更敏感。方法已实现于 Stata 的 kstest、adtest 和 cvmtest 命令。