给用户分实验组,像分两支球队:只看年龄容易分匀;再同时照顾地区、历史活跃度等几十种特征,顾此失彼就更难。这篇论文研究的正是,当协变量——实验前已知、可能影响结果的特征——随样本量一起增多时,随机分组还能否保持平衡,并支撑可靠的效果判断。
作者分析了两类协变量自适应随机化:系统逐个接收参与者,并根据当前组间差异调整下一人的入组概率。论文给出了两类方法的失衡度收敛速度;其中 IR-CAR 不只控制指定特征,还证明未纳入分组规则的额外特征,在一定条件下不会比完全随机化更失衡。作者进一步据此推导了均值差估计的渐近性质,并构造 95% 置信区间。说白了,这项工作的价值不是承诺“特征越多越好”,而是为特征数量持续增长时,平衡策略何时仍有统计保证补上理论依据。