你在一个社交平台测试新功能,把用户随机分成两组。即使甲没用新功能,他的朋友乙用了,乙的行为变化也可能影响甲。此时,如果拿乙的结果训练模型,再用模型评估甲,训练集和测试集虽然名单不同,却仍通过好友关系暗中“串线”。
这正是普通交叉拟合在网络实验里会遇到的问题。交叉拟合(cross-fitting)原本是一种防止数据混用的办法:把样本分成几折,轮流用其他折训练预测模型,再到留出的一折估计处理效果。但 Haoyang Yu、Anqi Zhao 和 Hanzhong Liu 的这篇论文指出,有网络干扰时,“没见过测试样本”并不等于真正独立。作者提出 neighborhood-excluded cross-fitting,简称 NECF:不仅留出评估对象,还把可能造成信息泄漏的邻域一并移出训练集。
这项工作的结论、模拟和应用结果目前都来自同一篇 arXiv 论文。论文正文未给出可在本文中完整复核的代码、数据和结果表,因此下面主要解释它的设计逻辑与作者报告的理论性质。
分了训练集和测试集,为什么还会泄漏?
先看普通实验。在没有干扰时,一个人的结果只受自己的处理影响。把甲放进测试折、乙放进训练折后,甲的随机分组不会改变乙的结果。训练出来的预测与甲的评估权重可以保持独立。
网络实验不一样。这里存在网络干扰(network interference):一个人的结果不仅可能受自己是否接受处理影响,也可能受邻居的处理影响。即使甲和乙被分到不同折,只要两人通过网络相连,甲的随机分组仍可能改变乙的结果。模型从乙的结果中学习,也就间接读到了甲的分组信息。
麻烦出在 Horvitz–Thompson 权重上。Horvitz–Thompson 估计是一种按某种处理或暴露状态出现概率的倒数加权的方法。它能校正不同状态被观察到的机会不等,但无偏性依赖权重与用于调整的预测之间具有合适的独立关系。
普通交叉拟合只保证评估对象本身没有进入训练集。它没有切断网络上的影响路径。因此,评估折权重所涉及的处理分配,仍可能通过邻居改变训练样本的结果,继而改变拟合预测。论文的表述很克制:这并不意味着普通交叉拟合在所有网络实验中必然有偏,而是说“样本外预测”本身已不足以保证有限样本无偏。实际是否产生偏差,还取决于干扰结构、要估计的效应、随机化方式和排除规则。
关键一步:把会传递信息的人也移出去
NECF 的思路像给测试折划一道隔离带。每次评估一折样本时,训练集不仅不能包含这些样本,也不能包含结果可能受到相关处理分配影响的邻居。
隔离带并非一刀切。论文强调,它要随 estimand 和随机化设计变化。Estimand 指实验真正想估计的量,例如一个人自己接受处理产生的直接效应,邻居接受处理带来的间接效应,或所有人接受处理与所有人不接受处理之间的全局平均处理效应。
在独立的 Bernoulli randomization 下——也就是每个单位各自按同一概率随机接受处理——论文给出的规则是:
- 估计直接效应时,排除评估对象及其一阶出邻居,也就是结果可能被评估对象的处理影响的人。
- 估计间接效应时,论文为简化规则,使用完整的二阶邻域排除。二阶邻域包括直接相连,或共享某个会影响其结果的邻居的单位。
- 估计全局平均处理效应时,作者转向 Bernoulli cluster randomization,即先把人分成群组,再让整个群组共同接受处理或对照。算法把群组当成单位,在群组构成的网络上排除二阶邻域。
排除后,决定评估权重的处理分配与影响训练结果的处理分配不再重叠。作者据此证明:在论文条件下,NECF 可以为任意预测算法恢复有限样本无偏性,而且不要求结果模型设定正确。换句话说,模型不必准确写出“结果是怎样生成的”;关键是训练信息与评估权重之间的隔离做对了。
这里采用的是 design-based inference,也就是设计型推断。它把潜在结果、协变量和网络视为固定对象,把随机性归因于实验的处理分配和样本分折。论文进一步为直接效应、间接效应和全局平均处理效应建立了 design-based Wald inference。Wald inference 是利用估计值、标准误和渐近正态近似来构造置信区间的方法。
隔离越严,训练数据越少
NECF 解决了独立性问题,也带来一个实际取舍:该分多少折。
折数少时,每个评估折较大。围绕它排除邻域后,训练集可能所剩不多。折数多时,每次评估的人更少,能保留更多训练数据;但算法要在更多次拟合中保持稳定,对累计预测误差的控制也更严格。
论文给出的充分条件表明,按个人随机分折时,直接效应所需的折数可能随一阶网络的平均度增长,间接效应则可能随二阶网络的平均度增长。平均度可以理解为一个单位平均连接多少相关邻居。网络越密,隔离带吞掉的数据越多。
按群组分折可以缓和这个矛盾。如果干扰主要发生在群组内部,把整个群组放进同一折,训练组和评估组之间就更容易天然隔开。在 partial interference,也就是干扰完全局限于群组内部的情形下,只要群组数量增长且没有单个群组占据绝大多数样本,论文称可以不做额外邻域排除,并使用固定折数。对于连接大多集中在群组内部、但并非完全隔绝的网络,群组分折通常也会比个人分折保留更多训练数据。
不只要无偏,还要把区间做得更有用
协变量调整的目的,是利用实验前已知的信息解释一部分结果差异,从而提高估计精度。网络实验里的协变量可能很多,包括个人属性、邻域信息和网络结构特征;它们的维度还可能随样本量增长。
论文在线性调整下研究了两种目标。一种直接追求最小方差;另一种追求更短的 Wald 置信区间。网络干扰下,这两个目标并不总是由同一组调整系数实现,因此作者分别推导了 variance-optimal 和 confidence-interval-length-optimal 程序,并给出允许协变量维度增长的显式速率条件。
作者还证明,在相应渐近条件下,可行的方差最优程序具有 no-harm 性质:与不做调整相比,它不会在一阶渐近意义上损害效率。这里的“不会伤害”不是对任意有限样本的无条件保证,而是依赖论文所列的网络结构、训练集保留率、预测稳定性和维度增长等条件。
框架也不限于普通线性变量。论文称,可以加入网络矩阵的主要特征向量来捕捉网络层面的变化;也可以先用灵活的机器学习模型产生预测值,再把预测值当成新的协变量做最终线性校准。不过,随机生成的增强协变量需要额外条件才能获得相应的方差缩减保证。
为什么值得关注
这篇工作的价值不只是提出又一种分折技巧。它指出了网络实验中一个容易忽略的边界:数据表上的训练集和测试集分开了,不代表两者在实验机制上真的独立。只要处理效果会沿网络传播,泄漏也可能沿网络传播。
NECF 把解决办法落到实验目标和随机化设计上:先问哪些处理分配进入评估权重,再找出哪些训练结果会受这些分配影响,最后排除对应邻域。这比笼统地扩大隔离范围更精细。论文还称,对直接效应,它只需排除一阶出邻居;相比按一般依赖图排除距离两步以内的训练单位,能保留更多数据。
作者报告的模拟结果与这一直觉一致:省略邻域排除会产生偏差;加入协变量调整则能提高精度。在高维线性调整的模拟中,未分折的回归调整会随协变量维度增加而明显恶化,而采用群组分折的 LR+NECF 保持了接近零的偏差、较低的均方误差和接近名义水平的覆盖率。供稿中的正文没有保留具体数值,因此不能进一步比较幅度。
论文还在一个社会网络实验应用中称,调整后的置信区间比未调整估计量“显著更短”。但它没有在现有材料中给出区间长度、缩短比例、样本量或基线细节。这个效果表述只能视为作者报告,暂时不能判断实际改善有多大。
局限与未知
- 全部核心结论来自同一篇 arXiv 论文,尚无第二个独立信源交叉验证。有限样本无偏、渐近有效和 no-harm 都依赖具体假设,不能脱离论文条件理解为普遍保证。
- 现有材料没有提供可核验的代码、数据、完整模拟参数和实证结果表。尤其是社会网络应用中“显著更短”的置信区间,缺少量化依据。
- 方法需要已知网络,并按目标效应和随机化设计正确构造排除邻域。论文说明了若干典型设计,但材料不足以判断网络记录不完整或干扰范围设错时的稳健性。