Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER 约 6 分钟

实验样本怎么分,要看最终服务谁

TWNA按部署重要性和测量难度重分实验样本,让有限预算更贴近最终决策。

你要测试一项新服务。试验招来的多是活跃用户,真正上线后,使用者却以普通用户为主。如果照试验人群的比例分样本,活跃用户会占掉大量预算;如果只照上线后的用户比例分,又可能漏掉那些人数不多、结果却很难测准的群体。问题不只是“样本够不够”,而是“有限的样本究竟该花在谁身上”。

Hoang Dang、Luan Pham 和 Minh Nguyen 在 arXiv 论文中提出 Target-Weighted Neyman Allocation(TWNA,目标加权 Neyman 分配)。它把两件事放进同一套实验设计:一个群体在未来部署中有多重要,以及这个群体的效果有多难测准。论文目前的证据来自作者的模拟与基准测试,正式发表和同行评审状态尚无法从材料确认。

不能只按“人多”或“难测”分

这里面对的是总体迁移——做实验的人群与最终服务的人群构成不同。比如试验里新用户很多,部署时却以老用户为主。与此同时,还可能存在异质性处理效应,也就是同一项措施对不同群体的作用不同。此时,直接平均试验结果未必能回答真正的部署问题。

常见做法是分层随机试验:先按年龄、地区或用户类型分组,再在每组内随机决定谁接受处理。这样可以分别估计各组的平均处理效应,论文称之为 GATE(Group Average Treatment Effect,组平均处理效应)。

难点在于如何分配各组样本。一种直觉是按部署人口比例分:未来人多的组多拿样本。另一种直觉来自 Neyman 分配:结果波动越大的组越难测准,因此应该多拿样本。两种做法单独使用都有盲点。前者可能低估测量难度,后者又可能把太多预算投向部署中很少出现的群体。

TWNA做的是折中,但不是简单取平均。它以“按目标人口权重计算的各组估计误差”为优化目标,让部署重要性和统计测量难度共同决定样本去向。部署中更常见、结果也更不稳定的组,会获得更多观察;部署占比低且容易测量的组,则不必机械地拿到同样多的样本。

先做小试验,再分大预算

TWNA采用两阶段设计。第一阶段先运行一个平衡的 pilot——也就是小规模先导试验——估计每个“群体—处理臂”单元的结果方差。方差可以理解为结果有多分散:越分散,越需要样本才能把平均效果测稳。

第二阶段再据此安排正式试验。TWNA同时决定两件事:每个群体拿多少样本,以及该群体中有多少人进入处理组、多少人进入对照组。组与组之间看部署权重和测量难度;同一组内部则沿用经典 Neyman 思路,把更多单位分给结果波动更大的处理臂。对于过低的分配概率,方法会设置下限,避免某个单元几乎无人可测。

如果提前知道真实方差,论文给出的 oracle rule——可理解为掌握理想信息时的最优分配——有闭式解,不需要反复搜索。现实中当然不知道真实方差,所以TWNA用先导试验的估计值代入。作者证明,在各组、各处理臂的方差估计逐渐稳定这一前提下,代入规则会逼近 oracle 规则。

数字说明了什么

作者用相对 MSE(均方误差)衡量效果,并把均匀、平衡分配设为 1;数字越低,说明目标加权的各组效果估计越准。

在“部署重要性与测量难度方向一致”的模拟场景中,TWNA的相对 MSE 为 0.693,oracle 为 0.689,相当于比均匀分配低约31%。在两种信号相反的场景里,TWNA为 0.986,基本守住均匀分配水平;只按部署比例分配则升至 1.596,误差增加约60%。这正是组合两个信号的意义:重要不等于难测,难测也不等于重要。

在处理组与对照组方差不同的场景中,TWNA为 0.827,固定两组各分一半的目标加权方案为 0.997。说明跨群体分样本还不够;当两个处理臂的波动不同,组内怎么随机也会影响精度。

先导试验的质量同样关键。论文报告,pilot 规模从100增至1000时,相对 oracle 的平均设计遗憾从2.217降至0.144,下降93.5%。这支持“pilot稳定后逼近理想分配”的机制,但不能理解成任何小规模 pilot 都足够可靠。

部署人群还没定,也能做吗?

TWNA还区分了两种不同的不确定性。

第一种是部署权重不确定,也就是尚不清楚未来各群体占多少。若只有一个大致分布,方法使用平均权重;若只知道可能范围,可以针对最不利的构成设计;完全没有信息时,则采用一种让不同部署构成风险相等的分配。论文的权重误设实验中,随着输入从准确逐步变为完全无信息,TWNA的相对 MSE 从0.682缓慢升至0.729,而不是突然失效。

第二种是 pilot 本身不可靠。小样本、重尾结果——少数极端值频繁拉动平均数——以及稀有事件,都可能让方差估计摇摆。作者另给出 robust TWNA,通过截尾、收缩和全局尺度等方式稳定输入。它解决的是“先导数据难信”,不是“部署人口难猜”,两种稳健性不能混为一谈。

为什么值得关注

很多实验分析把人口差异留到事后修正。TWNA把问题提前到招募和随机分配阶段:既然最终决策关心的是部署人群,就应该在花掉实验预算之前,把这个目标写进样本分配规则。

论文的协变量基准也支持这一方向。校准基准、IHDP 和 LaLonde 上,TWNA的相对 MSE 分别为0.837、0.884和0.869。不过这些并非真实线上随机实验:IHDP使用真实协变量及模拟潜在结果,LaLonde同样基于真实协变量模拟潜在结果。因此,它们说明方法能在更接近真实的人群结构上运行,却不能替代生产环境验证。

局限与未知

  • 方法假设群体事先固定,研究的是各组占比变化;它不负责发现新群体,也假设组内处理效应可以从实验人口迁移到部署人口。
  • 设计优化的是批量实验中的主要方差项,尚未纳入招募成本、容量限制、个体间干扰和多轮自适应。
  • 全部效果论断来自同一篇论文。真实线上实验表现、稳健性的代价,以及同行评审后的结论仍待确认。

供稿材料 SOURCES — 1

← 返回 2026-08-13 · 数据板块