你同时测试一百个产品改动,最后挑出“提升最大”的那个上线。可上线后,收益往往缩水。原因不一定是实验失灵:这个赢家可能确实有效,也可能只是恰好撞上了一次正向波动。测试越多,撞上这种“幸运高分”的机会越大。
这就是赢家诅咒——从大量实验中选出的最佳结果,通常混合了真实收益和有利噪声。Zhaoqi Li、Daniel Ting、Ilya Gorbachev、Ehsan Emamjomeh-Zadeh 与 Houssam Nassif 的论文提出用 SIMEX(SIMulation-EXtrapolation,模拟—外推)反过来估计所有实验的真实效应分布。它不只问某个实验是否有效,而是想知道:整批实验真正有多大价值,正收益和负收益各有多少。
这项工作的证据目前来自论文作者展示的合成示例,尚无独立信源交叉验证。论文也没有给出真实业务数据上的结果。
赢家为什么总显得更强
一次 A/B Test 会产生一个平均处理效应(ATE)估计值,也就是新方案相对旧方案带来的平均变化。但估计值不等于真实效应。可以把它简单写成:
单看一次实验,噪声可能让结果偏高,也可能偏低。可一旦团队只挑最高的结果,筛选过程便会偏爱那些同时拥有真实收益和正向噪声的实验。论文认为,大规模在线实验因此可能系统性夸大收益,导致发布后的表现无法复现,也会削弱实验人员对系统的信任。
影响还不止一次上线。实验平台要设置显著性水平——判断结果是否足以排除随机波动的门槛。门槛放低,会发布更多产品改动,也会增加假阳性,即实际上无效却被判断为有效的情况。这个取舍是否划算,取决于新增发布带来的总收益能否覆盖误判成本。要算这笔账,平台不能只看一串带噪的赢家成绩,还要知道潜在效应分布:所有实验的真实效果总体长什么样。
先把画面弄得更模糊
问题在于,真实效应从未被直接观测。研究者看到的只是被实验误差模糊后的分布。要拆掉噪声,属于测量误差反卷积:已知观测结果由真实信号和噪声叠加而成,再尝试倒推出原来的信号。这类问题天然不稳定,通常需要约束或平滑。
SIMEX 的思路有些反直觉。它不立刻去噪,而是先人为加入更多噪声。好比手里只有一张略微失焦的照片:你再制作几张模糊程度逐步增加的版本,观察画面特征怎样随模糊加重而变化,然后把这条变化趋势反向延伸,推测零模糊时的样子。
具体到实验数据,作者从每个实验的效应估计值及其已知方差出发。这里“方差已知”是重要前提:方差描述估计值会波动多大,方法需要知道应当模拟多少额外误差。论文并不是在没有噪声信息的情况下凭空识别真实分布。
作者选择跟踪分位数,而不是直接估计累积分布函数(CDF)。分位数回答的是“排在某个比例位置上的效应是多少”;把许多分位数连起来,就得到逆累积分布函数,也就是从百分位位置映射到效应大小的曲线。
方法分三步。先按不同强度加入模拟噪声,计算各个分位数如何移动。再为这些变化拟合平滑函数。最后把函数外推到零测量噪声的位置,得到真实效应分布的估计。
难点不只在外推
常见 SIMEX 会用二次回归完成外推,但作者称这种做法在本任务中表现不佳。另一个麻烦是,如果每个分位数各算各的,外推后的曲线可能不再单调:例如较低百分位的效应反而高于较高百分位。那就不再是合法的逆累积分布函数。
论文为此做了两处调整。第一,它围绕分位数设计一组基函数。作者称,当真实效应属于指定的参数分布族时,这套设计可以给出一致估计;即使不属于该分布族,也能获得较好的经验估计。第二,它扩展了保序回归,让所有外推结果在各个噪声水平上保持单调。保序回归是一种强制结果遵守大小顺序的拟合方法,在这里相当于给曲线加上“百分位越高,效应不能越低”的护栏。
作者将方法称为非参数方法,意思是它不要求真实效应严格服从某一种预先选定的分布。这与参数化的 empirical Bayes normal means(EBNM,经验贝叶斯正态均值模型)形成对照:后者用带有分布假设的模型,结合整批观测来修正单个带噪估计。
它证明了多少
论文展示了一个合成实验:真实效应分布和测量误差都服从正态分布。随着人为加入的噪声增多,各分位数逐渐向外扩散;反向外推时,估计分布重新收紧。作者据此称,该方法恢复了底层真实效应分布。
论文还称,其非参数方法在这个示例中表现得与参数化 EBNM “几乎一样好”。但原文没有提供评价指标、数值差距、重复次数或不确定性区间,因此这只能视为作者的定性描述,无法判断“几乎”具体差多少。作者另称方法也适用于其他效应分布,并认为基于分位数的设计具有一定稳健性,但相关结果未在材料所述实验中展示。
真正值得关注的,是它试图改变实验平台提问的尺度。团队通常盯着某次实验的点估计:这个按钮提升了多少。SIMEX 瞄准的却是整批实验背后的真实效应分布。如果这个分布能够被可靠还原,团队就能更现实地估算实验组合的价值,也能讨论上线门槛究竟该严到什么程度,而不是把排行榜顶部的噪声当成确定收益。
局限与未知
- 当前效果证据只来自真实效应与测量误差均为正态分布的合成示例,不能直接外推到真实线上实验,也不能证明它适用于非正态、重尾或选择性报告的数据。
- 方法依赖效应估计值无偏且方差已知。论文材料没有说明方差估计不准、实验之间相关时会怎样。
- 与 EBNM 的比较缺少指标和数值,其他分布上的结果也未展示。现阶段更准确的说法是:论文给出了一条有直觉吸引力的去噪路线,而不是已经验证了一套通用的上线决策工具。