你要判断一家产品明年能不能留住客户,却只能做几周的 A/B 测试。等长期结果,决策窗口早就过去了;看短期数据,又怕选错信号。团队通常会找一个更快出现的“代理指标”,比如短期留存,再用它替长期目标做判断。问题是:代理指标和长期目标往往来自同一批用户,两者会一起受抽样波动影响。过去的常见做法是尽量剔除这种共享噪声。这篇论文追问了一步:如果任务不是精确估计相关性,而是给候选代理排出名次,剔得越干净,排名就一定越好吗?
Sandro Provenzano 在 arXiv 论文《The Noise Is the Signal》中给出的答案是:未必。在他研究的实验档案里,共享抽样误差不只是污染,也携带了代理质量的排序信息。以下数字和结论均来自这一篇论文,尚无第二个独立信源交叉验证。
先分清两种“相关”
北极星指标,是团队用来衡量产品是否真正创造长期价值的核心指标。客户终身价值、长期利润等结果很重要,却通常出现得慢,而且短期测量很嘈杂。
代理指标则更快。一个好的代理,不只要和长期结果看起来相关,还要能可靠反映一次产品改动带来的长期变化。平台常从历史实验中寻找它:查看每个候选指标的实验效果,是否与北极星指标的效果同步,再据此排名。
麻烦来自抽样误差。实验只观察有限用户,即使原样重做,估计结果也会波动。代理指标和北极星指标又是在同一批用户上计算的,于是两边的误差可能一起升降。这叫相关抽样误差。
它确实会制造虚假的表面相关。极端地说,即便实验根本没有真实效果,只要两项指标在用户层面经常同涨同跌,估计出来的实验效果也可能显得相关。因此,Netflix、Google、Booking 等平台相关研究提出了不同的去噪估计方法,目标是把共享误差从真实实验效果的协方差中分离出去。
但这篇论文强调:估计一个数,与排一张榜,不是同一道题。一个方法可以更准确地估计每个候选指标的真实相关性,却未必更准确地排出谁在前、谁在后。
关键一步:让两边不再共享用户
要判断共享误差里是否真的藏着排序信息,作者需要一个不依赖现有去噪模型的参照,否则容易循环论证:用某种校正方法定义“真相”,再证明这种校正方法更好。
论文采用了一个直观的办法。它把每个实验中的客户随机分成互不重叠的两半,分别估计代理指标和北极星指标的实验效果,再跨两半比较。例如,用前一半客户估计代理效果,用后一半估计北极星效果;随后交换方向,并把结果合并。
因为两边没有共同客户,它们不会遭遇同一次用户抽样冲击。这样得到的“跨半一致性”,可以粗略理解为:拿掉共享抽样误差后,一个候选代理仍能在多大程度上跟随北极星变化。这个检验不需要先估计要扣掉多少误差,也不依赖某种特定的效果分布假设。
作者分析的档案包含 262 个随机实验和 69 个候选代理指标,其中有单项指标,也有组合指标。结果显示,共享抽样误差给出的候选排序,与跨半一致性排序之间的 Spearman correlation 为 0.65。Spearman correlation 衡量的是两个排行榜的次序有多相似;0.65 表示中等偏强的排序关联,不能理解成“预测准确率为 65%”。
这说明,在这份档案里,那部分准备被剔除的误差,确实倾向于把更好的代理排在更前面。论文给出的解释是:同一用户身上两项指标的关系,可能是指标组合的一种相对稳定属性。它不等于因果关系,却可能提示哪个候选指标更贴近北极星。
为什么“校正正确”仍可能“排名更差”
去噪方法做的减法,在统计定义上可以完全正确:观察到的跨实验协方差,减去同一实验内的抽样误差协方差,更接近真实效果之间的协方差。
问题在于,减法只移除了共享误差,却没有消除另外两个更大的麻烦:北极星指标本身很嘈杂,以及历史实验数量有限。论文所研究的档案名义上有 262 个实验,但不同实验提供的信息量并不均等;少数实验可能对拟合结果影响很大。因此,名义数量不等于真正有效的信息量。
如果共享误差恰好在优秀候选指标上更大,把它减掉还会压缩候选之间的差距,而且最容易压缩榜单头部的差距。作者把这种现象称为“与排名对齐的信号减除”:去掉的成分在估计目标里是偏差,在排序任务里却可能充当提示。
论文用按真实档案校准的模拟进一步检验这一点。模拟中,候选指标的真实排名是已知的,而且每种校正方法都直接获得真实的抽样协方差。换句话说,研究刻意排除了“协方差估得不准”这个解释。结果仍显示,校正方法剔除的共享误差越多,候选排序表现越差。作者据此认为,损失来自剔除本身,而不只是校正参数估错。
这也揭示了一个容易忽略的取舍:无偏估计追求把每个数还原得更准;代理选择关心的是能否把两个候选的先后顺序排对。前者更好,不保证后者也更好。
它不只在模拟里成立吗?
作者又留出一批真实实验做样本外评估:先用一组实验形成排名,再用另一组实验评分。评分时,决策信号与结果也分别取自互不重叠的客户子样本,避免共享误差抬高某种方法的成绩。
在这项比较中,真实结果与模拟所预测的方法排序高度一致,Spearman correlation 为 0.93。这里的 0.93 仍是两套排序之间的相关性,不是“模型准确率 93%”。论文也明确说,在这一个规模的档案上,单个方法相对基线的收益或损失没有达到统计显著;证据主要来自样本外次序与事先校准模拟之间的一致。
论文还展示了评估协议本身的重要性。如果用同一批客户同时读取决策信号和回报,共享误差会夸大效果。也就是说,不只训练排名时要区分两种相关,验证排行榜时也要避免让同一份噪声既当考题又当答案。
真正值得带走的,不是“别去噪”
这项工作的价值,不在于宣布共享误差永远有用。它提醒实验平台先问清自己的决策目标:是估计真实相关性的数值,还是从一批候选指标中挑出更好的几个?当损失函数从“数值误差”换成“排序错误”,最佳方法可能随之改变。
论文也承认,历史实验足够多时,校正仍可能带来收益。只是北极星指标越嘈杂,达到这个收益转折点所需的实验数量增长越快。作者给出了转折区间的映射,并建议平台利用现有数据做三项低成本检查:看有效实验数量、做跨半一致性检验,以及用不共享客户的留出实验评估实际回报。
更稳妥的实践结论因此是:不要默认把相关抽样误差全部保留,也不要默认全部剔除。先在自己的实验档案里检查,它究竟主要是污染,还是也在帮助区分候选指标;再根据北极星的噪声、有效实验数量和实际排序任务决定校正强度。
局限与未知
- 证据来自单一消费平台的实验档案。其北极星噪声、候选指标结构和实验分布未必代表其他平台,不能把“剔除越多、排名越差”当作普遍定律。
- 论文报告的样本外单项差距没有达到统计显著。0.65 和 0.93 都是排序相关,不代表代理指标的预测准确率,也不能单独证明因果机制。
- 这项分析讨论的是如何给固定候选目录排序。用户层面的相关关系不意味着干预代理指标就会推动长期结果,因此它不能替代对代理指标因果有效性的验证。