你想判断新的派单策略有没有用,却发现周一早高峰、周末夜间和不同城区的订单量本来就差很多。策略带来的小变化,很容易淹没在这些自然起伏里。多跑几周当然能看得更清楚,但实验时间和业务成本也会一起增加。Sergei Pankratev 与 Palash Arora 的新论文提出:不要只拿上一期数据做校正,而要把多期历史、时段规律和固定差异一起利用,再用 cross-fitting 防止模型高估自己的能力。
这项工作的证据目前全部来自作者论文,包括模拟实验和一组注入了合成处理的纽约出租车数据验证,尚无独立信源复核。
为什么普通 A/B 测试不够用?
外卖和出行平台经常不能简单地把用户分成两组。比如,一部分乘客采用新派单策略后,附近司机的位置和等待时间也会改变,另一组乘客不可能完全不受影响。
Switchback 实验因此改按“地点 × 时间”轮换策略。同一个城市、门店或市场,在不同时间段交替使用新旧方案。论文把这种随机分配单位称为 cell,也就是一个空间 cluster 与一个时间段组成的格子。
麻烦在于,每个格子的规模往往不同。有的城区某小时有大量订单,有的只有少量订单;天气、通勤节奏和地区差异还会让整格数据一起升降。这种格子层面的波动会放大处理效应估计的方差——方差可以理解为重复做同一实验时,答案会晃动多大。方差越小,统计功效越高,也就越容易在相同实验时长下发现真实的小效果。
CUPED 为什么还要“加码”?
CUPED——Controlled-experiment Using Pre-Experiment Data——会利用实验开始前已经观测到的指标,扣掉结果中可以预测的波动。比如,用上周同一时段的订单量校正本周订单量。它不改变随机分组,只让新旧策略的比较更精确。
常规 CUPED 通常只看一个历史滞后项,也就是上一期的同一指标。问题是,一周的数据未必足以描述稳定规律。上周可能恰好下雨,也可能碰上一次异常需求。只看这一张“旧照片”,很难分辨哪些是长期模式,哪些只是噪声。
作者提出的扩展框架把预测信息加厚。它同时使用多个历史滞后项;用正弦、余弦形式的周期编码表示一天中的小时,让深夜与凌晨在数学上仍然相邻;还测试了 hour fixed effects 和 cluster fixed effects。固定效应可以理解为给每个小时或地区设置一个长期基准,用来吸收稳定差异。
这条路线处在普通 CUPED 与 CUPAC 之间。CUPAC 会用更灵活的机器学习模型和大量实验前特征预测结果;本文仍采用较轻量的 ridge regression——一种会压缩过大系数、降低过拟合风险的线性回归——但把 CUPED 的单一历史指标扩展成一组有结构的协变量。
关键不只是“多放几个变量”
变量越多,模型越容易在训练数据上显得聪明。它甚至可能把随机噪声当成规律。如果随后仍用同一批数据评价方差缩减,结果就会虚高。
作者因此使用 cross-fitting,也就是交叉拟合:把数据分成若干份,预测某一份时,只用其余数据训练模型。每个格子的校正值都来自没有看过该格子结果的模型。在模拟中,作者采用五折划分;在纽约出租车验证中,则按 pickup-zone-by-hour cell 分组,避免同一格子的信息跨入训练与评估两边。
论文还专门加入与结果完全无关的随机特征。随着噪声特征增多,样本内表现会虚假上升,交叉拟合后的表现却下降,暴露出估计无用参数的代价。作者据此强调:对扩展后的特征集,cross-fitting 不是锦上添花,而是避免自欺的必要步骤。
协变量也不能随意加入。它们必须在处理前确定,或能确认不受处理影响;否则就可能发生 covariate leakage,即把策略实施后的信息偷偷带回校正过程。
多看几周,究竟多出多少信息?
作者用 Monte Carlo simulation——反复生成已知规律的合成数据——比较未调整估计、单滞后 CUPED 和扩展 CUPED。模拟覆盖三类情形:波动主要来自地区与时段、两类来源较均衡,以及波动主要来自“地区 × 时段”的交互。
在交互波动占主导的设定中,常规 CUPED 将方差降低 45.2%。只使用一周历史、周期编码和地区历史均值的 ridge 模型为 42.6%,反而略差,原因是正则化也压缩了有用的单滞后系数。加入三周历史后,同一配置达到 57.5%;再加入小时固定效应,达到 61.8%。这比单滞后 CUPED 高 16.6 个百分点。
结果也说明“更多固定效应”不等于“更好”。三周历史加 cluster fixed effects 时,方差缩减为 55.1%;同时加入 cluster 与 hour fixed effects 时为 59.9%,仍低于只加 hour fixed effects 的 61.8%。作者解释,小时类别较少,额外估计成本不高;地区类别更多,而且模型已有每个地区的历史均值,再加入大量地区虚拟变量会增加样本外预测波动。
因此,作者推荐的实际配置并不是摘要中容易让人误读的“固定效应全都上”,而是保留多期历史、周期编码和小时固定效应,省去高维地区固定效应。模拟其余比较为了保持一致仍使用两类固定效应,论文称其与推荐配置相差约一至两个方差缩减百分点。
真实数据验证了什么?
作者还使用 New York City Taxi and Limousine Commission 公开的 2024 年 1 月黄色出租车行程记录,以行程时长为结果,以 pickup-zone-by-hour 为格子。由于这不是一次真实实验,他们在一个星期的数据中随机注入已知的 cell-level 处理,前三周提供历史滞后项。
这项验证的意义,是检查方法在真实的季节性、格子规模不均和非高斯结果分布下,是否仍按理论预期工作。论文报告,加入时间类固定效应的三滞后配置优于普通 CUPED;高维 pickup-zone 固定效应依旧会拖累表现。不过,这不能证明方法已经在真实平台策略实验中取得同样收益,因为处理效果本身是合成的。
为什么值得关注
这项工作的价值不在于发明一个更复杂的预测器,而在于瞄准 Switchback 实验里最昂贵的那类噪声:整个随机化格子一起变化的部分。多个历史周期可以更清楚地识别重复出现的模式,小时结构可以吸收稳定的日内节奏,交叉拟合则负责检验这些规律能否走出训练集。
论文还推导了任意协变量调整所能达到的方差缩减上限。直觉是,按格子聚合的历史信息只能消除可预测的格子层波动,无法消除同一格子内部每笔行程各自的随机噪声;如果地区与时段交互中还有跨周不可预测的瞬时冲击,它也会留下。这个上限提醒实验团队:特征工程不能无限缩短实验,收益取决于噪声究竟由什么组成。
局限与未知
- 所有效果数字均来自同一篇 arXiv 论文,尚缺独立复现;模拟结论也不能直接推广到所有外卖、出行或聚类实验。
- 纽约数据中的处理是人工注入的,只验证估计与交叉拟合流程,没有检验真实策略造成的因果效应。
- 作者称方法 lightweight,且不增加普通 CUPED 已隐含的假设。但实际应用仍要求有可用的实验前历史、正确划分交叉拟合数据,并确保协变量不受处理影响;不同业务中的时间稳定性仍需另行核查。