Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
NEWS 约 6 分钟

Spotify为何拒绝贝叶斯A/B测试

Spotify拒绝的不是贝叶斯,而是把复杂统计包装成“一键更可靠”的实验模式。

IMAGE — Spotify Engineering

先别急着看胜率

想象你上线一个新按钮,每隔半小时看一次数据。一旦“新版胜出的概率”超过某条线,就立刻宣布成功。这个数字看起来直白,但反复查看本身会增加撞上偶然波动的机会。把结果换成贝叶斯概率,并不会自动解决这个问题。

这正是 Spotify 解释自己目前不采用 Bayesian A/B testing(贝叶斯 A/B 测试)的出发点。它反对的不是整个贝叶斯框架,而是把某种常见配置说成普遍安全、无需处理反复查看等问题。本文依据 Spotify Engineering 的单一官方材料,所述平台默认设置及统计结论尚无第二信源交叉验证。

“贝叶斯模式”不是一种方法

A/B 测试会把用户随机分到旧方案和新方案,再比较点击率、留存等结果。传统的频率学派方法会问:如果新旧方案其实没有差别,现在这样的数据有多罕见?贝叶斯方法则先设置 prior(先验分布,即实验前对效果的认识),再用数据更新出 posterior(后验分布),从而直接讨论“新版胜过旧版的概率”。

Spotify Engineering 指出,真正决定结果的并不是“用了贝叶斯”这一个标签,而是三个部件:先验、likelihood(似然,即某种效果产生当前数据的可能性)和 stopping rule(停止规则,即何时结束实验)。三者组合不同,统计保证也会不同。

这就像导航软件都叫“导航”,但有人选择最短距离,有人避开收费路段,有人优先减少时间。只说“我用了导航”,并不能说明最终走的是哪条路。

最常见的配置,问题出在哪

据 Spotify Engineering,GrowthBook、LaunchDarkly、PostHog、Amplitude Experiment、Optimizely、VWO、Statsig 和 Eppo 都提供 Bayesian mode;几乎所有这类平台默认采用 flat prior(平坦先验,即实验前不给某个效果范围更多权重),并在“新版胜出的后验概率”达到门槛时停止。

Spotify 的判断是,这种组合会复现频率学派里反复偷看数据的 false positive rate(假阳性率,即实际无效却被判为有效的比例)。换句话说,问题不在概率写成了多少,而在团队不断查看结果,并挑选一个看起来最有利的时刻收工。

常见说法是“贝叶斯测试不需要修正 peeking(反复查看结果)”。Spotify 认为,这句话混合了两件事:一种是团队根本不要求控制反复查看下的假阳性率;另一种是团队采用了能控制它的具体配置。前者改变了目标,后者改变了方法,不能都归结为“贝叶斯天然安全”。

Spotify并没有否定贝叶斯

Spotify 同时列出了几条有明确用途的贝叶斯路线。

Bayes factor(贝叶斯因子)比较“确有效果”和“没有效果”两种解释获得的数据支持。Spotify 称,它在原假设——也就是“新方案没有效果”的假定——成立时具有 martingale(鞅)性质,因此按贝叶斯因子门槛停止,可以在 optional stopping(根据中途结果决定何时停测)下控制假阳性率。

经过校准的 empirical Bayes prior(经验贝叶斯先验,即借助一批历史实验来设定先验)则会把过于夸张的效果估计向常见水平拉回。这种“收缩”可缓解 winner’s curse(赢家诅咒:被挑中的最佳结果往往高估真实效果),并约束 false discovery rate(错误发现率,即所有被宣布为发现的结果中,错误结果所占比例)。

还有 decision-theoretic approaches(决策论方法):先明确误判、等待和上线各自的成本,再由选定的 cost function(成本函数)推导停止规则。但 Spotify 提醒,这类方案是否控制频率学派关心的错误率,仍取决于具体配置。

真正的问题是实验计划想守住什么

Spotify 建议先问目标,再选工具。团队可能想限制上线无效功能的数量,可能要求效果估计达到一定精度,也可能希望长期总成本最低。这些目标需要的配置并不相同。

这种克制也与 Spotify 的平台经历相呼应。据 Spotify Engineering,其早期实验工具 ABBA 曾把一年不足 20 个重点实验推到数百个;实验规模扩大后,手算统计结果、用表格协调分组和重启实验等问题逐渐暴露,Spotify 最终于 2020 年关闭 ABBA。工具能让实验变多,却不自动让结论更可靠。

Spotify 相关论文的一个核心发现是,贝叶斯与频率学派其实比公开争论暗示的更接近:两边都要面对停止规则、误判成本和长期错误率。框架名称不能替团队完成这些选择。

局限与未知

  • 现有供稿是被截断的 Spotify Engineering 博客,未包含后续分层框架、两种范式如何互相转换,以及 Spotify 最终平台决策的完整论证。
  • “几乎所有平台默认使用平坦先验”等覆盖面很广的判断,目前只有 Spotify 这一处材料支持,本文不能独立核实。
  • 因此,“Spotify拒绝贝叶斯”更准确的理解是:它目前没有为生产实验增加一套 Bayesian mode,并警惕常见配置被过度简化;这不是对贝叶斯推断整体有效性的否定。

供稿材料 SOURCES — 1

← 返回 2026-09-10 · 数据板块