你改了推荐算法,七天后点击和观看时长都涨了。要不要上线?真正重要的答案,可能要半年后才知道:用户是否留下,收入能否持续,平台生态有没有变坏。但产品团队不可能让每个版本都试上半年。
这正是《Evaluating for the Long Term: Learnings from Industry》要处理的问题:怎样用数天或数周的实验,辅助判断数月后的结果。论文没有提出一套包打天下的新算法,而是把 26 位专家关在一场为期一天、共 8 小时的研讨会里,整理来自 15 家在线平台和 4 所大学的产业经验。
先说清证据边界:本文主要总结与会者的经验和共识,并结合部分公开案例形成一组命题。它不是跨平台统一验证,也没有为多数判断提供发生率或效果量。因此,下面更适合看作一张行业问题地图,而不是已经证明的普遍规律。
一周的结果,为什么不能直接乘到半年
平台最常用的工具是 A/B 测试:把用户随机分到旧方案 A 和新方案 B,再比较两组结果。随机分组让两组用户平均而言更可比,因此在标准条件成立时,差异可以用来估计改动造成的因果影响。
难点不在比较 A 和 B,而在时间。论文把典型问题写得很具体:平台希望知道一次排序算法调整会怎样影响六个月后的日活跃用户数,却只有七天内的点击、点赞、评论、转发和回访数据。类似的问题也会出现在搜索引擎和聊天机器人中,后者测试的可能是 LLM——大语言模型——或系统提示词的调整。
短实验只能测到一个特定时间窗口。新鲜感消退、用户逐渐学会使用新功能,或者平台生态发生调整后,影响的幅度可能变大或变小。随机化解决的是“两组人是否可比”,并不会自动证明“第一周和第六个月的关系仍然成立”。从短期外推到长期,始终需要额外假设。
方向通常不变,幅度却可能误导决策
研讨会参与者普遍认为,短期与长期处理效应——也就是新方案相对旧方案造成的变化——发生正负反转并不常见。但论文也坦言,公开且系统收集的证据仍然稀缺,长期实验成本高,留下来的实验本身还可能经过筛选。
更值得警惕的是幅度变化。一个功能第一周带来的提升,几个月后可能只剩一小部分,也可能继续扩大。论文列举的公开案例中,Pinterest 的 badging 改动起初令日活跃用户数增加 7%,随后降至 2.5%,方向没变,强度却明显不同。Pandora 的多年广告负载实验中,一年后的处理效应可能超过两个月时的两倍。换句话说,“涨还是跌”答对了,不代表上线判断一定不会变。
符号反转则更集中在几类干预中。第一类涉及内容质量或相关性信号:短期互动可能减少,长期留存反而改善。第二类是 hyper-monetization——过度变现,例如短期榨出更多游戏收入,却因为用户流失伤害长期收入。第三类是定价实验,其中观察窗口可能让短期结果带有偏差。论文援引的 YouTube 案例里,降低“低质或小报式”视频的排序分数后,三周观看时长下降 0.5%,三个月后则恢复并超过对照组。
最复杂的代理,不一定最有用
既然等不起半年,平台会寻找 proxy metric——代理指标,也就是实验期内可迅速测到、又可能透露长期影响的信号。再进一步,可以把多个短期信号和用户特征组合成 surrogate index——替代指标指数,用它预测长期结果或长期处理效应。
论文最反直觉的经验判断,是复杂模型未必胜过最简单的办法。所谓 univariate autosurrogate,是直接拿长期目标自身的短期版本去推测长期效果。例如,目标是长期日活,就先看实验期内日活的变化,必要时再乘一个换算系数。与会者认为,这种单变量自替代指标“往往很难被超越”。但论文没有给出统一的量化比较,参与者衡量的也常是上线决策是否一致,而不是预测是否无偏、均方误差是否更低。因此,这更像待验证的行业经验,而非确定结论。
简单指标受欢迎,还有组织上的原因。决策者通常不只想知道综合分数变了,还想知道为什么变。如果一个黑箱指数混合几十个信号,却无法解释究竟是留存、互动还是收入推动了结果,团队很难建立信任。论文因此提出一个重要转向:替代指标的价值,不应只看它能否无偏地还原真实长期数字,也应看它是否让决策变得更好。
这不等于越简单越好。月活没有自然的“一周版”;旅行预订等低频事件在短实验里可能根本不发生;收入和互动也可能存在短期取舍。遇到新产品或大幅改版,历史关系同样更容易失效。此时,多信号替代指标仍可能有价值,只是必须说明它依赖什么关系,又会在哪些场景失灵。
历史相关性,最容易冒充长期因果关系
替代指标可以从观察数据中学习,也可以从实验中学习。观察数据记录用户自然发生的行为,数量大、取得快,却容易混入 confounding——混杂因素。比如短期更活跃的用户,长期也更容易留下,原因可能只是他们本来就有更多空闲时间。模型看到的是相关性,未必是“增加短期活跃会造成长期留存”。
实验数据依靠随机分组,更适合识别因果关系。因此,与会者通常更偏好从实验中学习替代指标。不过,这条路需要一项稀缺资产:大量、长期且有代表性的实验。一个包含多个短期指标的替代模型,至少需要足够多的长期实验来估计各部分关系;即使单次实验用户很多,实验种类太少,结果仍可能不精确。
代表性也很难保证。团队往往会提前结束效果特别好或特别差的实验,把长期资源留给最重要的改动。这样形成的长期实验库不是平台日常改动的随机样本。通知实验学出的关系,也未必能搬到排序实验;旧实验得到的替代指标,还可能随着产品机制变化而过时。
长实验不是替代方案的对手,而是地基
论文最后的判断很克制:短期代理可以帮助平台更快决策,却不能取消长期实验。哪怕只能运行少数长期实验,它们仍能检验代理指标能否预测方向,或检验依代理做出的上线决定是否与真实长期结果一致。
但“长期”本身也不干净。产品团队会持续修改功能,算法也可能随着新数据自行演化,于是长期实验测到的不是一个固定改动,而是一连串干预。永久上线的算法还会在短实验结束后继续影响用户,长期结果未必完全通过实验期内观察到的代理变量传递。与此同时,短实验常常更容易纳入活跃用户,却漏掉测试期间没有出现的人;未来新增用户也不在原样本中。实验样本与真正关心的长期总体,可能从一开始就不是同一群人。
局限与未知
- 论文的核心命题来自一次研讨会。多数“通常”“很少”“更好”没有对应的平台比例、效果量或统一比较基线。
- 公开材料仍不足以确认符号反转究竟多罕见,也不能证明它主要只发生在内容质量、过度变现和定价场景。
- 不同平台、干预类型和时间跨度可能需要不同代理。论文没有给出可以直接套用的统一指标或决策规则。
这份总结真正有价值的地方,不是教平台把一周数据神奇地换算成半年,而是提醒团队先问对问题:短期信号能否支持更好的决定,它依赖哪些跨时间假设,又用什么长期实验来校准。短实验可以加快判断,但长期问题最终仍需要一些长期观察来兜底。