你在挑相机。先搜了几次参数,又看了评测,接着打开 AI 助手,最后进入购物网站。若分析只从打开 AI 的那一刻往后看,会发现搜索和浏览都变多了,很容易得出结论:AI 带来了更多活动。但另一种解释同样成立——你本来就在忙,打开 AI 只是这段任务的中间一步。
Michael Iannelli 与 Alan Ai 的论文《Event-Time Confounding Under Bursty Human Dynamics》研究的正是这个误判。它没有证明用户主动点开的产品无效,而是提醒:点击之后更活跃,不足以证明点击造成了活跃。本文涉及的实证结果均来自这一篇论文,目前没有独立复现。
那个整齐的零点,可能并不是起点
产品分析常用“事件时间对齐”(event-time alignment):把每位用户点击推荐、访问商品页或打开 AI 助手的时刻统一记作零点,再平均比较零点前后的活动。图很好读,也很容易讲故事。
问题在于,用户主动选择的零点通常不是随机的。人正忙于某项任务时,更可能打开工具,也更可能在之后继续搜索、浏览或购物。事件时点和后续活动共享了同一个原因:正在进行的任务。
论文把这种情况称为“内生时间零点”(endogenous time zero)。“内生”是说,零点本身受用户当时的状态影响。由此产生的“时间混杂”,就是事件发生的时机同时关联事件与结果,分析却把这种关联算到了产品头上。
作者进一步把具体机制称为“episode-selection bias”,可译作“任务过程选择偏差”:用户活动往往成簇出现,一阵密集操作之后隔着一段安静时间;某个点击被选进了活跃过程,过程的自然延续便被读成点击的效果。活动成簇本身不是混杂因素,背后不断变化的意图、注意力和任务投入才是。
先看零点之前发生了什么
论文分析同一批用户跨界面的网页日志。作者称,在 AI、购物、新闻、编程和参考查询五类事件之前,多个界面的活动已经普遍上升,并在零点之前达到峰值。围绕 AI response,浏览和搜索约在事件前八分钟达到峰值,随后回落,而随机时刻的对照曲线保持平坦。
这条曲线更像一次已经启动的任务过程:用户先忙起来,途中调用 AI,之后继续一会儿,再自然结束。零点后的高活动既可能包含产品效果,也可能只是过程延续;随后的下降还可能是自然衰减或“回归均值”——一次异常活跃之后,活动本来就容易回到通常水平。
单看事件前后曲线,无法把这些解释拆开。论文因此主张:在没有额外假设时,只观察单一界面的事件窗口,不能区分任务过程选择偏差与真实效果。换句话说,同一张图可能同时符合两个世界:一个世界里产品确实有效;另一个世界里产品毫无效果,只是恰好在用户最忙时被打开。
一个不会产生效果的假事件,也测出了“提升”
论文最有说服力的检验,是人为设置“known-null timestamps”——按设计不会产生任何效果的时间戳。思路很直白:为同一用户寻找没有发生 AI response、但事件前活动状态相似的时刻,把它当作假事件。如果标准分析仍在假事件之后测出明显增长,增长就不能全归功于 AI。
为避免偷看未来,筛选和匹配只使用事件之前的信息。作者还要求真实事件前有足够活动,并设置 washout——一段此前没有其他 AI response 的间隔,以减少连续事件互相干扰。严格条件下,符合要求的 AI responses 只占 5.8%。
在这部分样本中,known-null 时间戳之后的搜索活动是同一用户安慰剂基线的 3.42 倍;真实事件之后则是 4.32 倍。假事件复现了真实事件相当大的一部分表面增幅。这说明,仅凭任务过程的时机,就能制造出接近真实事件的“使用后提升”。但它不是效果分解:真实与假事件仍可能在任务类型、语义意图和继续浏览的倾向上不同,因此不能据此断言真实 AI response 完全无效。
另一组分层结果也很关键。作者按事件前是否活跃来比较:在能检测到明显活动的时刻,known null 复现的 excess 比例为 0.56;在安静时刻降至 -0.04,设计没有检测到效果。这里的负值不应解释成“负效果”。摘要没有交代该比例的具体分母、置信区间和统计显著性。
这道梯度指出了风险最集中的地方:事件越嵌在可见的活跃过程里,事件窗口越容易把过程延续算成效果。安静时刻没有出现同样信号,但也不能自动视为安全,因为任务可能发生在日志看不见的界面,或只存在于搜索和助手内部。
为什么“比较同一个人”还不够
分析者常用用户固定效应——控制每个人长期不变的差异——来避免把重度用户和轻度用户混在一起。它能消除“这个人平时就更活跃”的影响,却消除不了“这个人此刻比自己平时更活跃”的影响。
论文用零效果模拟说明,即使事件实际没有因果效果,用户固定效应、粗粒度活动匹配和依据近期活动分层,仍可能留下接近原来的偏差。原因是混杂发生在同一用户内部,而且随时间快速变化。过去几分钟的点击数只是任务投入程度的有噪声代理,无法保证两个时刻真的处在相同状态。
这也解释了为什么一些看似越来越严格的调整未必逐步接近真相。按时钟时间匹配、选一个普通页面访问作锚点、再匹配事件前活动,可能只是换了一种方式挑选高密度活动片段。只使用事件前信息是必要的卫生措施,却不是因果识别的通行证。
对产品分析和推荐评估意味着什么
最直接的改变,是别把“点击后发生了什么”直接写成“点击带来了什么”。推荐点击、商品页访问或 AI 调用都可能是真实任务的一环,但事件窗口测到的是事件与后续活动的合计关系,其中混有产品作用和原有任务的延续。
作者建议比较相似任务过程里“发生事件”和“没有发生事件”的情况,而不是拿事件时刻与普通安静时刻相比。跨界面数据也很重要:如果一个事件之前,搜索、浏览和其他界面已经一起升温,它们可以充当潜在任务状态的代理。不过,代理只能帮助诊断和削弱混杂;除非额外条件成立,不能自动把剩余差异解释为因果效果。
论文还提醒,活动总量和活动构成是两个问题。一次事件后搜索次数可能增加,因为整段任务更活跃;但搜索在全部活动中的占比可能下降,因为 AI 替代了部分搜索。前者问“总量是否更多”,后者问“行为组合是否改变”,两者方向相反也不矛盾。窗口长度同样属于问题定义:几分钟、一小时和一周测到的不是同一种效果。
为帮助实践者检查风险,作者提供了一套诊断协议、公开数据基准,以及轻量审计工具 burstcheck。它们的价值首先在于暴露设计是否正在读取任务过程,而不是直接产出一个无偏的效果数字。
局限与未知
- 全部结果来自同一篇 arXiv 论文,没有独立复现;跨界面面板的规模和部分具体计数也因披露限制未公开。
- 3.42 倍与 4.32 倍只适用于经过严格筛选的 5.8% AI responses,不能外推到全部 AI 使用场景。
- 论文揭示的是观察性事件窗口的因果识别缺陷。它既没有证明用户主动点开的产品无效,也没有给出真实效果的统一修正值。更准确的结论是:用户主动点开之后更活跃,只是一条相关性证据,离“产品有效”还差一个可信的对照设计。