你想知道,使用某项新功能会不会让用户更愿意续费。直接比较“用过”和“没用过”的人,看起来很合理,却可能把相关性错当成因果:愿意尝鲜的人,本来就可能更活跃、更容易续费。让 AI 来算并不自动解决这个问题。真正困难的是,人要先判断两群人能不能比、哪些差异必须控制,以及算出的数字是否值得相信。
Winston Chou、Adrien Alexandre、Lars Olds、Yi Zhang 和 Nathan Kallus 的研究,讨论的正是这种观察性因果推断——用没有随机分组的现实数据,估计某项措施带来的影响。他们发布了开源 Python 包 oci-agent,让 Agent 接手繁琐的计算和检查,同时把关键判断留给人类。值得看的不只是“AI 能做多少”,而是团队明确画出了一条边界:机器负责勤勉地执行,人负责决定问题是否成立。
它不是替人下结论,而是替人跑流程
oci-agent 把参与者分成三个角色。principal 是最终负责的人,通常是数据科学家;actor 是执行分析的软件角色;critic 则阅读结果、寻找缺口并提出修正建议。后两者组成循环:actor 计算,critic 检查,再推动下一轮分析。
这个设计的重点不是让大模型自由发挥。系统使用固定模板和经过检验的非 Agent 工具,底层依托 EconML、DoubleML 等开源库。每一步还会留下分析计划、参数说明、诊断结果和可重新执行的 Python notebook。换句话说,大模型更像流程调度员,不是临场发明统计方法的专家。人可以看到数字如何算出,也能修改并重跑。
它自动处理的工作包括协变量平衡检查、倾向得分修剪和敏感性分析。协变量是处理发生前就存在的特征,例如用户过去的观看量。若这些特征同时影响“是否使用新功能”和“是否续费”,它们就是混杂变量,会制造或掩盖因果关系。
倾向得分则是一个人在既有特征下接受某项处理的概率。系统会检查处理组与对照组在加权后是否足够相似,也会检查两组是否存在可比较的样本。论文采用的诊断规则包括:协变量的标准化均值差是否低于 0.2,以及倾向得分是否落在 0.1 到 0.9 之间。若有人几乎必然使用、另一些人几乎必然不用,两边就缺少真正可比的对象。修剪会去掉这类样本;敏感性分析则反复改变设置,观察结论是否容易翻转。
一次漂亮但偏大的估计
论文给出的 Netflix 案例很直观。团队想估计,参与某类新娱乐内容 Type X 是否影响两个月后的留存。他们把同一份分析计划交给 Claude Sonnet 4.6。没有额外流程约束时,模型选择线性回归,控制若干变量,并生成了一份看起来完整的报告。
同一个模型进入 oci-agent 的固定流程后,估计值却只有前一结果的 25%。原因是早期用户偏差:最先尝试新内容的人,很可能本来就是重度用户或相关内容的强烈爱好者。数据中,大多数人使用 Type X 的估计概率极低,处理组和对照组缺乏重叠。critic 发现了这一点,系统随后修剪倾向得分,并明确把问题收窄到“有现实机会用或不用 Type X 的重叠人群”。论文还报告,修剪到 [0.005, 0.995] 后,针对这部分人群的估计已相当稳定。
这说明自动诊断的价值,也说明它的边界。系统没有凭空找到“真正答案”,而是发现原问题覆盖的人群过宽,迫使分析者换成一个数据更能支持的问题。
脚手架比一句提示词重要
研究者还在 231 个 ACIC 2016 合成数据集上测试二元处理分析。合成数据的好处是因果真值已知。critic 将其中 192 次估计判为满意、39 次判为不满意;论文报告,前一组的均方根误差更低,95% 置信区间也校准得更好。这表明诊断至少能区分一部分较可靠和较不可靠的结果。
在随机选择的 10 个 ACIC 数据集上,团队逐层增加能力:只给提示词、补充完整数据、允许写代码、指定双重机器学习,最后提供完整 oci-agent 流程。只给提示词时,模型答案与真值无关;完整流程在 10 个数据集中有 9 个找回了真值附近的结果,并在论文采用的准确性与区间校准指标上领先其他设置。
真实数据测试更难。LaLonde 就业培训研究的实验估计为 1,794 美元,而直接比较观察数据得到的差异分别高达 15,205 和 8,498 美元。研究者还改列名、重采样并人为移动结果,避免模型背诵已知答案。在 20 次重复中,完整流程的绝对百分比误差中位数,在较难的 PSID 对照组上为 52%,在 CPS 对照组上为 19%。critic 因重叠太差,只在 PSID 的一次重复中愿意给出认证。这个“不肯盖章”本身,可能比勉强报出一个数字更重要。
人类究竟该在哪把关
论文给出的分工可以压缩成三道关。
第一道是问题界定。处理是什么,结果是什么,观察窗口多长,要回答所有人的平均效果,还是只回答可比较人群的效果,都不是软件从数据里自然读出的事实。
第二道是假设审查。哪些变量是混杂因素,哪些变量不该控制,未测量的差异可能有多强,都需要业务和领域知识。所谓“双重稳健”估计,也只是指在特定假设下,倾向得分模型或结果模型有一个设定正确时,估计仍可保持一致;它不等于对所有错误都免疫。
第三道是诊断和结果评估。平衡、重叠和敏感性检查可以自动运行,但阈值是否合适、修剪后结论适用于谁、效应大小是否有实际意义,以及结果是否稳定到足以交给决策者,仍由人负责。
这也是这项工作的真正启发:因果分析 Agent 最有价值的形态,未必是“自动给答案”,而是把容易遗漏的检查变成强制流程,并把每个中间产物摆在人面前。它减少的是重复劳动,不是责任。
局限与未知
- 论文作者、工具开发者、Netflix 内部案例提供方和效果评价方高度重合。所有效果论断目前只有这一项研究支持,尚无外部复现或 Netflix 之外的使用报告。
- 团队称
oci-agent自 2026 年 6 月开源后,每月编排超过 100 项分析,但未说明“分析”的计数口径、成功率,以及是否包含测试或重复运行。 - 多项“优于较弱结构的基线”或“可与人工调优基准竞争”的概括,部分实验给出了具体结果,但论文摘要层面的总括没有统一披露基线名称、误差范围和统计检验,不宜理解为已经证实的普遍优势。