看到“接触新内容的用户留存更高”,不能马上断定新内容提升了留存:也可能只是更活跃的人更早尝试。Netflix 开源的 oci-agent,正是帮助企业处理这类观察性因果推断(OCI)——用非随机实验数据估计一项行动是否真正带来变化。
据 InfoQ 报道,分析师先写出分析计划,并设想理想的 A/B 测试应如何招募、分组和衡量结果;Agent 再用现有数据尽量模拟这场测试。流程采用“行为者—批评者循环”:一个 Agent 执行分析,另一个检查结果、评级并要求修改,所有计划、参数和运行记录都留给人类复核。
最具体的警示来自 Netflix 的留存案例:普通 Claude 线性回归给出一个基准估计,而 oci-agent 的估计仅为其 25%;评审 Agent 还发现早期采用者偏差和安慰剂测试失败。它的价值因此不在于替专家下结论,而在于把容易遗漏的检查变成可复用流程。Netflix 只称其在 ACIC 数据集上“具有竞争力”,材料未披露具体指标。