Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER H 11 约 8 分钟

计数数据也能识别因果图

PT-SEM 利用计数的传递规律辨认因果方向,并把箭头、影响系数和外生分布一起识别出来。

如果一家商店发现,进店人数、咨询次数和成交笔数总是一起涨,它仍然不能只凭相关性断定箭头怎么画:是客流带来咨询,还是促销同时推高了几项数字?这篇论文关心的正是这类问题。它提出 Poisson thinning structural equation model(PT-SEM,泊松稀疏化结构方程模型),试图仅凭观察到的计数数据,辨认变量之间的完整因果图。

这里的“计数数据”,就是只能取 0、1、2 等非负整数的数量,例如每小时故障数、访问数或交易笔数。它们的波动规律不同于普通连续数据,直接套用常见的线性模型并不合适。PT-SEM 的价值,在于给这类数据提供了一套明确的生成机制和识别条件。

本文依据 Penggang Gao、Ming Cai 和 Hisayuki Hara 的论文及其公开实验材料。核心理论、模拟和真实数据结果目前都来自同一篇论文,尚缺少独立研究的交叉验证。

把“一个事件带来几个后续事件”写进模型

先看 Poisson thinning(泊松稀疏化)。可以把它理解为:父节点里每发生一次事件,就独立产生若干个传到子节点的事件;产生数量服从 Poisson 分布,平均数量由 thinning coefficient(稀疏化系数)控制。

例如,一次符合条件的犯规可能带来不止一次罚球。这里的系数不是“是否保留”的概率,而是每个上游事件平均产生多少个下游事件,因此可以大于 1。

这也是 PT-SEM 与此前 PB-SCM 的关键区别。PB-SCM 使用 binomial thinning(二项稀疏化):每个事件只能按某个概率保留或传递,系数必须落在 0 到 1 之间;它还把各节点自身产生的外生事件限定为独立 Poisson 变量。所谓外生变量,就是模型没有再向上解释的那部分新增计数。PB-SCM 的因果 DAG 通常只能部分识别。

PT-SEM 换成 Poisson thinning,允许一个事件产生多个后续事件,也允许不同节点的外生变量来自不同计数分布族。它仍保留一个直观解释:某条边的系数,表示父节点计数对其子节点条件均值的直接影响。

它怎样给箭头定方向?

因果 DAG 是一张用箭头表示直接因果关系、又不允许沿箭头绕回原点的图。只看相关性时,多种箭头画法可能产生相同的数据分布。想进一步定向,通常需要时间顺序、干预,或者对数据如何生成作出额外假设。PT-SEM 走的是第三条路。

论文证明,在逐节点正则条件成立时,观测分布可以唯一确定三样东西:因果 DAG、每条边的 thinning coefficient,以及每个节点的外生分布。相关条件包括外生计数并非退化常数、零值具有正概率,并且矩母函数在零点附近存在。论文称,Poisson、零膨胀 Poisson、负二项和几何分布等常见非退化计数分布满足这些条件。

证明的抓手是“汇点”。汇点指只有箭头进入、没有箭头出去的节点。作者用条件累积量生成函数——一种概括概率分布各阶特征的数学工具——刻画汇点,并从观测分布中逐轮找出、移除它们。这样可以恢复变量的拓扑顺序。随后,模型利用协方差关系确定每个节点的父节点和边系数;当所有父节点都为零时,节点的计数又能用于恢复其外生分布。

同一分析也能扩展回 binomial thinning。不过完整识别有额外前提:每一个非汇点的外生噪声都必须不是 Poisson 分布。换句话说,旧模型难以完整定向,并不只与二项稀疏化有关;Poisson 外生噪声也是一个特殊的识别障碍。

从“理论上可认”到“有限数据里去找”

真实数据不会直接交出完整分布。作者因此设计了一套结构学习算法。它先用矩估计——利用均值、方差和协方差反推参数——为各候选父节点组合估计边系数,再把估计值代入局部似然,计算可分解的 BIC 分数。BIC 是一种在拟合程度与模型复杂度之间取舍的准则。

随后,算法用子集动态规划寻找 BIC 最优的 DAG。动态规划会保存子问题的最优结果,避免反复计算,并能在设定的搜索空间内得到全局最优解。论文还证明,这套 plug-in BIC 方法对 DAG 和外生分布族的选择具有一致性:随着样本量趋于无穷,它选中真实结构的概率趋近于 1。这是渐近保证,不代表任意有限样本都一定判断正确。

模拟实验覆盖了纯 Poisson 外生变量,以及从 Poisson、负二项、零膨胀 Poisson、几何、二项和 Bernoulli 六类分布中逐节点选择的混合设置。由于数据本身由 PT-SEM 生成,实验设计天然有利于作者的方法。在这些设置中,Proposed DP-BIC 的图恢复表现接近预先知道各节点外生分布族的 Oracle DP;样本增多时,边系数估计误差下降。随着平均入度增加,贪心搜索明显恶化,而精确动态规划保持得更稳定。论文没有因此证明该方法普遍优于所有计数因果模型,但结果支持了算法在自身模型假设下的有限样本可用性。

NBA 数据给了一个直观例子

作者还分析了 2015–16 至 2024–25 十个 NBA 常规赛季的逐回合事件数据。事件按“球队—单节”汇总,排除加时,共得到 95,808 条观测。五个计数变量分别是球队博得的非进攻犯规 FOUL、罚球出手 FTA、罚球命中 FTM,以及个人犯规 PERS 和争抢球犯规 LOOSE。

依据事件定义和 NBA 规则,作者预先设定参考图:FOUL 指向 PERS、LOOSE 和 FTA,FTA 再指向 FTM。Proposed DP-BIC 在十个赛季中都恢复了这张参考图,骨架和有方向边的平均 precision、recall、F1 均为 1.000。相比之下,ODS 的有方向边 F1 为 0.889,PC-RCIT 为 0.169,PB-SCM 为 0.399,PB-SCM-PGF 为 0.423。

这组结果尤其展示了系数可以超过 1 的意义:论文报告 FOUL→FTA 的估计系数在所有赛季都高于 1,与一次符合条件的犯规可能产生多次罚球相符。不过,这里比较的是模型结果与作者依据定义和规则预设的参考图,并非随机干预得到的因果真值。

为什么值得关注

这项工作的真正推进,不是宣称“任何计数表格都能自动变成因果图”,而是给出了一类条件明确、又比 PB-SCM 更灵活的模型。在数据确实符合 PT-SEM 生成机制及其正则条件时,相关性背后的箭头、边系数和节点自身噪声不再只能部分确定。

它也把理论识别、参数解释和可运行的结构搜索接到了一起。对事件数、流量、故障和交易笔数这类数据,Poisson thinning 所表达的“一对多传递”尤其直观。NBA 案例中大于 1 的 FOUL→FTA 系数,正好说明了这种表达能力。

局限与未知

  • 完整识别依赖 PT-SEM 及逐节点正则条件。模型假设不成立时,仅凭观察数据不能据此保证因果方向正确。
  • 动态规划得到的是评分搜索中的全局最优结构,但搜索复杂度随节点数呈指数增长;论文给出的算法并不意味着可以轻松处理任意规模的图。
  • 模拟数据由 PT-SEM 生成,真实数据也只展示了一个 NBA 事件计数应用。独立团队能否复现,以及面对模型错设、潜在混杂或其他领域数据时表现如何,仍需后续验证。

供稿材料 SOURCES — 1

← 返回 2026-09-12 · 数据板块