Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
PAPER 约 7 分钟

控制变量越多,因果答案越乱?

多跑回归不等于更稳健:这篇论文用候选因果图区分好控制、坏控制和真正的结构分歧。

你想知道培训项目能不能提高收入,于是把年龄、过去收入、培训后的职业都放进回归,再把各种组合各跑一遍。结果有正有负。看起来,答案很不稳。

但问题可能不在数据,而在问题被悄悄换了。过去收入可能是混杂因素——它同时影响谁参加培训和后来赚多少,通常需要控制;培训后的职业却可能是中介变量——培训先改变职业,职业再影响收入。控制它,就截掉了培训效果的一部分。把这两类模型混在一起,好比把“全程用时”和“扣除中途休息后的用时”放进同一张表,再用数字分散来判断计时是否可靠。

Shoki Okubo 的论文提出:不要直接汇总所有看似合理的控制变量组合。先把研究者对因果关系的分歧画成几张候选因果图,再只比较每张图许可的模型。这样,“模型选择造成的波动”和“我们对世界如何运作意见不一”才不会挤在同一个指标里。

需要先澄清标题里的陷阱:论文并没有证明控制变量越多,答案就一定越乱。它针对的是另一件事——多规格分析常把合格的调整集,与包含中介变量、碰撞变量的控制集混在一起。

多跑模型,可能是在多问问题

多规格分析(multiverse analysis)会更换控制变量、函数形式或估计方法,运行许多规格,再观察结论的符号、显著性和离散程度。它想把研究者藏在单一结果背后的选择全部摊开。这一思路很有吸引力:既然没人能断言某一个模型绝对正确,不妨把合理选择都跑一遍。

难点在“合理”二字。

控制变量是在比较处理组与对照组时同时纳入分析的其他因素,目的是让两组更可比。但是否该控制,要看它位于因果链的什么位置。中介变量(mediator)处在“处理影响中介,中介再影响结果”的路径上;控制它,通常会把总效应改成另一种更窄的问题。碰撞变量(collider)则是两个因素共同造成的结果;控制它,可能在筛选后的样本中制造原本不存在的关联。

因此,两条回归即使只差一个变量,也未必在估计同一个东西。论文把这种情况称作多规格分析的基础性问题:如果模型没有共同的指向,汇总后的分布也就没有单一、清楚的解释对象。

先把争议画出来

论文的做法分三步。

第一步,先声明要估计什么。本文关注处理对结果的总效应。这个声明很重要,因为对总效应不合适的控制变量,在研究直接效应时可能属于另一个问题。

第二步,把真正有争议的变量放进一小组候选有向无环图(DAG)。DAG 是一种用箭头表达因果假设的图:箭头表示谁可能影响谁,“无环”表示路径不能绕一圈回到起点。同一个变量可以在一张图里是混杂因素,在另一张图里是中介变量。候选图不是让软件猜出真相,而是要求分析者公开写下不同假设,让读者能够检查和批评那些箭头。

第三步,软件依据每张图枚举允许的调整集。调整集就是为识别目标效应而需要控制的一组变量。每个模型随后被分为三类:在该图下必须纳入、禁止纳入,或可选。研究者只在每张图许可的模型中计算稳健性指标,同时记录同一模型是否被多张图许可,以及某张图是否根本没有可用的调整集。

关键变化很朴素:过去是先排列变量组合,再讨论结果为何不同;现在是先说明哪些组合在什么因果假设下有资格回答问题,再比较结果。

“乱”来自模型,还是来自世界观

论文还给出一个有限混合恒等式,把获许可模型的总体离散程度精确拆成两部分。

一部分是图内差异:在同一套因果假设下,更换仍然合格的模型,估计结果波动多大。这才是传统稳健性分析原本想测量的东西。

另一部分是图间差异:不同候选图各自的平均估计相差多大。它反映的不是简单的建模手法,而是对变量角色的结构性分歧。

作者据此计算图间差异在总体离散中的占比。不过,这个比例只是条件性的描述统计,不是“某张因果图正确的概率”。它会随候选图集合、各图权重和图内模型权重而变化。更重要的是,各图必须对应同一个估计目标;如果一边估计总效应,另一边估计直接效应,分解出的图间差异也不能直接解释成因果结构之争。

论文的模拟显示,传统指标可能同时把结果判为稳健,却把因果上不相容、隐含效应相差五倍的模型混在一起。反过来,把有效调整集和含有中介变量或碰撞变量的规格放在同一个池子里,也可能制造误导性的“不稳健”。模拟的具体参数没有在这里给出的材料中完整呈现,因此不宜进一步量化这些现象。

三个案例,三种误读

论文重做了 hurricane fatalities、job training 和 union wages 三类分析。

在 hurricane fatalities 案例中,结论在每张候选图内都较弱,而且很少达到统计显著。换句话说,即使清除不合格的控制集,脆弱性仍然存在,不能把问题都归咎于“坏控制”。作者还把模型统一到共同的一点变化对比后发现,区分候选世界的那些模型,其拟合均值也最不可信。因此,这里的图间分散更像系数敏感性,而不是已经测量清楚的结构分歧。

job training 案例展示了相反问题。未经筛选的多规格结果大约从负 8,500 美元摆到正 1,700 美元,看起来连方向都无法确定。论文追踪后认为,这种符号不稳定主要来自遗漏培训前收入的规格;作者能够引用的因果解释都不许可这样做。与实验基准匹配估计目标后,两套有实质依据的候选图与基准相容,而只被一个缺乏辩护的候选世界许可的规格遭到基准否定。

union wage premium——工会会员相对非会员的工资差异——则展示了第三种误读。把所有规格混在一起时,稳健性比率只有 1.05,而且五分之一的估计为负,按常规标准会被判为脆弱。但在六个能够通过调整识别该效应的候选世界里,系数都为正且达到统计显著。总体指标把一个尚未解决的结构问题——职业和行业究竟是混杂因素,还是工会影响工资的中介——误读成了结果本身不可靠。

不过,论文还保留了第七个候选世界:职业在加入工会前是混杂因素,加入后又成为中介。现有数据中没有任何控制集能在这个世界下识别目标效应。因此,union 案例的“翻转”只对已纳入且可识别的候选集合成立,不能说它经受住了所有可能结构。

为什么值得关注

这项工作的价值不是替研究者选出“正确的图”,而是把争议搬到更合适的位置。过去,读者只能看到一排回归结果,然后猜测某个变量为什么被加入或删除。现在,每项选择都能追溯到一张明确的因果图。争论从“你为什么喜欢这个模型”,变成“这条因果箭头有什么依据”。

这也保留了多规格分析原有的优点:模型空间仍可完整枚举,符号稳定性、显著率和稳健性比率仍可报告,只是改为按候选图分别计算。作者提供了实现该流程的 R package dagmv,涵盖因果图解析、调整集筛选、有效规格枚举和离散程度分解。

局限与未知

  • 候选图仍由研究者提出。方法让假设更透明,却不会从数据中自动判定哪张图是真的;遗漏一个重要且可辩护的候选世界,仍可能改变结论。
  • 图间差异占比依赖候选集合和权重,也要求各模型估计可比较的共同目标。它适合描述分歧来自哪里,不适合当作检验统计量或因果图的概率。
  • 本文的事实与效果论断均来自 Okubo 的同一篇 arXiv 论文,尚无独立信源交叉验证。三个应用说明了方法可能纠正的不同误读,但不能据此推断它在其他研究中会以同样方式改变结论。

供稿材料 SOURCES — 1

← 返回 2026-09-19 · 数据板块