你请几位邻居过去的用电曲线,拼出一个和自家几乎重合的“合成家庭”,再用它判断安装空调后的新增电费。可随后遇上罕见高温,而你家朝西、比邻居更怕热。此时,旧曲线拟合得再漂亮,也分不清电费上涨来自空调,还是来自不同的高温暴露。
这正是 Rok Spruk 研究的合成控制难题。合成控制(synthetic control)常用于只有一个国家、地区或企业受到政策影响的案例:研究者给多个未受影响对象分配权重,拼出处理对象“如果没有政策,本来会怎样”的反事实。通常,事件前贴得越紧,结果越让人放心。但论文指出,一旦处理后出现脱离历史规律的共同冲击,这种放心可能没有依据。
所谓共同冲击,是油价等同时影响多个对象的外部变化。“共同”不等于影响相同:产油国与非产油国面对同一轮油价下跌,承受的幅度可以相差很远。本文的理论、模拟和伊朗案例均来自同一篇 arXiv 论文,尚无第三方复现。
漂亮拟合为什么会失灵
问题出在处理前的“难以分辨”。假设商品价格在处理前与经济增长的潜在因素同步变化。高商品暴露加上较慢的基础增长,可能与低暴露加上较快的基础增长,形成几乎一样的历史轨迹。权重只需复刻结果曲线,未必会复刻商品暴露。
到了处理后,商品价格突然脱离原来的走势,两组对象才显出差异。估计器却可能把这部分差异记到政策头上。作者称这种此前几乎不可见、此后突然起作用的变量为 silent factor,即“沉默因素”。
论文先给任意加权估计量推导了一个逐时期偏误界:处理前的系统性失配,会被一个 leverage statistic 放大为处理后偏误。Leverage 可理解为“这一时期离历史经验有多远”;数值越高,估计越依赖样本外外推。它还能精确拆成潜在因素部分,以及可观测冲击的 partial leverage——也就是冲击中无法由处理前潜在因素解释的那部分,其处理后残差相对于处理前波动有多大。
这个拆分带来一项实用诊断。研究者只需观察共同冲击和始终未受处理的供体对象,就能检查冲击是否在处理后越出了历史范围,不必查看处理对象的处理后结果。这样可以在看到政策效果之前发现风险,减少“看完答案再挑规格”的空间。
能平衡暴露,就先平衡暴露
如果有预先确定的暴露指标,例如油租占 GDP 的比例,最直接的办法是让合成对象与处理对象在该指标上也保持平衡。这样,共同冲击再剧烈,也不会仅因双方暴露不同而制造偏误。
但传统方法通常采用 simplex weights:权重非负,而且总和为 1。它只能在供体之间做插值。要精确平衡暴露,处理对象必须位于供体暴露的 convex hull(凸包)内;在只有一个暴露指标时,说白了,就是其暴露不能高于所有供体,也不能低于所有供体。
若处理对象落在凸包之外,任何这类加权估计器都会留下暴露失衡。论文还给出了明确的偏误下界:离供体暴露范围越远,处理后的样本外冲击越大,无法消除的风险就越高。这个结论覆盖文中讨论的 synthetic control、penalized synthetic control、synthetic difference-in-differences 和 de-meaned synthetic control 等 simplex 加权方法。
暴露平衡也不是免费午餐。约束权重会损害事件前拟合。论文把两者画成 exposure–fit frontier,即“暴露平衡—历史拟合前沿”:越追求暴露一致,历史曲线通常越难贴紧。这个前沿是凸的,因此研究者可以明确看到自己在用多少拟合换多少暴露平衡。
平衡不了,再用供体之间的关系校正
对于凸包外的对象,作者提出 exposure-augmented synthetic control(EASC,暴露增强合成控制)。它先照常加权,再用供体之间的横截面回归校正剩余暴露差:比较同一时期不同供体的结果变化与暴露指标,同时控制这些供体在处理前不同阶段的增长。
关键不是简单问“油越多,结果变化多少”,而是先控制供体原有的增长特征。否则,暴露与潜在增长若相关,回归会把两者混在一起。按论文的条件,这一步识别的是共同冲击真正脱离历史关系的部分,恰好补上传统加权没有处理的缺口。
该方法具有论文所称的“双重稳健性”:如果权重已经平衡暴露,回归估错也不会产生这项样本外暴露偏误;如果回归在条件成立时无偏,即使权重没有平衡暴露,也能消掉这部分偏误。不过,校正仍需要暴露程度能够包围处理对象的供体,用来支撑回归外推;这些供体不一定要在合成控制中获得正权重。
作者还给出 bias-aware confidence intervals,即把可能的系统性偏误纳入置信区间,而不只计算随机噪声。配套的 breakdown value 回答一个更直观的问题:处理前失配中,有多大比例只要是系统性的、且方向恰好不利,就足以推翻当前结论。它不是一个无条件保证,而是一把敏感性标尺。
伊朗案例把问题照得很清楚
论文研究伊朗 2012 年制裁与研究期内 2014 年油价暴跌的交叠影响。作者称,伊朗在 1996—2011 年的油租平均占 GDP 的 23%;19 个“自然比较对象”中,最高只有 17%。因此伊朗位于这些供体的油暴露凸包之外。
标准合成伊朗的处理前对数收入路径拟合很好,均方根误差仅 0.014,但油暴露仍比伊朗低 15.5 个百分点。标准结果显示,2012—2015 年人均 GDP 损失约 12%,2016 年后还有持续约 8% 的损失。
加入油暴露调整后,前一段结论保持:论文报告,不同加权估计器、暴露调整方式和两套供体池下,2012—2015 年约 12% 的损失都仍存在;placebo 值为 0.045—0.09,breakdown value 为 0.21—0.41。这里的 placebo 检验,是轮流把供体假装成处理对象,看伊朗的估计有多异常。
但长期结果变了。控制油暴露后,2016—2017 年估计接近零,2018—2024 年甚至改变符号。作者没有据此宣称长期效果为正,而是指出:2015 年后潜在因素的 leverage 太高,现有比较对象无法识别长期制裁效应。也就是说,论文支持的结论不是“长期损失不存在”,而是标准合成控制不足以证明它存在。
为什么值得关注
这项工作的价值,在于把一句模糊提醒——“处理后可能和以前不一样”——拆成三件可操作的事:用 leverage 诊断是否越出历史范围;用预先确定的指标检查并平衡冲击暴露;平衡做不到时,再用供体间关系校正,并报告结论能承受多大偏误。
作者在 12 种、每种 500 次的 Monte Carlo 模拟中测试了正常与故意破坏假设的情形。按论文报告,当冲击越出历史范围、处理对象又在暴露凸包外时,标准估计器的偏误可达真实效应的三至四倍。EASC 在假设成立时消除了偏误;假设失效时,它只能去掉暴露相关部分,留下任何估计器都无法恢复的处理对象特有部分。偏误感知区间在这两类设计中均保持覆盖。
局限与未知
- 结果目前来自作者的一篇 arXiv 论文。理论条件、模拟设计和伊朗应用尚缺独立复现。
- EASC 依赖暴露指标近似线性、处理前增长控制能够覆盖潜在载荷等条件。测量误差、非线性、未观测的第二种冲击或处理对象特有变化,都会留下无法校正的部分。
- 伊朗约 12% 的估计以何种反事实为基准、各规格的完整区间,以及长期估计改变符号的具体数值,需要结合论文完整表格判断;不能把“长期不可识别”改写成“长期没有影响”。