一张脑部影像看起来能预测某种健康风险,模型却可能只是认出了年龄或性别。只要这些因素既藏在影像里,又与结果相关,网络就会把它们造成的差异错算到影像头上。这叫遗漏变量偏差:预测可能仍然准确,但关系解释已经失真。
Pfeuffer 等人把传统回归里的控制变量方法带进深度神经网络。他们不重新训练整个模型,而是改装预训练网络的最后一层,把年龄等已知混杂变量单独纳入,让“影像贡献”和“混杂因素贡献”分开估计。为避免两者互相顶替,方法还采用交叉拟合——用不同批次数据训练网络与重估最后一层——并以岭惩罚稳定小样本下的结果。
论文在模拟图像中恢复了真实效应;在人工引入混杂的真实神经影像数据上,预测表现也回到接近无混杂数据训练模型的水平。更重要的是,作者指出,仅让预测结果与混杂变量不相关,并不能消除遗漏变量偏差。说白了,“模型没显出偏见”不等于“模型找对了关系”。