同一把尺子,在不同人群里可能量出不同的“模型水平”。如果一种治疗对所有人的效果都差不多,模型再准确,也很难把获益多的人排在获益少的人前面。Bouvier 等人研究的正是这种人群依赖性:真实的治疗效应异质性——治疗对不同人的帮助或伤害究竟相差多大——会怎样改变判别力。
作者设定了一个“oracle”情境,也就是直接知道真实的条件平均治疗效应(CATE,给定年龄、病情等特征后,某类患者接受与不接受治疗的平均结局差),从而排除模型估计误差。他们在 20 种治疗效应分布上计算三项判别指标。结果差异很大:标准化 PAPE 为 0.010—0.961,benefit concentration 为 0.310—1.000,c-statistic for benefit 为 0.537—0.977。更反直觉的是,benefit concentration 在治疗效应差异几乎可以忽略时,仍可能显示“完美判别”;而较高的 c-statistic 和 PAPE 需要更强的真实异质性。
这意味着,判别分数既反映模型,也反映人群本身有没有足够明显的差异可供排序。比较个体治疗效应模型时,不能脱离目标人群,也不能把不同指标的高分当成同一件事。