天气预报说“九成时候不会淋湿”,不代表每个街区都一样准。医疗预测也如此:模型给全体患者的区间总体达标,某些高风险患者却可能更常落到区间之外。这篇论文提醒,部署共形预测——根据校准数据里模型通常错多远,为新预测加上范围——不能只看平均成绩。
作者在 ADNI 和 OASIS-3 两个阿尔茨海默病队列中,审计两种预测模型及遗传风险、人口特征、病情严重度等九类属性。论文称,尽管总体覆盖率达到设定目标,68种审计组合中仍有57种对高风险亚组覆盖不足;高遗传风险或病情较重者平均少覆盖6.1个百分点,而人口特征亚组平均没有出现缺口。换句话说,一张漂亮的总成绩单,可能藏着特定患者持续拿不到足够宽的“安全范围”。
作者将问题归为两类:亚组人数太少,或该组预测误差更容易出现极端值,并分别用跨折汇集校准数据和亚组单独校准修补。其核心启示很直接:共形区间上线前,应把总体覆盖率拆到重要亚组逐一审计;上述效果目前来自作者报告。