房价模型报出“300 万”,不代表这套房一定卖到 300 万。更合理的要求是:所有被报成 300 万的房子,实际成交价平均起来也接近 300 万。这叫校准;但校准同样依赖有限数据,不能只给一个看似确定的新数字。
Gavrilopoulos 和 Ziegel 把这件事推进到条件均值预测——根据已知特征估计同类对象的平均结果。他们先用分箱或 isotonic regression(保持预测高低顺序的单调回归)重新校准模型,再构造“校准置信区间”。这里的区间围住的是校准后的均值预测,而非某个对象的实际结果;它回答的是:校准之后,这个平均数本身还有多不确定。
作者借助 conformal prediction——利用留出数据中的预测误差排序来构造区间——证明:在新旧样本可交换的前提下,区间在有限样本中至少达到预设覆盖率,而且不要求先假定结果服从某种参数分布。采用 isotonic regression 并满足额外结构假设时,区间宽度还会随样本增加渐近缩至零。论文也在高度不平衡的保险数据上演示了方法;这些保证的边界仍是可交换性及相应结构假设。