假设一个预测系统换到新地区后,用户年龄结构变了。为了让预测区间仍然靠谱,加权共形预测会让更像当地用户的历史样本发挥更大作用。问题是,分布差异越大,权重越容易集中在少数样本上,校准成本也越高,甚至可能只能给出“整个实数轴”这种毫无用处的区间。
Mehrdad Pournaderi 提出的 sketched calibration,先把协变量——也就是年龄等输入特征——压缩成低维“草图”,再计算权重。论文给了一个很直观的例子:目标人群只在与预测结果无关的特征上发生变化,完整加权仍会为这次漂移付出代价;若草图只保留真正影响结果的方向,就能避开这笔开销。作者证明,压缩不会增加由分布漂移带来的校准成本。
但压缩不是免费午餐。被丢掉的特征若同时关联漂移与预测结果,误差会以“泄漏”形式回来,使覆盖率下降。论文也证明,对固定评分的阈值式方法,这种损失无法普遍消除。换句话说,这项工作的价值不只是省算力,而是把“省多少”和“可能错多少”放进了同一套可分析的权衡里。