一家连锁店想把直营店训练出的销量模型用到加盟店,却拿不到加盟店的逐笔销售记录,只能看到“周末销量占比”“各商品年均需求”之类的汇总。麻烦在于,客群和季节规律一变,就会出现分布漂移——训练环境与实际部署环境的数据规律不同,原模型可能随之失准。
Zhang 和 Rothenhaeusler 提出的 SAGE,会从目标总体的分组人数、均值等摘要中估计修正方向,再对来源域——拥有个体训练数据的人群——的模型做一次更新。关键不只是“往哪改”,还有“改多少”:步长同时考虑摘要的抽样噪声和分布漂移强度,避免信息有限时把模型推得太远。论文证明,在其随机漂移模型下,SAGE 可降低相对原模型的平均渐近目标超额风险;最优步长的渐近均方误差也不高于 entropy balancing——通过重新加权来源样本来匹配目标摘要的方法。
作者报告,SAGE 在多组真实数据、不同样本量和漂移设置下,通常比原模型及忽略漂移的一步更新更好,也比 entropy balancing 更稳定。不过,这种适配能修正多少,仍取决于目标机构愿意提供哪些人群和变量的摘要。