一家客户去年旺季买得多、今年淡季买得少,系统可能立刻把它判成“正在流失”。问题不一定出在预测模型,而在标签:常见做法把相邻两段时间的活动量作比较;两段落在不同季节时,正常的旺淡季变化也会被写成客户下滑,模型随后学到的其实掺杂了“季节识别”。
Islam 和 Mohammed 审计一个已上线的企业服务市场系统后发现,改用季节对齐的标签,原有预警名单从 119 个账户缩至 79 个,约三分之一的运营名额因此释放。三组公开数据中,原先标记的下滑事件有 37%—69%无法在季节对齐后对应;生产数据中的比例为 28%—50%。
论文给出的修正很直观:做同比校正,也就是把当前表现与上一年相近月份比较。这样能从标签源头减少季节性假警报,但代价是需要更长历史数据,也可能漏掉“先下滑、后稳定”的客户。上述效果均为作者报告。