给客户回访模型塞进消费价值、品类、地区和近期行为,就像给天气预报添更多仪表:信息看似丰富,却未必让“何时回来”更准。更麻烦的是,某个特征没有改善结果,可能是它确实无用,也可能只是模型根本识别不了它。
这篇论文提出“筛选后确认”:先植入一个强度已知的信号作为正向对照,确认模型能把它找回来,再检验真实特征。作者还用分类与连续两种编码,以及受时钟驱动的 NYC taxi 数据验证这套检查。这样,真实数据里的阴性结果才更有分量。
在 Amazon、Taobao、RetailRocket 和 Thumbtack 上,作者称,连续时间衰减——也就是让事件发生率随上次互动后的时间变化——已近乎够用;LTV、品类、RFM、日历和地区等信号叠加后,在公开数据集上对时间负对数似然没有统计增益,在市场数据上则无益或略有伤害。它的价值不只是说“少加特征”,而是先证明检验有能力看见信号,再相信“没有改善”。