如果一本行情数据库的授权到期,机构当然可以删除文件。但模型已经读过这些数据,就像学生交回了教材,脑中仍可能留下解题方法。真正棘手的问题不是“文件还在不在”,而是模型是否还在使用那段历史留下的影响。
Junyi Ye 的这项研究把问题变成一次可核验的对照实验:删除指定年份,从头训练一个新模型,再看便宜的“遗忘”方法能否得到相近结果。论文在 S&P 500 股票波动率面板上进行了 3,200 组配对比较。下文数字均来自这篇论文,尚无第二个独立信源交叉验证。
删除一年,究竟要删到哪里?
机器遗忘(machine unlearning),是从已经训练好的模型中移除特定数据的影响,同时尽量避免完整重训。时间序列让这件事格外麻烦:一天的行情不只是一行记录。
以 2020 年 3 月某个交易日为例。它可以直接出现在预测目标里,也可以藏在后续样本使用的 64 日输入窗口中,还可能影响滚动统计、缺失值填补或模型选择。于是,“删除 2020 年”至少有四种口径:只删预测目标;连输入窗口和标准化统计一起删;继续清除衍生特征中的依赖;或者排除它对调参、选模型等整个开发流程的影响。
论文把这些口径称为删除层级。层级越严格,禁用的依赖越多。研究主要采用 L1,也就是同时排除目标、输入窗口和相关标准化统计,并用 L0、L2 做稳健性检查。L3 在本实验中与 L2 相同,因为模型开发决策早于可删除年份。
这不是合同措辞上的小差别。金融模型常用滚动窗口——训练区间随时间向前移动,以免拿未来预测过去。相邻窗口彼此重叠,同一天的数据可能进入许多样本。论文发现,删除层级会同时改变需要移除的数据量和测得的“记忆差距”。换句话说,只写“删除某年”并不足以定义一次删除请求。
真正的标准不是“答不出来”
研究把使用全部数据训练的模型称为 reference;删掉指定时期后,按相同架构、参数和随机种子从头训练的模型称为 oracle。这里的 oracle 不是更聪明的模型,而是“如果当初没有使用这批数据,模型本应是什么样”的精确重训基准。
两者在被删数据上的误差差异,叫作记忆差距(memorization gap)。差距越大,说明那段数据对原模型留下的影响越强。近似遗忘方法的任务,就是把 reference 推向 oracle,而不是故意让模型不会预测被删除的年份。
论文用一个 Transformer 实验说明了区别。oracle 从未用 2020 年数据训练,却仍能在该年取得 0.51 的信息系数,reference 为 0.55。信息系数(information coefficient,IC)在这里是模型对股票未来波动率排序与真实排序之间的相关程度。两者很接近,说明模型对 2020 年的大部分判断可以从其他年份概括出来,并非来自对该年的死记硬背。
如果强行把模型在 2020 年的预测推向噪声,它反而会偏离 oracle,并损害之后的测试表现。删除一本书,不等于必须让人答错书中所有问题;他可能从别处学会了同一个道理。
危机年份留下了最深的痕迹
实验任务是预测 S&P 500 股票未来五日的已实现波动率。模型读取每只股票过去 64 日的十一项收益率衍生特征,并按每天的横截面对股票排序。研究覆盖五种神经网络架构、四个滚动分段、五个可删除年份和三个实验删除层级,共有 320 个实验单元,每个使用十个随机种子。
五种架构中,Transformer、TSMixer 和 SegRNN 在每个分段都超过四参数的 HAR 波动率模型,因此被论文归为“可部署”;iTransformer 和 PatchTST 从未超过 HAR,被归为“不可部署”。这只是论文在该任务上采用的划分,不是对这些架构的一般评价。
2020 年在每一种架构中都产生了最大的记忆差距。随机删去同等数量的训练窗口,差距接近零,说明结果不能只用“训练数据变少了”解释。作者认为,这与危机年份在保留数据中缺少替代样本相符,但实验没有识别出具体机制。
更反直觉的是:精确删除 2020 年后,三个可部署模型在四个滚动分段中全部改善,提升在 2022 年熊市测试期最大。HAR 删除后却略有退步,两种不可部署模型的反应也不一致。因此,不能简单说“2020 年数据有害”。更准确的说法是:在这组数据、架构和滚动窗口里,三个表现较好的神经网络可能过度吸收了这段特殊行情,以至于影响后来的预测。
便宜的遗忘,暂时不能通用
研究比较了继续用保留数据微调、hinge、SCRUB 和 TS-Unlearn 四种近似方法。衡量指标不是模型变差多少,而是它闭合了多少 reference 到 oracle 的差距:0% 表示仍停在原模型,100% 表示到达 oracle;超过 100% 只代表越过目标,不能写成“性能提升超过 100%”。
在十二个可部署架构与方法组合中,只有 TSMixer 配合 hinge 方法在每个滚动分段都接近 oracle,闭合 74%—118% 的差距,同时没有测得测试能力损失。hinge 可以理解为给遗忘数据上的损失设一道门槛:低于门槛时继续把它推高,同时保留其余数据上的能力。
但论文特别提醒,这次成功更像一次经验上的对齐。固定门槛恰好落在 TSMixer 对 2020 年的 reference 与 oracle 之间,并不意味着方法自己找到了正确目标。同一个 hinge 在 SegRNN 上遗忘不足,在 Transformer 上又会越过 oracle。方法排名还会随着架构和滚动窗口变化。若要可靠验收,仍需为具体架构和当前窗口训练 oracle;本实验中,一次 oracle 重训在一张 NVIDIA A100 上耗时 3—18 分钟。
审计没发现,不等于已经删净
最后一道难题是证明删除发生过。论文用不同随机种子训练多组 reference 和 oracle,再比较两组模型在被删年份上的损失分布。原模型对某段数据记得越深,删除前后的分离通常越明显;如果原本几乎没记住,精确删除之后也可能看不出显著变化。
单个窗口上的审计尤其弱。论文报告的窗口级比较最高只有 0.69,但摘要没有清楚说明这一数值对应统计量的完整定义和量纲,因此只能谨慎引用。另一个陷阱是把每只股票的窗口当成独立样本。它们共享同一天的市场截面,相邻日期的输入和预测区间也会重叠。忽略这种相关性,会让绝对 t 统计量的中位数膨胀 1.9 倍,让审计显得比实际更有把握。
这项工作的实用提醒很直接:机构需要先在合同中写清删除范围,再用匹配的精确重训模型校验近似方法,并在审计报告中交代聚合层级、重训种子数量和可检测的效应大小。一次没有发现差异的审计,只能说明“没有检测到”,不能单独证明模型已经遗忘。
局限与未知
- 证据只来自一个美国大盘股面板、一项波动率预测任务、五种架构和固定的五年训练窗口,不能外推为机器遗忘的一般规律。
- 实验确认删除 2020 年能改善三个可部署模型,却没有识别原因;架构的测试能力与记忆程度也同时变化,无法拆开解释。
- 论文称代码、模型和完整结果将在论文接收后发布;部分阈值、显著性标准及完整置信区间目前仍不足以独立复核。