模型平时不说出某人的邮箱,不等于它没有记住。就像上锁的抽屉,内容还在,只是不好打开。Zhang 与 Mireshghallah 发现,即便后训练完全不接触私人数据,也可能让这把锁变松。这值得警惕,因为后训练——模型预训练完成后,用奖励继续调整回答方式——正被广泛用于增强能力。
研究者让三个指令模型在 1,052 道无个人信息的事实题上接受 RLVR,即用可自动核对的答案给分并强化高分回答。随后,他们测试模型能否复述 Enron 员工邮箱。最明显的是 DeepSeek-V3.1:给出姓名后,准确复述邮箱的比例从 15.5% 升至 37%;不指定姓名、只让模型自由列举时,真实邮箱数量也从 50 个增至 83 个。虚构邮箱的对照组始终为零,推理表现与拒答率基本保持,说明变化更像是原有记忆变得容易提取,而非模型单纯更爱编造或更少拒答。作者据此提醒:后训练的隐私审计不能只检查训练数据是否含有敏感信息。