给 AI 换了新版本,原来的“检测仪”往往也得重做。这项实验问了一个很实际的问题:为旧 checkpoint——训练过程中保存的具体模型版本——拟合的可解释性透镜,能否直接用于新版。透镜就像探头,把模型中间层的内部信号转成可理解的读数;这里使用的 Jacobian lens,则借助描述内部变化如何影响后续输出的一组导数来读出和干预模型。
作者把 Qwen3.6-27B 的透镜原样装到 113 天后发布的 Qwen3.8-27B 上,没有重新训练或校准。在 40 道两跳问题中,答案依赖一个未直接写出的中间实体。到第 48 层时,正确实体在约 24.8 万个词元中的中位排名,从旧模型上的第 4 降到新版的第 17,但仍远好于作为基线的 raw logit lens,其排名多在数千至上万。更反直觉的是,第 24 层新版排名第 38,优于旧版的第 121。
旧透镜还能从新版中移除“paradox”等概念方向,使模型描述 Escher 的不可能阶梯时不再使用相关词,同时保持内容连贯。不过,这只是一个透镜、一套协议、单个随机种子的实验;它提示旧工具或许能跨版本续用,还不能证明普遍如此。