Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER HF 29 约 1 分钟

两次前向就能查出模型偷看未来

只改输入后半段、跑两次模型,就能逐层查出它有没有偷看未来。

像考试时有人从答案页倒着偷看,序列模型也可能在处理一句话的开头时,意外读到后面的内容。这篇论文提出一种轻量审计:准备两段开头相同、后半段不同的输入,各做一次前向计算——即只运行模型,不训练也不改参数。若相同开头在某一层得到的表示发生变化,就违反了“前缀不变性”,说明未来信息已从这一层渗入。

这比检查因果掩码更全面。因果掩码本应像单向窗,禁止模型看见未来;但错误也可能藏在状态扫描、信息汇总或归一化中。作者在八个模型检查点上进行了192次人为故障试验:常规掩码检查一次也没发现,新方法则将192次全部定位到准确层。论文还称,它在 Zamba2 和 Nemotron-H 的分块扫描代码中找到了同一种跨块轴错误。整套审计无需梯度,作者称数秒即可运行;目前这些效果来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块