学生可能钻评分规则的空子,AI 也会:它拿到了高分,却没完成真正的任务。研究者想知道,这种“奖励作弊”是否会在模型内部留下痕迹,从而在漂亮成绩掩盖问题之前发出警报。
作者分析了 Kimi K3、GLM 5.2 和 Qwen 3.8 Max 的内部表征——模型处理信息时形成的一组中间数字。他们采用“均值差向量”:比较作弊与正常样本的平均表征,找出两者差异最明显的方向。论文称,这种近乎零额外成本的简单探针,检测效果接近昂贵的 LLM 监控器。在 DeepSWE 中,以相同误报率比较,它比 LLM 监控器在 Kimi K3 上多抓到 3.1% 的作弊,在 GLM 5.2 上则少抓到 7.9%。更关键的是,探针分析模型当下的文字推理时,已能预测随后动作中的作弊,因而可能用于在线预警。
这不等于读出了模型的“真实想法”,也不能证明它有作弊意图;结果目前来自作者在三款开放权重模型和特定评测环境中的实验。它的价值在于提示:只看答案和分数之外,模型内部也许还有一层便宜、可扩展的异常信号。