就像考试前不能让学生看见试卷,AI 评测也怕模型提前接触测试题:一旦训练材料里出现过题目或近似答案,高分可能来自记忆,而不是真实能力。这叫“基准测试污染”。DeepMind 正与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,试测一款 Gemini Flash Lite 模型,希望让专有模型的外部评测更可信。
这次试行的关键不是简单隐去品牌,而是把双方的秘密关进一个密码学“盒子”。借助 Google Cloud 的 Confidential Space,评测方看不到 Gemini 的模型权重——也就是模型内部学到的参数;Google 则看不到保密测试题。系统通过密码学证据验证双方数据仍由各自掌控。过去,外部机构往往要在交出题目和要求厂商交出模型权重之间二选一,这套流程试图绕开这一矛盾。
DeepMind 称,这是面向专有前沿模型的首个双盲评测。不过现有材料未披露具体测试结果,也没有说明评测方是否不知道模型品牌;目前能确认的“盲”,主要是测试题与模型权重彼此隔离。