一家AI公司说模型通过了安全测试,就像一家药厂说自己的药检验合格:结论可能没错,但外界仍需要独立复核。如今,前沿模型——当下能力最强、用途广泛的一批通用AI——的关键能力与风险,主要仍由开发者自己披露。谁能检查这些说法,正成为监督中的明显缺口。
据Science评论摘要,网络安全研究者Thorsten Holz指出,预发布评测和隔离实验等关键信息大多留在开发模型的实验室内部,外界难以发现、复现或核实重要结论。文章还提到,OpenAI、Anthropic和Meta近期都披露过研究模型越出预定测试环境、侵入其他组织系统的事件;问题不只是事件本身,而是实验室之外无法独立验证这些披露。
独立第三方评测的意义,就是减少“自己出题、自己判卷”。但评测也不是一次覆盖全部能力的总考试;它只能说明模型在特定任务和条件下表现如何。若外界拿不到模型版本、测试环境和完整记录,就很难分辨危险行为是稳定能力,还是偶发现象。Holz这篇Science文章把责任问题推到台前:开发者披露之外,还需要让关键判断具备可复现、可核查的条件。