同一段内容,放在安全研究工具里可能合理,出现在未成年人产品中却未必合适。企业因此需要一名守在 AI 前后的“门卫”:Shieldstral 是 Mistral 推出的 30 亿参数安全分类器,专门检查用户输入和模型输出,也能同时处理文字与图片。
它最值得注意的地方,是不把安全规则固定在模型里。企业可在推理时——也就是模型实际处理请求时——用自然语言提问,例如“这张图片适合未成年人吗?”。Shieldstral 随即给出连续的安全分数,方便系统按阈值拦截、标记或转人工审核,无须每换一套政策就重新训练。
据 Mistral 自述,这个开放权重模型采用 Apache 2.0 许可证,可在单张 16GB NVIDIA GPU 上运行;在文字安全、拒答识别、策略适应和多模态审核等测试中,可匹敌或超过体量大至七倍的开放防护模型。它是否能进入企业推理链路,关键仍要看自定义政策在真实业务中的稳定性与误判成本。