一张图到底该不该放行?它可能是在判断“是不是热狗”,也可能是在检查暴力、仇恨等风险。Mistral 的 Shieldstral 想把这类判断交给一个较小的模型完成。它是一款多模态安全分类器——既能检查文字,也能检查图片;3B 表示约 30 亿个可学习参数,较小规模通常更方便单机部署,但不等于审核一定更准。据 arXiv,论文于 2026 年 7 月 28 日提交。
最值得注意的是它对审核规则的处理。Shieldstral 把不同政策统一改写成 yes/no 问题:用户用自然语言提出标准,模型判断内容是否符合。换句话说,开发者不必只在训练时固定的风险类别里做选择。论文称,其训练数据约 5410 万条;在文本安全基准上达到或超过接近七倍规模的模型,并在多模态安全分类中取得当时最佳结果。不过,这些效果均为作者报告,实际部署仍要结合具体政策验证。