Mistral AI 推出 Shieldstral 3B 模型用于 AI 安全审核

Mistral AI 推出 Shieldstral,一款面向 AI 安全审核的 3B 参数多模态分类模型。论文称,该模型在文本安全基准上可达到或超过参数规模近 7 倍的模型,并在多模态安全分类任务上取得新的最佳结果。

Mistral AI 推出 Shieldstral,一款专门用于 AI 安全审核的 3B 参数多模态安全分类模型。根据相关论文介绍,Shieldstral 的目标不是生成内容,而是判断文本或图像等输入是否违反指定的安全政策,从而为聊天机器人、智能体和其他生成式 AI 应用提供审核环节。

Mistral AI 推出 Shieldstral 3B 模型用于 AI 安全审核主题相关图片
来自网络

Shieldstral 将内容审核统一建模为一个二元问答问题:给定一项安全政策和待审核内容,模型回答内容是否符合该政策。论文认为,这种设计可以将具有不同分类体系的安全数据集纳入同一训练框架,也便于开发者根据自身政策调整审核标准。

在模型规模方面,Shieldstral 使用 3B 参数。论文称,它在文本安全基准上的表现可以达到或超过参数规模接近其 7 倍的模型,并在多模态安全分类任务上取得新的最佳结果。不过,这些结论来自论文披露的实验设置,实际表现仍取决于政策定义、数据分布、阈值配置和部署场景。

论文还介绍了 Shieldstral 的数据构建方法,包括数据筛选、生成和政策适配流程,并称相关训练数据规模约为 5410 万条样本。对于需要本地部署或低延迟审核的应用,小参数模型的定位可以降低对大模型审核器的依赖,但企业仍需要结合人工复核、日志审计和针对业务场景的评估集,建立完整的安全审核流程。

Shieldstral 的思路与 Mistral 现有的审核产品形成互补。Mistral 官方文档显示,其审核服务可以对文本进行多类安全政策分类,并提供专门的审核 API。Shieldstral 则更强调小规模、可适配政策的模型形态,重点在于让安全审核能力更容易嵌入不同的 AI 应用和部署环境。