2026年8月5日Open SourceInfrastructureAgents

Mistral 发布 Shieldstral:3B 审核模型,规则写在 prompt 里

Mistral 8月4日发布了 Shieldstral:30亿参数的内容审核模型,Apache 2.0,权重直接放 Hugging Face,单张 16GB GPU 就能跑。支持文本、图片和图文混合内容,官方口径是打平或超过体积大它七倍的开源 guard 模型。

聪明的地方在接口设计。Shieldstral 把审核变成一个二元问答任务:推理时把你的内容政策用大白话喂给它,一次前向传播返回一个校准过的 yes/no 概率。大多数 guard 模型的分类标准是训练时焊死的,规则一变就得重训。这里政策就是 prompt 的一部分,改规则等于改一段文字。

对做 agent 的人来说这件事的分量在于:任何认真的 agent 循环都需要一道又便宜又快的进出关卡,而且每一轮都要过。3B 模型加一张中端卡,正好是常驻服务该有的成本曲线;政策放推理时,意味着同一个部署能同时服务十个规则各不相同的产品。

发布当天就是 HN 第一。权重在 huggingface.co/mistralai/Shieldstral-1.0-3B,公告在 mistral.ai/news/shieldstral。
← 上一篇
Warp 造了五年终端,然后把 agent 拆出来单卖了
下一篇 →
Uber 开源 ADR:生产环境里跑着的 agent 安全栈
← 返回所有文章

评论

加载中...
>_