PolicyLM-1.7B:决策模型找到第一份正经工作,审核人类
决策模型这波热潮找到了一个比 agent 更早就存在的用武之地。信任与安全创业公司 Musubi 周二放出 PolicyLM-1.7B,Apache 2.0 开源权重。给它一条消息和一份用大白话写的政策,它对政策里每个类别吐一个 0 到 1 的分数。不生成任何文字,所以没有东西要解析,在一张 24GB 的 L4 上,一条短聊天消息中位数 35 毫秒,H100 上 22 毫秒。笔记本 CPU 也能跑。
对平台来说要紧的是自定义政策模式。类别就是推理时现写的几条短规则:什么算违规,什么不算,什么是例外。政策改了,不用重训。Musubi 说在它的自定义政策基准上,这个模型打赢了所有 20B 以下的模型。另外内置了英伟达 Aegis 2.0 的 23 类分类法做通用筛查,一次最多打 16 个类别,在 19 种语言上做了评估。底座是一个 1.7B 的双向 embedding 模型,用英伟达、阿里和 PolyGuard 的安全数据集微调。
联合创始人 Filip Jankovic 对 TechCrunch 说,这个思路早于 Jev,能追溯到 2024 年的 GLiNER。但产品公告故意往 Jev 上靠:如果 Jev 吸引了你,这就是同一类模型,专门为审核训练,而且你能自己跑。TechCrunch 的框架是对的。决策模型的第一份工作是管住出格的 agent,把同样便宜、输出受限的分类器拿来管出格的人,是顺理成章的下一步,经济账也一模一样:单次决策成本就是大模型审核规模化失败的原因。
模型卡对边界的坦诚程度少见。不适用于儿童安全执法,不能作为唯一的自残防线,不是对抗恶意用户的安全边界,也不审核助手自己的回复。不处理图片,不看对话历史。申诉需要一段书面理由的,请用别的东西。
最后那句就是决策模型的全部论点。这个模型服务的是 99% 现在就要一个数字的决策,不是 1% 事后要解释的决策。
链接:huggingface.co/musubilabs/policylm-1.7b,以及 techcrunch.com/2026/10/06/how-ai-decision-models-could-change-content-moderation/
← 返回所有文章
对平台来说要紧的是自定义政策模式。类别就是推理时现写的几条短规则:什么算违规,什么不算,什么是例外。政策改了,不用重训。Musubi 说在它的自定义政策基准上,这个模型打赢了所有 20B 以下的模型。另外内置了英伟达 Aegis 2.0 的 23 类分类法做通用筛查,一次最多打 16 个类别,在 19 种语言上做了评估。底座是一个 1.7B 的双向 embedding 模型,用英伟达、阿里和 PolyGuard 的安全数据集微调。
联合创始人 Filip Jankovic 对 TechCrunch 说,这个思路早于 Jev,能追溯到 2024 年的 GLiNER。但产品公告故意往 Jev 上靠:如果 Jev 吸引了你,这就是同一类模型,专门为审核训练,而且你能自己跑。TechCrunch 的框架是对的。决策模型的第一份工作是管住出格的 agent,把同样便宜、输出受限的分类器拿来管出格的人,是顺理成章的下一步,经济账也一模一样:单次决策成本就是大模型审核规模化失败的原因。
模型卡对边界的坦诚程度少见。不适用于儿童安全执法,不能作为唯一的自残防线,不是对抗恶意用户的安全边界,也不审核助手自己的回复。不处理图片,不看对话历史。申诉需要一段书面理由的,请用别的东西。
最后那句就是决策模型的全部论点。这个模型服务的是 99% 现在就要一个数字的决策,不是 1% 事后要解释的决策。
链接:huggingface.co/musubilabs/policylm-1.7b,以及 techcrunch.com/2026/10/06/how-ai-decision-models-could-change-content-moderation/
评论