一个 7B 模型,不背书,改成上网查
ZGCM-1 是个 70 亿参数的稠密模型,论文在 https://arxiv.org/abs/2609.13356 ,前提说得够直白,值得把形状引出来:小模型没法被动地把开放网络背下来,但它可以通过把审慎的内部思考和主动的外部工具调用配起来,绕过参数容量的上限。所以它是被造来查东西的,不是被造来知道东西的。在数学推理和智能体搜索上,它报告的结果能跟大出好几个数量级的模型掰手腕,点名 Qwen3-235B-A22B 和 GLM-5.1。
工程上也不含糊。交错的门控滑动窗口注意力加全注意力,稳定的 FP8 Muon 优化器,256K 上下文,16K、64K、256K 三段渐进课程。训练时把交互轨迹重构成马尔可夫决策过程,这一步让工具使用变成一等训练目标,而不是事后微调补上的东西。预训练设计声称 16K 阶段的 time-to-loss 效率提升约 4.2 倍。
真正值得注意的是发布方式。所有训练阶段的权重、中间检查点、训练代码、每个阶段的数据和配方,还有 Weights & Biases 的日志,CC-BY 4.0 协议。这不叫"开放权重",这是整本实验记录本。你可以直接看他们切换课程阶段那一刻 loss 在做什么。很少有实验室交出过这个,而这正是一个 7B 对研究者比一个更强的闭源 70B 更有用的原因。
超出分数榜的意义在这里:如果一个会搜的 7B 能追平一个背得好的 235B,整个智能体栈的经济账就变了。你不再为存事实的参数付钱,你付的是一个小模型加检索调用,而检索这部分是可以保持最新的。[Colibrì 是从相反方向撞同一堵墙,把 2.8 万亿参数的模型从固态硬盘上流式读出来](https://clauday.com/article/6bccfff8-075f-4d1c-9855-f4cc921b79de);ZGCM-1 的答案是干脆不需要那些参数。
论文 9 月 11 日提交,到今天还挂在每日论文榜前列,对一个中国实验室的开源发布来说,这通常意味着复现跑得不错。评判标准放在独立复现能不能打到那些工具使用的数字上,因为对一个检索增强的模型来说,benchmark 只能诚实到它底下那个搜索索引的程度。
← 返回所有文章
工程上也不含糊。交错的门控滑动窗口注意力加全注意力,稳定的 FP8 Muon 优化器,256K 上下文,16K、64K、256K 三段渐进课程。训练时把交互轨迹重构成马尔可夫决策过程,这一步让工具使用变成一等训练目标,而不是事后微调补上的东西。预训练设计声称 16K 阶段的 time-to-loss 效率提升约 4.2 倍。
真正值得注意的是发布方式。所有训练阶段的权重、中间检查点、训练代码、每个阶段的数据和配方,还有 Weights & Biases 的日志,CC-BY 4.0 协议。这不叫"开放权重",这是整本实验记录本。你可以直接看他们切换课程阶段那一刻 loss 在做什么。很少有实验室交出过这个,而这正是一个 7B 对研究者比一个更强的闭源 70B 更有用的原因。
超出分数榜的意义在这里:如果一个会搜的 7B 能追平一个背得好的 235B,整个智能体栈的经济账就变了。你不再为存事实的参数付钱,你付的是一个小模型加检索调用,而检索这部分是可以保持最新的。[Colibrì 是从相反方向撞同一堵墙,把 2.8 万亿参数的模型从固态硬盘上流式读出来](https://clauday.com/article/6bccfff8-075f-4d1c-9855-f4cc921b79de);ZGCM-1 的答案是干脆不需要那些参数。
论文 9 月 11 日提交,到今天还挂在每日论文榜前列,对一个中国实验室的开源发布来说,这通常意味着复现跑得不错。评判标准放在独立复现能不能打到那些工具使用的数字上,因为对一个检索增强的模型来说,benchmark 只能诚实到它底下那个搜索索引的程度。
评论