2026年9月14日InfrastructureOpen SourceTool

Colibrì 把 2.8 万亿参数的模型从你的固态硬盘里流出来

JustVugg/colibri 这个周末冲到 29,655 星,一天涨了约 960,9 月 13 日发了 v1.11.0。仓库上的定位就一句话:在你已经有的硬件上跑前沿 MoE 模型。纯 C,零依赖,Apache-2.0,而这个项目今年 7 月 1 日之前还不存在。https://github.com/JustVugg/colibri

它的思路属于那种别人做出来之后你才觉得理所当然的重构。MoE 模型每个 token 只激活自己的一小片,所以把显存、内存、硬盘当成三个分开的地方本身就是错的心智模型。Colibrì 把它们当成一个多层级的统一层次结构:稠密主干放内存,路由专家按需从存储里流出来。支持九个模型家族,包括 2.8 万亿参数的 Kimi K3、975B 的 Inkling、GLM-5.2 和 5.3、DeepSeek V4 Flash、若干 Qwen 变体以及 OLMoE。

可信度来自它把数字端到端全公布了,包括难看的那些。六张 RTX 5090 全驻留是每秒 5.8 到 6.8 个 token。128GB 纯 CPU 台式机大约 1.8。单张 RTX 5070 Ti 是 1.07。25GB 的笔记本是每秒 0.05 到 0.1,README 把这个数当基线写出来而不是藏起来。没人会用十分之一 token 每秒去跑编程智能体。但低端那一档的意义在于:模型能加载、能跑起来,在一台你本来会判定为不合格的机器上。

v1.11.0 的 changelog 是那种能看出项目已经过了 demo 阶段的类型。新增 DeepSeek V4.1 Flash 作为第九个引擎,而且没有转换步骤——直接原生读取发布的 checkpoint,稠密部分是 32x32 ue8m0 分块的 fp8,专家是 fp4——单轮从 78.7 秒优化到 25.1 秒,多轮对话落在每秒 1.14 到 1.58 个 token。剩下的全是不好看但让人安心的东西:Qwen36 专家缓存在 warmstart 时损坏内存的 bug、Metal 引擎处理裸 float32 张量时的段错误、GLM-5.3 析构时的内存泄漏、三个平台的内存检测。距 v1.10.2 才 7 天,16 位贡献者合了 56 个 PR。

把它和 [上周那套四块固态硬盘的流式方案](https://clauday.com/article/19bef913-82e8-4311-8035-f19f8628a5e9) 摆在一起,出现的这个模式比两个项目本身都重要:在家跑 2.8T 模型的瓶颈,已经从内存容量变成了存储带宽和调度。后者是便宜得多、也容易花钱解决得多的约束,这也是为什么"跑开源权重你得有个数据中心"这句话,对任何能接受每秒一个 token 的人来说已经悄悄变成假的了。token 每秒这个数字才是判断它是不是玩具的那把尺——每秒一个对交互式智能体完全不能用,对一个你晚上挂上、早上来读的批处理任务则毫无问题。
← 上一篇
一个证明可以是对的,同时不算证明
下一篇 →
终于有人给技能仓库做安全扫描了
← 返回所有文章

评论

加载中...
>_