2026年8月5日InfrastructureOpen Source

AirLLM 把 2.8 万亿参数的 Kimi K3 塞进 3.72GB 显存

AirLLM 连续三天挂在 GitHub trending 上,仅今天就涨了 1700 多星,总量 28K。导火索是 7月29日 发布的 v3.1.0:运行 Kimi K3 这个 2.8 万亿参数的开源旗舰,显存峰值只要 3.72GB。没打错字。模型体积是占用内存的差不多一千倍,跑在大部分游戏玩家现成的硬件上。

方法是逐层流式加载:不把模型放进内存,而是从磁盘一次读一层,算完丢掉,再读下一层。项目自己也不藏着掖着:慢,非常慢,token 是一个一个爬出来的,没人应该拿这个伺服用户。它买到的不是吞吐量,是准入权。

而准入权很值钱,星数就是证明。在此之前,摸一个前沿规模的开源模型意味着租 GPU 集群或者信任别人的 API。现在一个拿着 4GB 显卡的学生可以加载真正的 K3 权重,做探针、跑评测、抽层、研究路由。过去两周的开源潮,Kimi K3、DeepSeek V4 Flash、下周承诺放权重的 Qwen3.8-Max,一直在生产只有少数实验室跑得动的东西。让另外几百万人摸到这些模型的,正是这类工具。

仓库在 github.com/lyogavin/airllm。
← 上一篇
单卡 AMD 跑 DeepSeek V4 Flash:生态之潮打到了硬件层
下一篇 →
把任务状态挪出上下文,agent 涨 30 分
← 返回所有文章

评论

加载中...
>_