四块 SSD 硬灌 2.8 万亿参数:MacBook 跑 Kimi K3,一秒一个 token
有人在 MacBook Pro 上跑起了 Kimi K3——一个 2.78 万亿参数的 MoE,光专家权重就约 1.45TB。速度:每秒一个 token。9 月 8 日发布的 deltafin 分支(HN 首页,149 分)的解法:用 pread 加 F_NOCACHE 把专家权重直接从四块外接 SSD 上流式读进来,吃的是每层 896 个专家里只激活 16 个这个事实。M5 Max 从头到尾不装下整个模型,只装工作集。
作者在 HN 帖子里对这东西是什么、不是什么很坦诚。一秒一个 token,聊天完全没法用。但聊天本来就是错误的参照系:这不是聊天机器人,是一台过夜批处理机。睡前排进一个 agent 任务,早上醒来拿到几千 token 的前沿开放权重输出,数据全程没出过你的桌面。对那些约束是数据不出境而不是延迟的人,这是一个真实存在的品类。
它也把我们一直在追的 substrate 故事又推进了一格:OpenAI 在成千上万台地买 Mac mini 跑 agent 负载(https://clauday.com/zh/article/b4fa0ee4-7221-4871-918f-338c381a9aa2),oMLX 把本地编码 agent 做到了能忍(https://clauday.com/zh/article/73bb73f5-e4a7-499d-ab19-7312b166b6e6),现在爱好者的前线问题变成了"多大的模型能从我的 USB-C 口里物理通过"。这个数字上涨的速度,比所有人的预算都快。
仓库:https://github.com/argonautlabsai/deltafin
← 返回所有文章
作者在 HN 帖子里对这东西是什么、不是什么很坦诚。一秒一个 token,聊天完全没法用。但聊天本来就是错误的参照系:这不是聊天机器人,是一台过夜批处理机。睡前排进一个 agent 任务,早上醒来拿到几千 token 的前沿开放权重输出,数据全程没出过你的桌面。对那些约束是数据不出境而不是延迟的人,这是一个真实存在的品类。
它也把我们一直在追的 substrate 故事又推进了一格:OpenAI 在成千上万台地买 Mac mini 跑 agent 负载(https://clauday.com/zh/article/b4fa0ee4-7221-4871-918f-338c381a9aa2),oMLX 把本地编码 agent 做到了能忍(https://clauday.com/zh/article/73bb73f5-e4a7-499d-ab19-7312b166b6e6),现在爱好者的前线问题变成了"多大的模型能从我的 USB-C 口里物理通过"。这个数字上涨的速度,比所有人的预算都快。
仓库:https://github.com/argonautlabsai/deltafin
评论