Gemma 4 26B,跑在 2GB 内存里,还是台 8GB 的 MacBook Air
turbo-fieldfare 冲上了 Hacker News 榜首,靠的是一个听起来根本不可能的说法:它能在 Apple Silicon 上、包括那台 8GB 的入门款 MacBook Air 上,用大约 2GB 内存跑 Gemma 4 26B-A4B。完整模型有 14.3GB。那你怎么把一个 14GB 的脑子塞进一个 2GB 的房间?
答案是你压根不全加载。Gemma 4 是个 mixture-of-experts 模型,意思是任何单个 token 实际上只会用到一小片权重。turbo-fieldfare 把 1.35GB 的共享核心和 KV 缓存常驻在内存里,然后在生成需要的时候,按需从 SSD 上流式读取各个 expert,配一个 16 槽的缓存把热的那些留住。再加上给 4-bit 量化运算写的自定义 Metal kernel,你在一台 M2 Air 上能拿到每秒 5 到 6 个 token,对一次聊天或者一个 agent 循环来说,是真能用的速度。它是原生 Swift 加 Metal 的运行时,Apache 2.0,附带一个 Mac app、一个 CLI,还有一个带函数调用支持的、OpenAI 兼容的本地回环服务器。
最后这个细节才是这里的关键。这不是一个聊天机器人 demo,而是一个带工具调用的本地推理引擎,也就是说你可以让一个 agent 指向 localhost,把整个循环跑在一台不用额外花钱的笔记本上,离线,数据永远不离开这台机器。本地 AI 这两年的故事一直是买更多显存。expert streaming 把它翻了过来:瓶颈从你有多少内存,挪到了你的 SSD 读得有多快,而 SSD 很便宜。在苹果卖的最便宜的 Mac 上跑一个前沿级别的 MoE,是那种会悄悄重设独立开发者能力边界的事。仓库在 github.com/drumih/turbo-fieldfare。
← 返回所有文章
答案是你压根不全加载。Gemma 4 是个 mixture-of-experts 模型,意思是任何单个 token 实际上只会用到一小片权重。turbo-fieldfare 把 1.35GB 的共享核心和 KV 缓存常驻在内存里,然后在生成需要的时候,按需从 SSD 上流式读取各个 expert,配一个 16 槽的缓存把热的那些留住。再加上给 4-bit 量化运算写的自定义 Metal kernel,你在一台 M2 Air 上能拿到每秒 5 到 6 个 token,对一次聊天或者一个 agent 循环来说,是真能用的速度。它是原生 Swift 加 Metal 的运行时,Apache 2.0,附带一个 Mac app、一个 CLI,还有一个带函数调用支持的、OpenAI 兼容的本地回环服务器。
最后这个细节才是这里的关键。这不是一个聊天机器人 demo,而是一个带工具调用的本地推理引擎,也就是说你可以让一个 agent 指向 localhost,把整个循环跑在一台不用额外花钱的笔记本上,离线,数据永远不离开这台机器。本地 AI 这两年的故事一直是买更多显存。expert streaming 把它翻了过来:瓶颈从你有多少内存,挪到了你的 SSD 读得有多快,而 SSD 很便宜。在苹果卖的最便宜的 Mac 上跑一个前沿级别的 MoE,是那种会悄悄重设独立开发者能力边界的事。仓库在 github.com/drumih/turbo-fieldfare。
评论