14MB 的 agent 模型,跑在 200 美元的手机上
Cactus Compute 把 Needle 2 发到了 Show HN:4500 万参数,压成一个 14MB 的单文件二进制,跑完整个 session 只占 28MB 内存。Apache 2.0,权重在 Hugging Face,运行器在 GitHub。
它不聊天,也不写文章。它只做工具调用、设备操作和结构化抽取——这是个刻意的、甚至有点狠的裁剪:把 agent 的调度器用不上的东西全砍掉,看看调度器能小到什么程度。答案是 14MB。Google Mobile Actions 榜上 63.7%,树莓派 5 上解码每秒 500+ token,Quest 3S 上 400 到 1500,200 美元以下的安卓机上 300 到 700。不要 GPU,不要 NPU,ESP32-S3 上都能跑。
他们主打的对比是:跟 FunctionGemma 270M、LFM2.5 230M 和苹果的端侧基础模型互有胜负,而体积小 5 到 70 倍。跟大一个数量级的东西互有胜负,这个说法值得去验,好在权重就摆在那里,谁都能验。
跟 Meta 那个 30B 本地 agent 模型同一天,这个巧合挺妙。Glimmer 是在你笔记本上思考的 agent,Needle 2 是住在你电灯开关里的 agent。真正有意思的问题是:agent 的实际工作里有多大比例属于第二种——理解意图、挑工具、填参数——以及这部分是不是从来就不值 300 亿参数。
https://cactuscompute.com/needle
← 返回所有文章
它不聊天,也不写文章。它只做工具调用、设备操作和结构化抽取——这是个刻意的、甚至有点狠的裁剪:把 agent 的调度器用不上的东西全砍掉,看看调度器能小到什么程度。答案是 14MB。Google Mobile Actions 榜上 63.7%,树莓派 5 上解码每秒 500+ token,Quest 3S 上 400 到 1500,200 美元以下的安卓机上 300 到 700。不要 GPU,不要 NPU,ESP32-S3 上都能跑。
他们主打的对比是:跟 FunctionGemma 270M、LFM2.5 230M 和苹果的端侧基础模型互有胜负,而体积小 5 到 70 倍。跟大一个数量级的东西互有胜负,这个说法值得去验,好在权重就摆在那里,谁都能验。
跟 Meta 那个 30B 本地 agent 模型同一天,这个巧合挺妙。Glimmer 是在你笔记本上思考的 agent,Needle 2 是住在你电灯开关里的 agent。真正有意思的问题是:agent 的实际工作里有多大比例属于第二种——理解意图、挑工具、填参数——以及这部分是不是从来就不值 300 亿参数。
https://cactuscompute.com/needle
评论