2026年9月19日AgentsOpen SourceInfrastructure

Needle 3 只有 8MB,工具调用打得过大它十倍的模型

Cactus Compute 发布了 Needle 3,一个面向微型设备的自动化基础模型,而它的卖点就是那组尺寸数字:磁盘上 8 到 29 MB,2900 万到 1.21 亿参数,权重量化到 CQ2-bit。移动端工具调用上打赢大它十倍的模型,结构化抽取上打平大两到三倍的模型。在 Cactus 平台上微调之后,一个从 2900 万参数起步的四层 Needle 3 超过 DeepSeek V4 Flash。Show HN 帖对应的页面在 https://cactuscompute.com/needle,权重和各平台引擎在 Hugging Face 的 Cactus-Compute/needle3,代码在 https://github.com/cactus-compute/needle。

架构上的花招叫 intelligence laddering。一个二进制里装着从 2 层到 20 层的子网络,同一个产物既能跑单片机又能跑手机,部署时挑深度,而不是发五个模型。底下是 Laddered Simple Attention Network,用 Monarch Hadamard MLP 顶掉 FFN,GQA 注意力加因果卷积抽头,一块靠 gather 读取的 engram n-gram 记忆,再加多通道超连接。作者的说法是 1.21 亿参数的模型只做 5000 万参数的算术量。每个生成的 token 都被一套从你的 schema 编译出来的字节级语法约束住,这也是为什么抽取能在这个尺寸上work:模型不是被信任去产出合法 JSON,是被结构性地禁止产出别的东西。

它只干三件事。工具调用,也就是从用户请求里选函数、填参数。结构化抽取成带类型的 JSON 字段。文本 embedding 用于本地语义检索。这份窄,正是那些数字成立的全部原因,而且它对 agent 往哪走的论证,比大部分前沿模型的讨论都更有说服力。agent 里决定"调哪个工具、传什么参数"的那一部分不需要前沿模型,它需要的是快、本地、便宜、受约束。

针对特定数据集微调能把表现拉高 18 到 36 个百分点,这个幅度大得惊人,也正是那句诚实的注脚:开箱即用是好用,任务微调之后才是那个超过 DeepSeek V4 Flash 的东西。Needle 走 Apache 2.0,而 Cactus Engine 是自己的 source-available 协议,你依赖的是哪一块得自己看清楚。macOS、Linux、Windows、Android、iOS 和 WebAssembly 都有预编译引擎。
← 上一篇
谷歌给家庭 AI agent 开了个它自己的谷歌账号
下一篇 →
Opus 4.8 写不出来的 exploit,Opus 5 写出来了,终点是 OpenAI 的内部单仓
← 返回所有文章

评论

加载中...
>_