2026年8月31日InfrastructureCodingOpen Source

oMLX 修好了本地编码 agent 最难受的那一件事

在 Mac 上拿本地模型跑编码 agent,一直有一个很丑的失败模式。agent 一口气发几十个请求,提示词的前缀每次都轻微地挪一下,而现有的每一个 MLX 服务器一遇到这个就把 KV 缓存整个扔掉,从头把全部上下文重算一遍。上下文一长,就意味着第一个 token 出来前要等三十到九十秒。在 agent 循环的每一步都这么来一次,模型不是慢,是根本没法用。

oMLX 是一个跑在 Apple 芯片上的菜单栏应用,直接冲着这个问题去。它的核心招数是分页 KV 缓存加分层存储——热的块放内存,冷的块落到 SSD——这样当一个你见过的前缀再回来,它是从磁盘恢复而不是重算。用户反馈长上下文下的首 token 时间从那三十到九十秒,掉到了一到三秒。底层是一个包着苹果 MLX 的 FastAPI 进程,一个能把好几个模型同时留在内存里的引擎池,基于块的分页缓存带前缀共享和写时复制,还兼容 OpenAI 和 Anthropic 的 API,所以 Claude Code、OpenClaw、Cursor 可以直接指过来。

它是 Apache 2.0 开源,可以用 .dmg 装、用 Homebrew 装、或者从源码装,同一套批处理栈还能跑视觉语言模型、OCR 和 embedding 模型。它之所以重要,不止是省事,而是我们反复回到的那条成本线:当前沿模型贵到不能再当默认,问题就变成你到底能在本地跑出多好的一套,而瓶颈从来不是模型,是那个把算好的东西又扔掉的服务层。oMLX 就是那个服务层的解法。仓库在 github.com/jundot/omlx。
← 上一篇
Superagent 给 Claude Code 配了台真电脑
下一篇 →
Maritime 想用一个月一美元帮你托管 agent
← 返回所有文章

评论

加载中...
>_