2026年9月14日InfrastructureResearchAgents

每个智能体沙箱省 8.7 倍内存,诀窍在于什么时候压

规模化跑智能体就意味着规模化跑沙箱,而沙箱大部分时候就是一堆闲着的内存。每一个都从同一个模板启动,干一小会儿活,然后在模型思考的时候攥着内存干坐着。arXiv 2609.11294、9 月 10 日提交的 AgentZip,在沙箱自有内存上做到最高 8.7 倍的压缩率,而标准 Linux 的压缩只能做到 2.1 倍。https://arxiv.org/abs/2609.11294

靠三件事做到,第三件最值得偷。第一,它利用了模板相关和跨沙箱的冗余——一千个从同一模板起的沙箱共享着海量几乎相同的状态,而它的压缩器被设计成能从"相似"的页里获利,而不是要求"完全相同",后者正是常规去重放弃的地方。第二,它把作用范围从冷页扩大到任何有划算表示的页。第三,也就是那个洞察:压缩按执行阶段调度,而不是按内存压力。标准系统是在内存快用完的时候压,而那恰恰是负载最需要快的时候。AgentZip 选在大模型思考的时候压,反正那段时间沙箱本来就是空转。

这一换位把成本从错的地方挪到了对的地方。开销不再是压缩时的选页,而变成了恢复时的预取,而预取是可以预测的。结果是:激进压缩本来要付 3.1 倍的减速,现在降到 1.40 倍,同时几乎保住了全部内存收益。七位作者,Mengming Li 领衔,同时归类在 AI 和操作系统两个方向下——这个分类组合是对的,也是这个领域正在往哪儿漂的一个信号。摘要里没有代码仓库。

背景是集群经济性已经变成一条真实的成本项。[Herdr 之所以做多机版](https://clauday.com/article/a54f4a11-575b-4ca5-baf1-ca251ad8af0d),是因为智能体机群撑爆了一台笔记本;[substrate blindness 之所以有了名字和数字](https://clauday.com/article/7e90a965-bacf-431b-9668-898886a3b393),是因为智能体总表现得好像脚底下那台机器是免费的。它不免费。在"我笔记本上跑一个智能体"和"高扇出沙箱"之间的某个点上,单沙箱内存从可以忽略的零头变成了决定你能并行跑多少个智能体的那个数。

这里能带走的一般性教训比这篇论文本身大。智能体的循环里天然嵌着一个巨大、可预测、周期性的空闲窗口——每次模型在生成,沙箱就没事干。而大多数基础设施仍然按资源压力来调度工作,这个习惯继承自那些不会以固定节奏停顿好几秒的负载。做智能体基础设施的人都该问一句:还有什么该塞进那个窗口。快照、GC、索引重建、日志上传,现在全都在毫无必要地跟执行抢资源。
← 上一篇
COBRA-Skills 靠「不全测」把技能调优成本砍掉一半
下一篇 →
AgentsDock 把 Claude Code、Codex、Cursor 装进一个窗口,还装进手机
← 返回所有文章

评论

加载中...
>_