2026年9月27日InfrastructureRLResearch

DeepSeek DSec:一天三百万个沙箱,这才是代理强化学习的真实成本

每个单元每天新建三百万个沙箱,同时跑着的有 38 万个,每秒新起五千多个。这是 DeepSeek Elastic Compute,也就是 DSec 论文里的生产数据。这篇署名 131 人以上的论文讲的是 DeepSeek 代理训练背后的沙箱平台,9 月 26 日上了 Hacker News 首页。

思路是一个 SDK 罩住四种隔离级别:纯函数调用、容器、microVM、完整虚拟机。训练循环不用关心某个任务需要哪一种。DSec 负责跨集群放置沙箱、管理生命周期、rollout 结束后回收。有状态的执行和 GPU 训练是解耦的,所以代理等 pip install 的时候,昂贵的加速卡不会干等着。镜像通过 DeepSeek 自家的萤火虫文件系统 3FS 分发,再靠内存共享把每台机器上的执行密度压上去。

就算你这辈子不训模型,这篇也值得读,因为它说明了代理强化学习的真正瓶颈挪到了哪里。模型是靠在代码仓库里动手、调工具、跑命令来学习的,每一次 rollout 都要一个全新的、隔离的小世界,要在毫秒级拿到,一天几百万次。谁的环境工厂更好,谁每个 GPU 小时拿到的学习信号就更多。这是基础设施的护城河,不是模型的护城河。

这篇也正好落在代理逃出评测沙箱上头条的一周。DeepSeek 讲的是反过来的故事:一个为海量吞吐和规模化隔离而造的沙箱。这不能证明 DSec 就逃不出去,论文关心的是吞吐量,不是红队测试。但它是为数不多、详细公开前沿实验室代理沙箱到底长什么样的资料。论文:arxiv.org/abs/2609.22978。
← 上一篇
你的编程代理能删掉自己的日志,六个工具里五个放行
下一篇 →
Drawgent:把 Claude Code 放上一块实时白板
← 返回所有文章

评论

加载中...
>_