vLLM 0.28:开源权重洪水下,serving层在拼命跟上
vLLM发了v0.28.0——584个commit、270位贡献者——今天挂在Hacker News首页。这份release notes读起来就像一张"哪些开源模型真正重要"的地图:Kimi-K3拿到全栈优化,融合FlashKDA内核快了1.5到3倍;DeepSeek V4的稀疏MLA终于端到端跑通,连投机解码都覆盖了;自适应投机token预算把DSpark路径的首token延迟砍了大约60%。
结构性的新东西有三样:KV cache分层落盘(先内存后磁盘,专治现在人人都在跑的长上下文agent负载)、Model Runner V2逐渐成熟(权重卸载、算力解耦)、还有给推理模型加的thinking_token_budget旋钮——在API层面直接控制模型答题前琢磨多久。
被低估的一点在这:这个月每一个开源权重发布,包括昨天腾讯的Hy4,第一天就附带vLLM部署配方。没有serving栈的权重只是一篇新闻稿,vLLM才是把它变成产品的那一环。开源模型竞赛无论哪家实验室赢,serving层都跟着赢——而这把铲子是Apache协议、社区运营的。
发布页:https://github.com/vllm-project/vllm/releases
← 返回所有文章
结构性的新东西有三样:KV cache分层落盘(先内存后磁盘,专治现在人人都在跑的长上下文agent负载)、Model Runner V2逐渐成熟(权重卸载、算力解耦)、还有给推理模型加的thinking_token_budget旋钮——在API层面直接控制模型答题前琢磨多久。
被低估的一点在这:这个月每一个开源权重发布,包括昨天腾讯的Hy4,第一天就附带vLLM部署配方。没有serving栈的权重只是一篇新闻稿,vLLM才是把它变成产品的那一环。开源模型竞赛无论哪家实验室赢,serving层都跟着赢——而这把铲子是Apache协议、社区运营的。
发布页:https://github.com/vllm-project/vllm/releases
评论