Poolside开源了一个118B的coder,顺手解了个Erdos问题
Poolside本来应该是走企业合同那条路的,卖给国防和银行、永远不给你看模型的那种实验室。7月21日他们放出了Laguna S 2.1,权重开源在Hugging Face上,OpenMDW-1.1协议,而且数字不像是礼节性发布。
118B参数的MoE,每个token激活8B,1M上下文,专为长周期agentic编码做的。Terminal-Bench 2.1拿70.2%,在所有模型里排第11。SWE-Bench Multilingual 78.5%。SWE-Bench Pro 59.4%。DeepSWE v1.1思考模式40.4%。Poolside自己的说法是,在长周期基准上它能跟大它很多倍的模型掰手腕,配上8B激活参数,这句话是可核对的而不是宣传。他们还说从预训练开始到发布不到九周。
demo是那种不好造假的。从零写了一个浏览器引擎。优化了复杂代码库。以及独立重新发现了Erdos问题#397的一个证明——这根本不是编码基准,是那种要么发生了要么没发生的结果。
然后是价格,响的地方在这。Hugging Face上权重免费。chat.poolside.ai免登录免费聊。OpenRouter上有个256K上下文的免费端点。付费托管在OpenRouter上是每百万输入0.1美元、输出0.2美元,带完整的1M上下文。一毛钱。一个Terminal-Bench排第11的模型,一百万token的上下文。vLLM、Ollama、Baseten和Vercel AI Gateway都上了。
稀疏MoE是这个价格能成立的原因,而它现在明显是agent场景专属的胜出架构:每个token只付8B的算力,拿到接近前沿的长周期行为。如果一个月前你的agent循环因为百万token上下文太贵而用不起,这个约束现在没了。详情在 poolside.ai/blog/introducing-laguna-s-2-1
← 返回所有文章
118B参数的MoE,每个token激活8B,1M上下文,专为长周期agentic编码做的。Terminal-Bench 2.1拿70.2%,在所有模型里排第11。SWE-Bench Multilingual 78.5%。SWE-Bench Pro 59.4%。DeepSWE v1.1思考模式40.4%。Poolside自己的说法是,在长周期基准上它能跟大它很多倍的模型掰手腕,配上8B激活参数,这句话是可核对的而不是宣传。他们还说从预训练开始到发布不到九周。
demo是那种不好造假的。从零写了一个浏览器引擎。优化了复杂代码库。以及独立重新发现了Erdos问题#397的一个证明——这根本不是编码基准,是那种要么发生了要么没发生的结果。
然后是价格,响的地方在这。Hugging Face上权重免费。chat.poolside.ai免登录免费聊。OpenRouter上有个256K上下文的免费端点。付费托管在OpenRouter上是每百万输入0.1美元、输出0.2美元,带完整的1M上下文。一毛钱。一个Terminal-Bench排第11的模型,一百万token的上下文。vLLM、Ollama、Baseten和Vercel AI Gateway都上了。
稀疏MoE是这个价格能成立的原因,而它现在明显是agent场景专属的胜出架构:每个token只付8B的算力,拿到接近前沿的长周期行为。如果一个月前你的agent循环因为百万token上下文太贵而用不起,这个约束现在没了。详情在 poolside.ai/blog/introducing-laguna-s-2-1
评论