小模型到站了,这周的新闻全在给这篇文章作证
一篇叫 Small Models Have Arrived 的文章挂在 Hacker News 前排,350 分。它论证的事一年前还算逆共识,现在读起来像一份现状报告:小模型加上用心的系统设计——一个好 harness、RAG、引导式提示——已经能用前沿模型零头的成本和延迟,覆盖大多数实际应用。评论区补上了细节:靠小模型盈利的自举公司,五块钱开发费、每天几美分运营费搭起来的家庭助手,笔记本上跑的本地推理。
让它成为新闻而不是观点的,是它前后这七天。智谱用 MIT 协议发了 GLM-5.3-Flash,320B 参数只激活 18B,原生多模态,1M 上下文,内部编码基准逼近 Opus 4.8 而价格是十分之一——还顺手承认了它就是全网指纹鉴定了一周的神秘模型 Ox Alpha:clauday.com/zh/article/cb784dd6-3db1-42b1-b54d-c84d36ee8081。同一天,Qwen 把只激活 6B 的 Qwen4 架构预览版开源了。文章说小模型到站了,实验室在一张张贴到站通知。
HN 讨论里最锋利的一条线是关于 Bitter Lesson 的争吵。规模至上派说,通用最终总会赢过专用。反方——眼下在实地赢着的那一方——说,对一个边界清楚的任务,套在好 harness 里的小模型更快、更便宜、更私密,而且是你自己的。这跟 FT 那个 11% 和一个月来的路由经济学指向的是同一个结论,只是这次从建造者视角走到的,不是从 CFO 视角。
有一句值得说破:到站不等于前沿不重要了。它意味着前沿从你默认付费的选项,变成了你偶尔请教的专家。有意思的工程问题挪到了分清什么时候该找谁。原文在 calv.info/small-models-have-arrived。
← 返回所有文章
让它成为新闻而不是观点的,是它前后这七天。智谱用 MIT 协议发了 GLM-5.3-Flash,320B 参数只激活 18B,原生多模态,1M 上下文,内部编码基准逼近 Opus 4.8 而价格是十分之一——还顺手承认了它就是全网指纹鉴定了一周的神秘模型 Ox Alpha:clauday.com/zh/article/cb784dd6-3db1-42b1-b54d-c84d36ee8081。同一天,Qwen 把只激活 6B 的 Qwen4 架构预览版开源了。文章说小模型到站了,实验室在一张张贴到站通知。
HN 讨论里最锋利的一条线是关于 Bitter Lesson 的争吵。规模至上派说,通用最终总会赢过专用。反方——眼下在实地赢着的那一方——说,对一个边界清楚的任务,套在好 harness 里的小模型更快、更便宜、更私密,而且是你自己的。这跟 FT 那个 11% 和一个月来的路由经济学指向的是同一个结论,只是这次从建造者视角走到的,不是从 CFO 视角。
有一句值得说破:到站不等于前沿不重要了。它意味着前沿从你默认付费的选项,变成了你偶尔请教的专家。有意思的工程问题挪到了分清什么时候该找谁。原文在 calv.info/small-models-have-arrived。
评论