GLM-5.3 把 Terminal-Bench 从 4.6 干到 28.3,底座还是老的
智谱 8 月 14 日发了 GLM-5.3,Hacker News 上直接冲到第一,一千多分。最扎眼的数字是 Terminal-Bench 3.0 从 4.6 涨到 28.3。这是衡量模型能不能在真实终端里把活干完的榜,六倍多,而且用的还是 GLM-5.2 那套底座权重。没有重新预训练。只是把后训练拉长,加了更多可执行环境、更多长周期任务、更多 RL 算力。
这个细节才是正文。所有人默认下一次能力跃迁的价格是再来一次预训练加一个数据中心。智谱靠的是把强化学习指向"模型得活下来的环境"而不是"模型得答对的题目",换来内部编码提升 50%,DeepSWE v1.1 从 46.2 到 66.9,SWE-Marathon v1.1 从 19.4 到 42.5。如果这条路能泛化,把前沿往前推的成本远比那些资本开支公告暗示的低,今年签下的一堆算力大单,定价的前提可能就错了。
网安那组数字是让人不太舒服的部分。GLM-5.3 在 CyberGym 上 84.5%,压过了 Mythos 5 和 GPT-5.6 Sol。智谱自己说在 ExploitBench 这类深度利用任务上跟闭源前沿仍有差距,这个补充很诚实,但一个马上要放出权重的模型领跑漏洞挖掘榜,和一个托管 API 领跑,完全是两回事。智谱把权重压了大约两周做安全评估。这件事就该按字面理解:一家中国实验室在为网安能力做分阶段发布,跟西方实验室那套流程一模一样,没人立法,它自己长出来了。
现在能用到什么程度。模型只在 GLM Coding Plan 里开放,Lite 18 美元、Pro 80 美元、Max 168 美元一个月,有个 1M 上下文的通道叫 glm-5.3[1m],推理档位分 low、high、max。标准 API 的 token 价没公布。没有 model card,没有 license,没有本地部署方案,上面每一个 benchmark 都是厂商自己跑的,还没有第三方复现。
所以清醒的结论是:纸面上最强的开源权重编码模型,权重还没放出来。你要是已经在付 Coding Plan 的钱,手上又有能量化的仓库任务,今天就跑一遍,看 Terminal-Bench 的涨幅能不能落到你的代码库上。你要是需要 license 或者本地可控,真正值得等的是两周后那个日子。详情看 z.ai/blog/glm-5.3。
← 返回所有文章
这个细节才是正文。所有人默认下一次能力跃迁的价格是再来一次预训练加一个数据中心。智谱靠的是把强化学习指向"模型得活下来的环境"而不是"模型得答对的题目",换来内部编码提升 50%,DeepSWE v1.1 从 46.2 到 66.9,SWE-Marathon v1.1 从 19.4 到 42.5。如果这条路能泛化,把前沿往前推的成本远比那些资本开支公告暗示的低,今年签下的一堆算力大单,定价的前提可能就错了。
网安那组数字是让人不太舒服的部分。GLM-5.3 在 CyberGym 上 84.5%,压过了 Mythos 5 和 GPT-5.6 Sol。智谱自己说在 ExploitBench 这类深度利用任务上跟闭源前沿仍有差距,这个补充很诚实,但一个马上要放出权重的模型领跑漏洞挖掘榜,和一个托管 API 领跑,完全是两回事。智谱把权重压了大约两周做安全评估。这件事就该按字面理解:一家中国实验室在为网安能力做分阶段发布,跟西方实验室那套流程一模一样,没人立法,它自己长出来了。
现在能用到什么程度。模型只在 GLM Coding Plan 里开放,Lite 18 美元、Pro 80 美元、Max 168 美元一个月,有个 1M 上下文的通道叫 glm-5.3[1m],推理档位分 low、high、max。标准 API 的 token 价没公布。没有 model card,没有 license,没有本地部署方案,上面每一个 benchmark 都是厂商自己跑的,还没有第三方复现。
所以清醒的结论是:纸面上最强的开源权重编码模型,权重还没放出来。你要是已经在付 Coding Plan 的钱,手上又有能量化的仓库任务,今天就跑一遍,看 Terminal-Bench 的涨幅能不能落到你的代码库上。你要是需要 license 或者本地可控,真正值得等的是两周后那个日子。详情看 z.ai/blog/glm-5.3。
评论