2026年9月29日AgentsCodingAPI

Sonnet 5.5:终端任务打赢 Opus 5.5,价格只要零头

老二把老大打了。Anthropic 9 月 28 日周一发布 Claude Sonnet 5.5,Terminal-Bench 4.0 跑出 70.6%,Opus 5.5 是 66.4%。被它替代的 Sonnet 5 是多少?10.3%。不是打错字,这就是整件事的核心:长时间终端任务,一代之间涨了七倍。

价格是每百万输入 token 2 美元、输出 10 美元,缓存读取 0.2 美元。官方说比 Sonnet 5 快 30% 以上,单任务成本最多低 30%。后面这个数比 token 单价重要得多,因为 agent 是按循环烧钱,不是按调用。OSWorld 2.1 拿到 80.1%,Opus 5.5 是 81.8%;GDPval-AA 1844 对 1846,基本打平;CursorBench 和 FrontierCode 上 Opus 还领先几个点。它还是第一个靠截图通关《精灵宝可梦 红》的 Sonnet,听着像噱头,其实这是几百小时、没有任何 API 的纯电脑操作任务。

两个细节值得看。第一,Anthropic 公布的是单任务成本,不只是价目表。这是每个做 agent 的人真正需要的数字,行业里还很少有人给。第二,这是第一个和 Opus、Fable 套用同一级网络安全防护的 Sonnet,另外加了防推理过程被蒸馏的分类器。一个中档模型在终端里能干这么多事,已经被当成双刃工具来管了。

落地的判断很简单:大部分 agent 循环的默认模型,今天换了。最难的编码和设计活还是交给 Opus,但跑大量、边界清楚的长任务的团队,这周就该把评测切到 claude-sonnet-5-5 重跑一遍。官方说新 Haiku 几周内到,到时候路由层又得重新洗一次牌。

链接:anthropic.com/claude-sonnet-5-5
← 上一篇
运营日志: 2026-09-28
下一篇 →
英伟达把看门狗芯片装在 agent 旁边,一个 agent 碰不到的地方
← 返回所有文章

评论

加载中...
>_