Claude Haiku 5.5:便宜 75%,生来当子代理
Anthropic 周三发了 Claude Haiku 5.5,Hacker News 几小时给了 516 分。卖点不是智力,是价格和一个明确的岗位。Haiku 5.5 对 10 万 token 以内的请求,输入每百万 $0.10、输出每百万 $0.50,比 Haiku 4.5 在这类请求上低 90%,Anthropic 说平均便宜 75% 左右。缓存读取每百万一美分。定位就是在 Opus 5.5 和 Sonnet 5.5 下面跑编码的子代理,以及压缩上下文、摘要、分类、数据库查询、在线客服、浏览器操作这些活。
对小模型来说数字不错。Terminal-Bench 4.0 拿 39.2%,Haiku 4.5 是 0.0%,GPT-6 Luna 是 16.4%。OSWorld 2.1 离线子集 72.4%,Luna 48.9%。Humanity's Last Exam 不带工具 45.9%。GDPval-AA v2.1 的 Elo 1620,高于 Luna 的 1437。FrontierCode 1.1 46.4%。这是第一个带可调 effort 档位的 Haiku,而 Anthropic 自己的图里 Sonnet 5.5 在高难 agent 任务上仍然赢,所以老实的读法是"把窄活干好的便宜模型",不是打折的前沿模型。HubSpot 报告在自家 CRM 测试集上拿 92.8%,是它见过的小模型最高分。Asana 测到延迟降 30%,每个 agent 回合推理快最多 2.5 倍。
对做 agent 的人,小字里有两条比跑分更要紧。Sonnet 5.5 缓存读取从每百万 $0.20 砍到 $0.10,Anthropic 说这让 Sonnet 在大多数 agent 任务上便宜约 20%,因为缓存读取占了 agent 大头的 token 量。还有,Max 5x 订阅每月送 $100 API 额度,Max 20x 送 $200,Team 最多 $500 共享。这是明摆着的推力:别把订阅当聊天套餐,去做一个调 API 的东西。Python 和 TypeScript SDK 也加了计算机操作和浏览器操作的 beta 支持。
网络安全护栏比 Sonnet 5.5 松,但仍然拦渗透测试,和 Mistral 前一天拿 Large 4 点名的那条分界线一模一样。现已在 Claude Platform、AWS、Google Cloud、Azure 上线,模型 ID 是 claude-haiku-5-5。
链接:anthropic.com/claude-haiku-5-5
← 返回所有文章
对小模型来说数字不错。Terminal-Bench 4.0 拿 39.2%,Haiku 4.5 是 0.0%,GPT-6 Luna 是 16.4%。OSWorld 2.1 离线子集 72.4%,Luna 48.9%。Humanity's Last Exam 不带工具 45.9%。GDPval-AA v2.1 的 Elo 1620,高于 Luna 的 1437。FrontierCode 1.1 46.4%。这是第一个带可调 effort 档位的 Haiku,而 Anthropic 自己的图里 Sonnet 5.5 在高难 agent 任务上仍然赢,所以老实的读法是"把窄活干好的便宜模型",不是打折的前沿模型。HubSpot 报告在自家 CRM 测试集上拿 92.8%,是它见过的小模型最高分。Asana 测到延迟降 30%,每个 agent 回合推理快最多 2.5 倍。
对做 agent 的人,小字里有两条比跑分更要紧。Sonnet 5.5 缓存读取从每百万 $0.20 砍到 $0.10,Anthropic 说这让 Sonnet 在大多数 agent 任务上便宜约 20%,因为缓存读取占了 agent 大头的 token 量。还有,Max 5x 订阅每月送 $100 API 额度,Max 20x 送 $200,Team 最多 $500 共享。这是明摆着的推力:别把订阅当聊天套餐,去做一个调 API 的东西。Python 和 TypeScript SDK 也加了计算机操作和浏览器操作的 beta 支持。
网络安全护栏比 Sonnet 5.5 松,但仍然拦渗透测试,和 Mistral 前一天拿 Large 4 点名的那条分界线一模一样。现已在 Claude Platform、AWS、Google Cloud、Azure 上线,模型 ID 是 claude-haiku-5-5。
链接:anthropic.com/claude-haiku-5-5
评论