Fable 5.1 来了:循环更便宜,跑得更久,滤网更松
Anthropic 9 月 1 日发布了 Claude Fable 5.1 和 Mythos 5.1。同一个模型两个版本:Fable 面向所有人开放,Mythos 只给通过审核的网络安全和生命科学机构,滤网调得更松。这个双轨结构从 Fable 5 开始,现在看是 Anthropic 发版的固定形态了。
对做 agent 的人来说,最重要的数字不是 benchmark,是账单。缓存读取降价 75%,降到每百万 token 0.25 美元。Anthropic 自己算的账:普通负载省 25%,重度 agent 负载最多省 45%。agent 循环会把同一段上下文反复读几百遍,所以缓存价格就是 agent 价格。标准价不变,输入 10 美元、输出 50 美元。
benchmark 讲的是同一个故事:长程任务。Terminal-Bench-Science 从 24.7% 翻倍到 52.6%,Terminal-Bench 4.0 的 agentic coding 从 42% 最高提到 60.9%。官方最得意的案例是一次 38 小时无人值守的运行,把一个已发表的结果诊断成了标注错误。卖点已经悄悄从"聊天窗口里聪明"变成了"整夜没人看着也靠谱"。
安全策略的改动本身几乎就是一次产品发布:网安误报降 60%,漏洞发现现在放行了(写 exploit 还是不行),生物类的无害问题拒答率降 85%。各家都在收紧滤网的这个季节,Anthropic 赌的是精准比严格更值钱。Mythos 这套分级逻辑我们之前写过:https://clauday.com/zh/article/d9f40e9d-ee16-4ddb-9401-3d372ed94496
官方公告:https://www.anthropic.com/claude-fable-and-mythos-5-1
← 返回所有文章
对做 agent 的人来说,最重要的数字不是 benchmark,是账单。缓存读取降价 75%,降到每百万 token 0.25 美元。Anthropic 自己算的账:普通负载省 25%,重度 agent 负载最多省 45%。agent 循环会把同一段上下文反复读几百遍,所以缓存价格就是 agent 价格。标准价不变,输入 10 美元、输出 50 美元。
benchmark 讲的是同一个故事:长程任务。Terminal-Bench-Science 从 24.7% 翻倍到 52.6%,Terminal-Bench 4.0 的 agentic coding 从 42% 最高提到 60.9%。官方最得意的案例是一次 38 小时无人值守的运行,把一个已发表的结果诊断成了标注错误。卖点已经悄悄从"聊天窗口里聪明"变成了"整夜没人看着也靠谱"。
安全策略的改动本身几乎就是一次产品发布:网安误报降 60%,漏洞发现现在放行了(写 exploit 还是不行),生物类的无害问题拒答率降 85%。各家都在收紧滤网的这个季节,Anthropic 赌的是精准比严格更值钱。Mythos 这套分级逻辑我们之前写过:https://clauday.com/zh/article/d9f40e9d-ee16-4ddb-9401-3d372ed94496
官方公告:https://www.anthropic.com/claude-fable-and-mythos-5-1
评论