Claude Opus 5 来了:前沿的活,一半的钱
Anthropic没等IPO路演就把王炸先甩了。Opus 5发布,话说得很直白:前沿级别的活,价格只有Fable 5的一半。
数字才是重点。Frontier-Bench上,它把Opus 4.8的分数翻了一倍还多,成本反而更低。CursorBench 3.2上,只差Fable 5峰值不到半个百分点,钱只花一半。ARC-AGI 3是次优模型的三倍。OSWorld 2.0直接压过Fable 5,成本只有三分之一。价格还是每百万token输入5美元、输出25美元,跟4.8一模一样——等于白送你一代的提升。
大家都在传的那个demo:给它一张它没法直接看到的机械零件图,Opus 5自己写了一套计算机视觉管线,从原始像素里把几何结构抠出来,再把整个零件还原出来。这就是变化的形状。它会验证自己的输出、反复迭代,而不是猜一次就往下走。
对做agent的人,有两个实打实的新东西。现在可以在对话中途换工具了(beta),被标记的请求会自动回退到别的模型,而不是直接报错。纸面上不起眼,但你跑长链条agent循环、最怕中途死掉的时候,这个很关键。
没明说的潜台词是:这台模型重新定义了“日常主力”这条线画在哪。当前沿只要上个月前沿一半的钱,问题就不再是它能不能干这活,而是你为什么还在跑那台贵的。
https://www.anthropic.com/news/claude-opus-5
← 返回所有文章
数字才是重点。Frontier-Bench上,它把Opus 4.8的分数翻了一倍还多,成本反而更低。CursorBench 3.2上,只差Fable 5峰值不到半个百分点,钱只花一半。ARC-AGI 3是次优模型的三倍。OSWorld 2.0直接压过Fable 5,成本只有三分之一。价格还是每百万token输入5美元、输出25美元,跟4.8一模一样——等于白送你一代的提升。
大家都在传的那个demo:给它一张它没法直接看到的机械零件图,Opus 5自己写了一套计算机视觉管线,从原始像素里把几何结构抠出来,再把整个零件还原出来。这就是变化的形状。它会验证自己的输出、反复迭代,而不是猜一次就往下走。
对做agent的人,有两个实打实的新东西。现在可以在对话中途换工具了(beta),被标记的请求会自动回退到别的模型,而不是直接报错。纸面上不起眼,但你跑长链条agent循环、最怕中途死掉的时候,这个很关键。
没明说的潜台词是:这台模型重新定义了“日常主力”这条线画在哪。当前沿只要上个月前沿一半的钱,问题就不再是它能不能干这活,而是你为什么还在跑那台贵的。
https://www.anthropic.com/news/claude-opus-5
评论