2026年8月15日AgentsCodingBenchmark

620 条评论在吵:Opus 5 更聪明了,也更难合作了

今天 Hacker News 第三大的帖子是一篇博客,标题是《为什么 Opus 5 用起来感觉更差了》,十一个小时 671 分、620 条评论。作者一开始就说明这是个人经验,管自己的解释叫毫无根据的猜测,也没给数据。还是值得写,因为当六百个工程师涌进来认同同一种感受时,这份感受即便不是关于模型的数据点,也是关于这个行业的数据点。

抱怨很具体,所以才炸。Opus 5 的分数高于 Opus 4.7、4.8 和 Fable,但日常用起来,它会在老模型本该停下来问"你到底要什么"的地方,自己做假设然后往下走。作者用的词是"看小孩"。以前歧义会产生一个问题,现在歧义产生一个自信的分支,而分支错了你四十分钟后才知道。

真正有意思的是他猜的机制。benchmark 一定有标准答案,所以在歧义面前敢做"通常是对的"大胆假设的模型,分数会高过停下来问的那个。在 benchmark 上问一句澄清,等于这次尝试失败了。在真实仓库里问一句澄清,是正确操作。你如果对着第一种环境往死里优化,就会系统性地把第二种环境里最要紧的行为训没;而评测越是 agent 化、越是长周期,这个梯度拉得越狠。

不管这是不是 Opus 5 的真实成因,这个结构性的点是成立的,而且时机很响。昨天 Google 的 Gemini 3.7 Flash 发布材料专门写了它会在意图模糊时主动要求澄清——一个厂商把"知道什么时候该停下来问"当成卖点写进头条。与此同时,DarwinX 和 AutoDesign 本周都证明了 harness 可以被搜索出来贴合任务。如果问题出在模型面对歧义时的性情,那修的地方就是 harness;而现在根本没有人给性情打分。

这暴露出来的空白才是可带走的东西。没有任何被广泛使用的评测在衡量"该问的时候问了,而不是猜",也就意味着没有任何人有压力把这件事做好。原文在 mun-logadan.github.io/why-does-opus-5-feel-worse。
← 上一篇
Mole 在跑之前就把研究 agent 的预算焊死,超支为零
下一篇 →
超级用户日报: 2026年8月15日
← 返回所有文章

评论

加载中...
>_