Anthropic 在悄悄测试:你调的 High,给你 Low 的量
"High" 现在等于 100 分制里的 10 分——正好是过去 "Low" 的数值。一位 ID 叫 argofowl 的开发者翻了 Claude Code 的服务端配置后发现了这个,帖子在 HN 上拿了 127 分,评论区罕见地怨气冲天。
具体情况:Claude Code 2.1.236 及以上版本的 Fable 5 会话,被服务端划入一个压缩推理 effort 刻度的实验。老版本客户端和 Opus 5 会话不受影响。changelog 里只字未提,而且因为是 A/B 测试,只有一部分用户中招——也就是说,两个人套餐相同、设置相同,拿到的思考量却不同,而且双方都不知道。
这不是孤立事件。Anthropic 通过远程 feature flag 管道在付费用户身上跑实验有先例:此前被记录过的包括一个硬性限制输出长度的 Plan Mode 变体,和一个直接把 Claude Code 从部分 Pro 账号下架的测试。而这次它落在我们跟了几周的一堆线索上:Opus 5 变笨了的体感帖、session token 经济学拆解、"模型在故意变笨"的论断。之前那些是体感和推测,这次有了数字。
界线在哪里要说清楚:所有 serving 系统都做 A/B 测试,effort 路由本身也是正当的成本工程。问题在于悄悄重定义一个用户明确设置过的旋钮。"High" 是一个有含义的承诺,当仪表盘撒谎,开发者的反应从来只有一种——绕开你。我们反复报道的多供应商路由生态,接住的正是从这里流失的信任。
HN 讨论:https://news.ycombinator.com/item?id=49401549 原帖:https://x.com/argofowl/status/2091150597374537729
← 返回所有文章
具体情况:Claude Code 2.1.236 及以上版本的 Fable 5 会话,被服务端划入一个压缩推理 effort 刻度的实验。老版本客户端和 Opus 5 会话不受影响。changelog 里只字未提,而且因为是 A/B 测试,只有一部分用户中招——也就是说,两个人套餐相同、设置相同,拿到的思考量却不同,而且双方都不知道。
这不是孤立事件。Anthropic 通过远程 feature flag 管道在付费用户身上跑实验有先例:此前被记录过的包括一个硬性限制输出长度的 Plan Mode 变体,和一个直接把 Claude Code 从部分 Pro 账号下架的测试。而这次它落在我们跟了几周的一堆线索上:Opus 5 变笨了的体感帖、session token 经济学拆解、"模型在故意变笨"的论断。之前那些是体感和推测,这次有了数字。
界线在哪里要说清楚:所有 serving 系统都做 A/B 测试,effort 路由本身也是正当的成本工程。问题在于悄悄重定义一个用户明确设置过的旋钮。"High" 是一个有含义的承诺,当仪表盘撒谎,开发者的反应从来只有一种——绕开你。我们反复报道的多供应商路由生态,接住的正是从这里流失的信任。
HN 讨论:https://news.ycombinator.com/item?id=49401549 原帖:https://x.com/argofowl/status/2091150597374537729
评论