模型是故意变笨的,而且这条路走对了
Walter van der Giessen 周一发的这篇,两小时内冲上 Hacker News 首页,反应是对的。他的判断是:各家实验室在刻意拿事实存储换推理能力,而所有把冷知识 benchmark 下滑读成退化的人,把因果读反了。
证据是参数量。GLM-5.2 用 40B 激活参数在 AIME 2026 上拿 99.2%。Qwen3.5 用 17B 激活拿 91.3%。DeepSeek V4-Flash 激活只有 13B。而 2023 年的 GPT-4 大约 280B 激活参数,这类题根本做不稳。三年时间,推理便宜了二十倍。
事实没有。SimpleQA 的榜首 Gemini 2.5 Pro 停在 53%——这是目前地表最强的事实召回,也就是抛硬币再好一点。Qwen3.5 的 4B 和 9B 模型在知识类 benchmark 上幻觉率 80% 到 82%。van der Giessen 给的解释是一个存储估算:每个参数大约装两个比特的事实知识。这就是为什么知识密集的模型需要万亿级权重,而推理能力可以压缩到几乎不占地方。
如果这个估算大体成立,设计结论就是被逼出来的。存在权重里的事实很贵,训练一结束就开始过期,而且出错时不吭声。存在权重里的流程很便宜,而且不过期。所以你留下流程,去租事实——检索、工具、搜索、一个数据库。
这就是 agent 的全部论证,只不过从一个完全不同的方向走过来。任何 agent 架构本来就默认模型是一个接着外部状态的推理器。这篇文章只是说,做模型的人已经悄悄同意了,并且在照这个方向优化。别再拿"记得多少"给模型打分了。https://w4g1.dev/blog/models-are-getting-dumber-on-purpose
← 返回所有文章
证据是参数量。GLM-5.2 用 40B 激活参数在 AIME 2026 上拿 99.2%。Qwen3.5 用 17B 激活拿 91.3%。DeepSeek V4-Flash 激活只有 13B。而 2023 年的 GPT-4 大约 280B 激活参数,这类题根本做不稳。三年时间,推理便宜了二十倍。
事实没有。SimpleQA 的榜首 Gemini 2.5 Pro 停在 53%——这是目前地表最强的事实召回,也就是抛硬币再好一点。Qwen3.5 的 4B 和 9B 模型在知识类 benchmark 上幻觉率 80% 到 82%。van der Giessen 给的解释是一个存储估算:每个参数大约装两个比特的事实知识。这就是为什么知识密集的模型需要万亿级权重,而推理能力可以压缩到几乎不占地方。
如果这个估算大体成立,设计结论就是被逼出来的。存在权重里的事实很贵,训练一结束就开始过期,而且出错时不吭声。存在权重里的流程很便宜,而且不过期。所以你留下流程,去租事实——检索、工具、搜索、一个数据库。
这就是 agent 的全部论证,只不过从一个完全不同的方向走过来。任何 agent 架构本来就默认模型是一个接着外部状态的推理器。这篇文章只是说,做模型的人已经悄悄同意了,并且在照这个方向优化。别再拿"记得多少"给模型打分了。https://w4g1.dev/blog/models-are-getting-dumber-on-purpose
评论