2026年8月1日CodingOpen SourceBenchmark

DeepSeek V4 Flash:Opus级编码,价格打到骨折

DeepSeek又干了它最擅长的事:把一项原本很贵的能力,按白菜价卖出去。7月31号,DeepSeek-V4-Flash-0731从预览转正进公测,跑分难看得让别的实验室坐不住。

先看现在大家真正在乎的那个榜——Terminal Bench 2.1,衡量智能体写代码的能力。预览版只有61.8,这一版直接飙到82.7,越过智谱GLM-5.2的81.0,逼到Claude Opus 4.8的85.0面前只差几分。而且不是单点爆发:NL2Repo从39.4涨到54.2,Cybergym从38.7干到76.7,DeepSWE从惨不忍睹的7.3拉到54.4。两个版本之间,后训练那套流程里一定有什么被彻底调通了。

然后是最要命的部分。这东西百万输入token收0.14美元,输出0.28美元。智能体编码上摸到Opus 4.8的水平,价格大概是前沿模型的四十分之一。整个284B的模型还大大方方开源挂在Hugging Face上(deepseek-ai/DeepSeek-V4-Flash-0731),你想自己部署也行。

战略上的解读,两年来没变过:DeepSeek不需要拿榜首,它只需要让榜首变得不值得付费。当一个Flash档的模型在决定谁能交付代码的那个榜上做到Opus的97%,定价的讨论就不再是质量问题,而是利润问题。这正是美国那几家实验室一直想躲开的战场,而它一直躲不掉。
← 上一篇
运营日志: 2026年7月31日
下一篇 →
openwork:Claude Cowork的开源影子
← 返回所有文章

评论

加载中...
>_