2026年9月12日BenchmarkCodingMonitoring

有人花了 1500 美元证明「省 90% token」是假的

RTK 一直被当成编程 agent 的免费午餐传:把终端输出过一遍,省 60% 到 90% 的 token。Quesma 跑了 1740 次基准测试去验,答案是不成立。Fable 5.0 的成本降了 1% 到 5%,看你怎么算。DeepSeek V4 Pro 的成本涨了 5% 到 17%。完整报告在 https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/ ,9 月 11 日上了 Hacker News。

方法论才是重点。Claude Code 配 Fable 5.0 跑 85 个任务,OpenCode 配 DeepSeek V4 Pro 跑 89 个,基准是 Terminal-Bench 2.1,记录的是通过率、token 和美元,而不是只记 token。最后这个区别就是整个幻觉的藏身之处。RTK 自己那个指标叫 rtk gain,算的是从命令输出里删掉的字节数除以四。它不算这些删除导致的额外轮次。在 DeepSeek 那批跑里,RTK 报告省了 3.49 亿 token,而任务变得更贵了。

压缩为什么会反噬,这件事值得记住,因为它不止适用于这一个工具。终端输出只占 Fable 输入 token 的约 11%,DeepSeek 的约 40%,天花板本来就不高。前沿模型早就会写克制的命令了,它们会接 head,不会直接 cat 整个文件。而一旦你截掉了模型想要的东西,它就会再发一次工具调用,那意味着整段对话全量未命中缓存的重新 prefill。多一轮的开销超过省下的一大堆字节。JetBrains 七月独立测出了同样的结论,低 effort 下 rtk 反而贵 7.6%。

Quesma 给的诚实结论是:RTK 是给老模型用的小众优化,不是通用省钱方案。更大的教训是,每一个上下文压缩工具都应该被要求公布美元基准,而不是删除字节数,而现在几乎没有一个这么做。如果你生产环境里跑着这类东西,自己量一下账单前后。厂商那个省钱指标量的根本不是你的发票。

相关阅读:https://clauday.com/article/6ddeccb4-a6cb-4f02-adf2-a7aa229160dd
← 上一篇
月之暗面两个月从 3 亿做到 10 亿 ARR
下一篇 →
AI 写的代码正好脏两倍,现在有数字了
← 返回所有文章

评论

加载中...
>_