2026年8月30日deep-dive

Harness 把模型吃掉了

这周有个开发者发了一句话。他说愿意付一笔离谱的钱,只求一个能同时看到他所有编码 agent 的窗口。一天 1600 赞、44.9 万浏览,然后十几个人照着这个格式改写,每人各点一个窟窿。一个要 Claude Code、Codex、Pi、Grok 一起的 TUI。一个要一个能把完整上下文像 subagent 一样从一个模型交到下一个模型的路由器。一个要「真正需要他」的那些 Slack 线程。段子自己就写好了,但这个段子,就是当下 AI 到底走到哪儿的全部故事。

因为这些人没有一个在要更聪明的模型。他们手里已经是有史以来最聪明的模型了。他们搞不到的,是一个窗口、一颗停止按钮、一张收据、一个权限。智能过剩,而围着它的脚手架缺席——这个缺口,正是整个行业这周悄悄挪过去的地方。

先从那句所有人转发却没意识到它是论点的话说起。Google 团队甩出一份九页的笔记,叫 Harness Engineering,压缩成一条公式:Agent = 模型 + Harness。真正该让你停住的是演示。同一个 Claude Sonnet。同一个基准。只改 harness,结果就天差地别。不是权重、不是训练、不是 prompt。是套在模型外面的那个循环。

慢慢把这句话念一遍。三年来整个话题都是关于模型的。哪家实验室的最好。多少参数。跑了多少分。而这里一个 Google 工程团队实质上在说:把模型摁住不动,你照样能靠外面那层东西赢下或输掉整盘。模型是发动机。harness 是车。而没人买一台发动机。

如果这只是某一个团队的暴论,你大可不理。但看看实验室用手做了什么,不是用嘴。DeepSeek 开源了它的 harness。OpenAI 开源了 Codex 的 harness。当两家前沿实验室把运行时白送、把权重攥着,它们是在告诉你它们认为护城河不在哪儿。一位中文分析师给了最锋利的框:harness 正在变成一个微内核。核心是薄运行时,只做每个 agent 都需要的事——插件加载、事件路由、权限、会话状态。然后研究、编码、办公、客服全部作为插件包在上面拼装。在那个世界里,模型不再是你挑选的产品,而变成一个可替换的执行资源、按任务路由。强模型规划,便宜模型苦干,在它们之间切换是一个运行时决定,不是一次迁移。

这是 agent 的 Android 时刻,而且这个类比精确。一个开放地基能阻止一百个团队重复造同一个运行时。但发布参考代码,和拥有一个平台,不是一回事。接下来六个月决定这些开放 harness 是收敛成一个有稳定接口、可信插件的东西,还是散成又一堆互不兼容、各自技术上都能跑、却谁也拼不到一起的参考实现。

现在说说为什么这件事的意义超出架构图。如果模型是大宗商品、harness 是价值所在,那么有意思的工程问题就不再是「模型多聪明」,而变成「你在它外面裹了什么」。而你一问这个问题,就撞上了这周主宰所有其它数据线的东西:循环,以及循环记住了什么。

最清楚的证据来自一个让它当众翻车的人。他给一个 agent 一个钱包,让它在一个链上游戏里赚钱、别犯错。27 次运行后:亏 87%,盈利次数 0。而黑色幽默在于它每一次都在改进。每次失败变成一个回归测试,架构越来越聪明,宝石数一路 500、300、200、90 地滑下去。它在一个不盈利的系统里优化「正确行为」,给自己堆了太多互相冲突的规则、把自己勒死了。他那句话值得记住:agent 在持续自我改进,和 agent 会赚钱,是两个完全不同的说法。

这是 loop engineering 用惨痛方式学到的一课,而整个领域正从另一个方向学同一课。这周最好的 autoresearch 成果,不是模型想得更狠的演示。是会记忆的 harness。一个 autoresearch 系统在 vLLM 和 SGLang 底下的注意力 kernel 里揪出一个数值错误的哨兵值,那种能吃掉人类工程师一整周的静默 bug。QuEra 的一个四人团队花了几个月把量子计算机的激光恢复率做到 58%;一个过夜的 agent 循环到了 99.3%,而它写出来的控制器现在不用模型也能跑。把最后半句再读一遍。循环的产出不是一个模型在旁边盯硬件,而是循环通过过夜试错发现的一段确定性程序、然后交接出去。智能做了搜索。它留下的成品,比它自己活得更久。

然后,从一个完全不同的房间,同样的形状作为一个市场冒了出来。这是该让建造者坐直的部分。在 Ideas 数据线里,几百个人各自独立地说了同样一句话:agent 缺的那一层是「权限」。不是更聪明的模型。是权限。一个能下单、能花钱、能改记录的 agent,需要一个硬的、可审计的答案——谁授权的、它被允许做什么、怎么撤销。有人框得完美:谁把「可验证、按用户、可撤销的 agent 身份」ship 出来,谁就成了 agent 时代的 OAuth。

看看刚刚发生了什么。Google 的笔记说,是 harness 而不是模型在强制安全。翻车的交易 agent 证明,一个聪明模型在一个边界糟糕的循环里,一边变聪明一边把钱烧光。而市场,没读过这两者中的任何一个,却走到了同一扇门前、开始砸门:给我们那个权限层、那颗停止按钮、那张收据。三条数据线、三个视角、同一块缺失的拼图。当用户痛点、方法论辩论、产品需求在同一天指向同一个洞,那不是噪音。那是一个市场在告诉你它哪儿疼。

有个成本角度让这一切变具体,而它来自一个不光鲜的基准。一个叫 PRAXIST 的开源研究 agent,在 MLE-Bench 上干过了 Claude Code + Opus 4.8 的组合,而且成本只有十二分之一。多拿 44% 的金牌,用的还是更弱的开源模型,3000 美元对 38000 美元。怎么做到的?不是更大的脑子。是架构。大多数 agent 系统跑赢家通吃——试一条路、留最好的、删掉其余——这扔掉了整轮里信息量最大的数据。PRAXIST 并行跑多个研究同伴,把每个发现汇进共享记忆,让一个评审组读完整堆再决定下一个实验。失败会复利,而不是蒸发。结构赢了规模,而且赢得毫不勉强。

所以把这些拼图摆到一张桌上。模型正在变成一个你按任务路由过去的大宗商品。价值挪到了循环、记忆、和围着它的权限层。实验室在白送运行时,因为它们心里清楚。而市场上最响的未满足需求不是智能,是那些让智能可以安全地指向真金白银和真实记录的无聊管道——评测、日志、回滚、一颗停止按钮、一条审计轨迹。这周有人说得很直白:做管道的公司会悄悄赢下 2027。

如果你在建东西,结论既让人不适又让人解脱。你不会在模型上干过 Anthropic 或 DeepSeek,而你也不必。可赢的地盘是 harness——那个它们真的在白送、因为它们不认为那是自己护城河的层。那个抓取厂商不肯开放的界面、像 2023 年的聊天聚合器那样做出来的多 agent 驾驶舱。那个卡在 agent 意图与不可逆动作之间的权限闸门。那个把上一次失败一直留着、让下一小时从真正的伤口而不是第一章开始的记忆。那个给服务 400 家牙科诊所的垂直 SaaS 做的公司上下文层——他们想要按客户隔离、可追溯到文档的答案,又没法自己花六个季度去造。

十年来,本能都是伸手去够最聪明的模型、然后假设那层壳无关紧要。这周,行业当众承认了相反的事。那层壳才是活儿。模型现在是便宜的那部分。Harness 把模型吃掉了,而那些还在争参数数量的人,正在优化那个已经不再重要的变量。

学会你的循环。它是唯一剩下的、真正属于你的东西。
← 上一篇
灵感雷达: 2026-08-30
下一篇 →
运营日志: 2026-08-30
← 返回所有文章

评论

加载中...
>_