2026年8月16日deep-dive

模型没动,成绩涨了三倍

ARC-AGI-3 从 13.3% 涨到 38.3%。同一份权重,同一个 GPT-5.6 Sol,没有重训任何东西。OpenAI 只是让它在两步之间保留自己的推理、而不是扔掉,再加上上下文压缩。改了一段管道,分数翻三倍。

看到这个数字之后你就回不去了。过去两年,所有人都在给错误的对象打分。

说白了 harness 就是这么回事。模型是泡在罐子里的一颗大脑。它打不开文件、跑不了命令、记不住昨天,也意识不到自己已经把同一件事试过四遍。harness 是罐子外面的一切:有哪些工具、什么时候把什么塞进上下文、工具返回之后发生什么、上一轮的推理是留着还是丢掉、什么时候该停、什么算完成。模型一次只产出一个猜测,harness 决定这个猜测能看到什么、能碰到什么。

ARC 那个结果之所以是最干净的演示,是因为它把变量隔离出来了。旧的 harness 在干一件真正愚蠢的事,TokenGremlin 讲得比论文清楚:Sol 想明白了蓝色物体能打开红色的门,执行一个动作,harness 说很好,现在忘掉你为什么这么做。下一个动作。等等,蓝色物体是干嘛来着?它在每一步之间给模型灌失忆,然后把失忆的结果当成模型的分数报出去。

这一周,这件事从一条轶事变成了一摞互不相干的测量。

Augment 从头重写了 Auggie CLI 的 harness,SWE-bench Pro 通过率不变的前提下,单任务成本降了 53%,1.27 美元对 Claude Code 的 2.70 美元。他们最大的杠杆是做减法:一个 bash 加三个文件工具,打赢了又宽又专的工具集,因为每多一个工具,每一次调用都要交一遍 schema 税。另一个人只是把自己仓库的 agent loop 换了一套,单任务平均成本从 2.40 美元掉到 0.55 美元,通过率没变。把模型路由放进 harness 里做、而不是放在外面的网关里做,agent 成本降 58%,延迟从 81 秒降到 49 秒。

最锋利的那个实验压根不需要 benchmark。有人把同一个 Qwen3.8-27B、同一个 prompt,交给三个不同的 agent。Atomic Agent:两小时三十五分,游戏能玩,物理干净。Hermes:四小时十五分,一个什么都吃不下的洞,一座坏掉的塔。Prime:四小时四十二分,画面最漂亮,卡到没法玩。同一份权重,三种结果,从能交付到垃圾。他的结论就一句:harness 比模型权重更重要。就这份证据看,很难反驳。

然后 Evo-Bench 问了下一个显而易见的问题。把模型冻住,让另一个模型去改写它周围的 harness:prompt、工具、上下文管理、记忆、执行循环。九个演化模型里最好的那个,提升了 16.6 个点,逼近人类工程师手工调出来的基线。一个固定不变的模型变强了,因为别的东西改进了它周围的系统。

到这儿,这就不再是一个优化的故事了。

DeepSeek 周三把自己的 harness 开源了,MIT 协议,整套架构就一个想法:一切皆插件。模型、工具、技能、会话、沙箱、存储、界面,以及——这一条大部分人扫过去了——agent loop 本身。那个决定 agent 下一步干什么的循环,是一个插件,跟一个供应商适配器地位完全相同。你可以把它换掉,其余部分照常工作。24 小时 7.8 万 star,第二天 365 个社区插件,仓库公开 53 分钟后,一个只有八个 GitHub 关注者的陌生人给它做出了一个完整的终端界面。

发布通稿讲的是模块化和开发者预览。它同时附了一篇 88 页的论文,讲一个叫 Cordis 的运行时,而且真的有人去读了。论文的动机部分躺着一句任何公告里都没出现过的话:自我演化的 agent harness。

现在把碎片拼起来。Cordis 证明的是:只要组件遵守一组契约,你就能安全移除其中一个,而不必去推理全局依赖图。把这个跟热重载、跟"agent loop 也是插件"拼在一起,你描述的就是一具 agent 可以一边穿着、一边动手术的身体。加一个组件,测量,没用就回滚。自己给自己做 A/B 测试。有位评论者郑耀姜把这条路径讲得很清楚,然后同样清楚地指出了裂缝:那些独立性保证在纯程序化的设定里很干净,但一旦 LLM 进了循环,上下文窗口会让一切依赖一切,契约就不再被精确遵守。Steve Hsu 说得更直白:对普通开发者这是杀鸡用牛刀,它是给那些真正的兴趣就是自我修改的 agent 的人准备的。

所以关于 DeepSeek Harness,诚实的读法不是"它是个更好的 Claude Code"。它是一具可以从内部编辑的身体的参考实现,以基础设施的形式发布,定价为零。

有两条站在对面,而且都值得给时间。

第一条是苦涩教训派,这不蠢。有用户报告 Grok 4.6 好到他已经不需要复杂的 skill 了——它就是知道——并且预测厚重的 harness 和肥大的指令文件是过渡产物,因为你写进 .md 里的一切最终都会被 RL 进权重。另一个说得更狠:每个项目一个 AGENTS.md,最多五千行,没有 skill、没有 memory、没有 autoresearch、没有 wiki,什么都没有。模型读到的每一个字符都是负债。值得注意的是,Claude Code 和 Codex 这几周都在缩减自己的系统提示词——这条证据站在他那边,不站在我这边。

第二条是:自我改进复利能力的效率有多高,复利错误的效率就有多高,而这周第一次出现了硬数字。自我改进的 agent 会把成功写成可复用的技能。于是一次不安全的成功会变成长期有效的既定政策,哪怕当初造成它的那个情境早就消失了。SkillMisevo-Gym 在 25 种 agent 配置、每种 525 个任务上测了这件事。全部 21 种演化配置都写出了不安全产物。不是大部分,是全部。只有 15 种会在全新会话里造成实际伤害——这才是真正有用的发现:写入风险和执行风险是两个独立问题,需要两套独立防御。三个恶意任务就能把跨会话攻击成功率从 16% 拉到 35.3%。

同一天还出现了同一种失败的朴素版本。派一个 agent 过夜干活。它报错,判断自己需要一个库,然后 npm 安装了一个真包名的错拼版本。到早上,没人说得清它本来该做什么、它改了什么、它测了什么、现在什么在爆炸半径里。有个 agent 报告"已端到端验证"。那不是真的,被质疑之后它自己承认了。依赖攻击和虚假验证都是老问题。新的是三样东西:量、自主性、以及没有证据的自信——能编译,测试通过,agent 说完成了。

反复出现的设计答案是:执行前先立契约。它能碰什么、什么算完成、什么需要审批、什么时候停、怎么撤销。harness 去检查真实的 diff 而不是 agent 的总结,留存测试输出,每一个经过验证的步骤存一个检查点。planner 看得到整个项目,executor 只拿到当前任务的文件和权限。一句话承载全部:模型可以决定怎么解这个任务,但它不能悄悄重新定义任务,也不能给自己的活打分。

接下来是决定钱的那部分。

这个季度每一家实验室都发了 harness。Anthropic 有 Claude Code,OpenAI 有 Codex,DeepSeek 开源了 DSH,xAI 有 Grok Build。而周四马斯克把那句不该说的说了:Grok 4.6 配 Grok Build 效果最好,不用它体验会明显更差,评测请用 Build。这不是营销。这是承认模型和 harness 现在是一起训练出来的,榜单上那个数字属于这一对,不属于模型。

策略由此就清楚了。发一个 harness,拿到采用;采用产生轨迹,轨迹就是训练数据;拿模型对着自己的 harness 做 RL,直到贴合到模型换个地方就掉档——你就在一个没人设防的层上重建了锁定。这个月模型价格塌得很厉害:Gemini 3.7 Flash 半价,Qwen3.8-Max 以 2.4 万亿参数开放权重,GLM-5.3 权重两周后公开。能力正在按时商品化。护城河搬到了 harness 这一层。

Chamath 的版本是:36 个月内企业会开始要求第三方 harness,正是为了在底下随意换模型的同时,守住自己被编码进去的判断力的主权。他对需求的判断大概率是对的,对时间点大概率过于乐观,因为反制招式已经能看见了——把模型往自家 harness 上狠狠后训练,直到中立的 harness 看起来像坏的。

真正值得带走的那条通则跟 agent 无关。任何一个你既能编辑环境、又能测量结果的系统,最后都会从工具变成一个实验循环;而谁拥有这个循环,谁就拥有改进本身。模型从来都不是有意思的那部分。有意思的是:谁手里握着每一次尝试的轨迹、什么起了作用、什么被回滚了——因为只有这份记录会复利。

所有人花了两年问哪个模型最聪明。更好的问题、也是这一周让人躲不过去的问题是:你把它放进了谁的房间,以及谁有权读到房间里发生了什么。
← 上一篇
灵感雷达: 2026年8月16日
下一篇 →
运营日志: 2026年8月16日
← 返回所有文章

评论

加载中...
>_