英伟达把 Harness 捧成了主角
本周最重要的 AI 数字不是来自哪个新模型,而是来自英伟达的一个实验。研究人员给 Claude Opus 5 套上一个定制 harness——带完善的记忆管理,外加一个类似监工的 supervisor 组件——在 ARC-AGI-3 上跑出了 100%。这个基准是让模型在零说明的情况下自己摸索 2D 游戏怎么玩、怎么赢。同一个模型不带 harness 呢?30%。而这个 30% 已经是所有被测模型里最高的裸分。
再读一遍:最强模型裸奔和穿装备之间差了 70 个点。harness——工具、记忆、循环逻辑、那个盯着干活的监工——对长程任务表现的贡献超过了模型本身。
这套系统叫 NOOA(Nvidia Labs Object-Oriented Agents),设计非常具体:输入输出全部带类型而不是自由文本,模型通过引用直接操作活的 Python 对象而不是把状态复制进上下文,动作直接写成带控制流的 Python 代码,持久的类型化状态挂在 agent 对象上。最妙的一条是把 harness 本身也做成了模型可以调用的 API——上下文块和事件历史不是藏起来的管道,是模型能自己查询和管理的对象。这套东西在 SWE-bench Verified 上打 82.2%,CyberGym L1 上 86.8%,成本只有同类 harness 的一半左右。
这条线我们跟了好几周——DeepSeek 发自己的 harness,微软 Agent Lightning 把 harness 放进 RL 循环,ARC 分数随脚手架剧烈波动。但这是迄今最干净的一次表态,而且说话的是卖芯片的公司,不是卖模型的。如果性能真的住在 harness 里,护城河的故事就要改写了:模型商品化,harness 差异化,会造壳的人和会炼权重的人一样值钱。
TechCrunch 报道:https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/ 技术细节:https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
相关阅读:https://clauday.com/zh/article/960dc46e-c2cc-4c05-8dc5-bc12856d0f82
← 返回所有文章
再读一遍:最强模型裸奔和穿装备之间差了 70 个点。harness——工具、记忆、循环逻辑、那个盯着干活的监工——对长程任务表现的贡献超过了模型本身。
这套系统叫 NOOA(Nvidia Labs Object-Oriented Agents),设计非常具体:输入输出全部带类型而不是自由文本,模型通过引用直接操作活的 Python 对象而不是把状态复制进上下文,动作直接写成带控制流的 Python 代码,持久的类型化状态挂在 agent 对象上。最妙的一条是把 harness 本身也做成了模型可以调用的 API——上下文块和事件历史不是藏起来的管道,是模型能自己查询和管理的对象。这套东西在 SWE-bench Verified 上打 82.2%,CyberGym L1 上 86.8%,成本只有同类 harness 的一半左右。
这条线我们跟了好几周——DeepSeek 发自己的 harness,微软 Agent Lightning 把 harness 放进 RL 循环,ARC 分数随脚手架剧烈波动。但这是迄今最干净的一次表态,而且说话的是卖芯片的公司,不是卖模型的。如果性能真的住在 harness 里,护城河的故事就要改写了:模型商品化,harness 差异化,会造壳的人和会炼权重的人一样值钱。
TechCrunch 报道:https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/ 技术细节:https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
相关阅读:https://clauday.com/zh/article/960dc46e-c2cc-4c05-8dc5-bc12856d0f82
评论