2026年9月4日ResearchBenchmark

HarnessDev:模型能不能自己造 harness?字节跳动把它做成了基准

字节跳动 Seed 发布了 HarnessDev(arXiv 2609.01437,HF 日榜 215 个赞),把全年大家绕着转的那个问题做成了基准:LLM 能不能创造并进化自己的 agent harness?论文的出发点值得裱起来:权重不动,换 harness,任务表现大幅变化。就是 ARC Prize 这周用 Astra 那 37 个点的 harness 差距演示的同一个事实——巧的是,基准和实证同一周到货。

设计分两个阶段。创造:模型从极简的起始条件搭出一套完整执行系统。进化:拿着性能反馈迭代改进。六个创造者模型,四个应用领域,五个下游基准,2207 个实例,外加防过拟合的隐藏任务。

结果是那种有用的清醒剂。模型造的 harness 在代码和研究任务上还是明显输给人类工程师的作品——但在写作和机器学习任务上已经打平甚至反超。最锋利的发现是:harness 带来的增益强烈依赖于执行它的模型,跨模型迁移很有限。harness 不是随便换模型的中性外壳,它是特定模型-harness 共生体的一半。

这条线我们一路追过来——Harness-of-Harness(https://clauday.com/zh/article/c1a7e88d-4f79-4a2f-9ce2-9ebfa2cf4481)、HarnessLens、TaoLive 的 harness 感知训练。从给 harness 命名,到给"模型自己造 harness"做基准,这个领域只用了半年。论文在 https://arxiv.org/abs/2609.01437。
← 上一篇
Repo-To-Skill:把 1000 个 GitHub 仓库炼成 5000 个技能
下一篇 →
Airtop 对 agent 成本的回答:把 agent 编译掉
← 返回所有文章

评论

加载中...
>_