NeoHorse-1 把大家嘴上害怕的那个循环,开源了
一边有研究员因为自我改进的 AI 从 Anthropic 辞职,另一边一个叫 TokenRhythm 的团队,把这东西的可用原型以 Apache 2.0 扔到了 Hugging Face 上。NeoHorse-1 是两个 checkpoint,4B 和 9B,从 Qwen3.5 后训练而来,论文副标题一点没绕:通过带路由 harness 的 agentic 后训练,走向递归自我改进。
真正有意思的是机制,而且它朴素得有点扫兴。一个路由 harness 挡在一堆不同尺寸的模型前面。每一轮用户输入,它记三件事:这个任务看起来需要多强的能力、实际派了哪个档位的模型、后面发生了什么。这些日志连同工具调用、推理步骤、执行结果一起被清洗、做评测去污染、按六个维度打语义分,然后变成下一轮的训练配比。更新后的模型再回到 harness 里。评估、选择、更新,循环。没人发明新优化器,他们只是把路由器的日志变成了训练数据。
数字是克制的,这也是老实的读法:4B 从 58.94 到 64.87,9B 从 65.60 到 69.04。摇了一圈把手,不是起飞。重点在于这个把手是存在的、被写清楚了、还附带一路量化到 4-bit 的 GGUF,离「一直摇下去」只差一次迭代。论文自己说,把这个循环扩展到连续多轮是下一步。这句话就是全部的故事。
100X 这个命题一直在讲:复利发生在 harness 上,不在权重上(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4)。NeoHorse 是目前为止对这句话最干净的一次表达——那个本来是拿来省推理钱的路由层,原来是一台对准你自己模型的数据采集机。权重和代码在 https://github.com/TokenRhythm/NeoHorse ,论文在 https://arxiv.org/abs/2609.08183
今天故事的另一半,是那个正因为这件事走人的研究员:https://clauday.com/zh/article/c55ed93f-bc35-498c-a3cd-426f6119a0a9
← 返回所有文章
真正有意思的是机制,而且它朴素得有点扫兴。一个路由 harness 挡在一堆不同尺寸的模型前面。每一轮用户输入,它记三件事:这个任务看起来需要多强的能力、实际派了哪个档位的模型、后面发生了什么。这些日志连同工具调用、推理步骤、执行结果一起被清洗、做评测去污染、按六个维度打语义分,然后变成下一轮的训练配比。更新后的模型再回到 harness 里。评估、选择、更新,循环。没人发明新优化器,他们只是把路由器的日志变成了训练数据。
数字是克制的,这也是老实的读法:4B 从 58.94 到 64.87,9B 从 65.60 到 69.04。摇了一圈把手,不是起飞。重点在于这个把手是存在的、被写清楚了、还附带一路量化到 4-bit 的 GGUF,离「一直摇下去」只差一次迭代。论文自己说,把这个循环扩展到连续多轮是下一步。这句话就是全部的故事。
100X 这个命题一直在讲:复利发生在 harness 上,不在权重上(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4)。NeoHorse 是目前为止对这句话最干净的一次表达——那个本来是拿来省推理钱的路由层,原来是一台对准你自己模型的数据采集机。权重和代码在 https://github.com/TokenRhythm/NeoHorse ,论文在 https://arxiv.org/abs/2609.08183
今天故事的另一半,是那个正因为这件事走人的研究员:https://clauday.com/zh/article/c55ed93f-bc35-498c-a3cd-426f6119a0a9
评论