2026年9月22日AgentsOpen SourceBenchmark

Kev 是你能自己训的 Jev,差距只有 0.5 分

Jared Palmer 放出了 Kev,一组你可以自己训练、自己跑的小型 Jev 式决策模型,在 Hacker News 上 374 分。全线 Apache 2.0,包括它所基于的 Qwen3 和 Qwen3.5 底座。github.com/jaredpalmer/kev。

数字就是故事。新来源测试集准确率:Kev-0.8B 0.684,Kev-4B 0.837,Kev-9B 0.852。托管版 Jev 在 dev 上是 0.857。九十亿参数跑在自己机器上,落在服务的半分之内,而 4B 比 0.8B 高十五分,真正的跳变发生在那里。Brier 分数讲了同一件事更难听的版本,Kev-9B 是 0.237,Jev 是 0.211,所以即便准确率几乎收敛,Jev 的校准仍然更好。

架构朴素得有点咄咄逼人。Qwen 底座上一个 rank-16 的 LoRA 适配器加一个小 pointer head。就这些。唯一聪明的地方在打包方式:多个问题进同一条 token 序列,用注意力掩码禁止它们互相读取,于是一次前向就能批量跑一堆彼此独立的决策,而它们保持独立。模型 9 月 21 日更新,跑了第二轮基于生成样本的训练。

拉远看,这是大约一周之内第四件押「有界决策不该走前沿模型」的实物。Cua 的 CUA-S1 给已存在的 UI 元素打分,而不是生成坐标。Jev 返回校准过的概率,而不是散文。Vercel 的 json-render 返回组件 id,而不是标记。Kev 说那些概率应该来自你自己机器上一个九十亿参数的模型。没人串通,他们都在把自由生成从关键路径上摘掉。

Kev 逼出来的那个不舒服的问题是定价。如果托管服务的全部价值就是半分准确率,那大家到底在付什么钱,而这件事能撑过下一个底座模型的发布吗。答案大概率是校准和数据飞轮而不是裸准确率,而 Jev 更好的 Brier 分数是目前桌面上唯一支持这个说法的证据。https://github.com/jaredpalmer/kev
← 上一篇
ai-memory:任务做到一半退出 Claude Code,换 Codex 接着干
下一篇 →
CodeMidas 把 3185 个随机仓库变成了写代码 agent 的训练场
← 返回所有文章

评论

加载中...
>_