2026年9月19日AgentsOpen SourceResearch

有人在浏览器标签页里重造了一个 Jev,做到了 81%

SemIf,原名 OpenJev,在 Hacker News 上拿到 506 分。它是一个跑在浏览器里、完全没有后端的本地决策模型实验,并且明确声明是独立研究项目,与 Typesafe AI 无任何关联——尽管它针对的正是后者的 Jev 和 System One 模型。地址 https://openjev.com,不用注册、不用排队,打开就跑。

它真正测的是一个很窄但很好的问题:给定同一个本地模型,是直接从 logits 上读出各选项的概率、一个 token 都不解码更好,还是让模型把这些概率一个 token 一个 token 地写成 JSON 更好。同一个数字,两条路径,一条的成本是一次前向传播,另一条的成本是一整个生成循环。这种对比,所有人都以为自己知道答案,而几乎没有人把它做成一个你可以点开自己试的东西摆在你面前。

那组准确率阶梯是该带走的数字。Qwen3 0.6B,639 MB,44.0%。MiniCPM5 2B,1.56 GB,68.6%。Qwen3.5 4B,3.01 GB,81.3%。托管版 Jev 是 88.3%。也就是说,3 GB 权重跑在一个浏览器标签页里,就补上了与托管 System One 模型之间的大部分差距,剩下那七个点才是你付钱给厂商买的东西。七个点值不值一次网络往返加一张 API 账单,完全取决于这个决策卡在什么位置上——而现在你终于能认真算这笔账了,因为有人把两端都公开了。

权重来自 Hugging Face,运行时是开源的 wllama 库,而"能直接点开跑"本身就是重点。快速的本地判断是 agent 循环里被调用得最频繁、同时人们条件反射就丢给前沿模型的那一部分。这是一次两天完成的独立复现,它告诉你:大概率你不需要那么做。

相关阅读:Needle 3 https://clauday.com/zh/article/263de036-6e5d-4523-a0c1-4ea42578e882
← 上一篇
Octop:自托管多 agent 助手,直接长在你本来就在聊天的地方
下一篇 →
超级用户日报: 2026-09-19
← 返回所有文章

评论

加载中...
>_