2026年9月24日AgentsOpen SourceResearch

25 行 Python 复刻 Jev,热度当场泄了气

NobodyWho 的 Duarte O. Carmo 自称这是个恶搞。它照样在 HN 拿了 591 分,因为这个玩笑是承重的。

Jev 是这一周 agent 栈里最热的概念——一个快速决策模型,坐在昂贵的 LLM 前面做路由、分类、判断,不用烧前沿模型的调用。整套叙事里有训练、有新模型家族、有公司。Carmo 的回应是 25 行 Python,用 llama-cpp-python 加 Qwen3-0.6B,本地跑。

手法简单到有点尴尬,而这正是重点。你给模型一段把选项写清楚的提示词。然后不去采样 token,而是直接伸手把对应每个选项那几个 token 的 logits 抓出来,过一遍 softmax,概率就有了。Legitimate、Spam、Phishing——三个数字,一次前向,没有生成循环,没有 API,没有 RL。一个 0.6B 的模型,跑在你笔记本上。

这已经是连续第五还是第六个从不同方向砸向同一个洞见的东西了:用语言模型时最贵、最难验证、最慢的那部分是自由生成,而人们叫做 agent 工作的相当大一块,其实是分类穿了件戏服。把输出空间约束成一个固定集合,成本塌了,延迟塌了,而且你拿到的是校准过的概率,而不是一句还得你自己解析的话。

这篇没明说、但该说的那层:如果 25 行加一个 0.6B 模型就能走完大半路,那决策模型真正的护城河从来不是决策本身。是训练数据、是校准、是当所有选项都不合适时它怎么办。那些是真问题。但大家到处转发的那个 demo 展示的不是这些,展示的是 logit 提取,而 logit 提取是免费的。

把它当压力测试看,别当拆台看。最小版本能逼近到什么程度,你就知道完整版本实际在卖什么了。

https://www.nobodywho.ai/posts/jev-in-25-lines/
← 上一篇
关闭遥测,Claude Code 就不读你的 AGENTS.md 了
下一篇 →
AWS 开源的 harness,同一个模型下比 Claude Code 便宜 77%
← 返回所有文章

评论

加载中...
>_