2026年10月2日AgentsOpen SourceInfrastructure

Clef、Strands Decider、Decisions API:三家巨头一周内集体复刻 Jev

一个月前,决策模型还只是一家创业公司的卖点,这周已经成了一个品类。周二 OpenAI 在 Dev Day 上顺口公布了 Decisions API;周四 Cloudflare 发了 Clef 和 Clef-flash,AWS 发了 Strands Decider 2B。三家做的是同一件事,也就是 TypeSafe 的 Jev 在做的事:给模型一组固定选项,它返回一个带校准概率的类型化选择。不生成自由文本,也不临场发挥调工具。

三家里 Cloudflare 最认真。Clef 底座是冻结的 Qwen3.8-27B,Clef-flash 是冻结的 Qwen3.5-9B,上面各加一个路由头和 rank-256 的适配器。推理时只做一次 prefill,然后并行给每个合法选项打分,完全不逐 token 生成,所以快。它能看图,Jev 不能;上下文 64k,Jev 是 32k。Cloudflare 说在 TypeSafe 自己的评测集上,四个方向赢了 Jev 三个。权重 Apache 2.0 放在 Hugging Face,API 跟 Jev 兼容,托管在 Workers AI。他们的威胁情报团队拿它给域名分类,2.2 秒,gpt-oss-120b 要 4.7 秒,给出的类别还更全。另外推出 RL 微调服务,先由 Cloudflare 工程师手把手做,之后开放自助。

亚马逊这个起初是业余项目。杰出工程师 Marc Brooker 看到 Jev 后自己在 Qwen3.5-2B 上做了一个,一度冲上同尺寸 Jevbench 第一,Strands Labs 于是把它收拾好开源了。Brooker 对这个品类的概括最干净:工作流里那一步的完美决策器,回答「按现在的状态,下一步该干嘛」。

真正解释这波热潮的数字来自一个黑客松 demo,不是哪家实验室:用 Jev 检查 agent 的每个动作是否偏离任务,成本 2.94 美元,换成前沿大模型要 372 美元。这个价位下,每个动作都配一个审查员终于付得起了。这正是 OpenAI 一直花「大量算力」在解决的 agent 监控问题。

TypeSafe 创始人 Diogo Almeida 的话最损:「要又快又便宜,掷骰子就行。」问题从来不是速度,而是校准。训一个这种模型只要几百到几千美元,现在谁都没有护城河。第一篇专门压测有序量表校准的论文已经挑出了真毛病,今天另有一篇专门讲。到十一月还会冒出一打类似模型,选的时候看校准曲线,别看延迟图。

链接:blog.cloudflare.com/clef-decision-models,techcrunch.com(Strands Decider 2B,10 月 1 日)
← 上一篇
技能级联攻击:三个无害的 skill,合起来删掉一条药物警告
下一篇 →
Gemini 4 Argon:先给网络安全防守方,其他人排队
← 返回所有文章

评论

加载中...
>_