OpenAI Decisions API:每百万 $0.10,只回答是、否、选哪个
OpenAI 周二把 Decisions API 开进公开测试,Hacker News 给了 381 分。这是个新端点 POST /v1/decisions,输入文本或图片加一组问题,返回带类型的答案:某个条件成立的概率、固定集合里选一个、按有序等级打分。不做自由生成。OpenAI 说比 Responses API 快约 10 倍。目前唯一可用模型是 gpt-6-luna,价格是输入每百万 token $0.10,没有输出费、没有缓存读写费,因为压根没有输出可收费。正式 GA "几周内"。
这是决策模型这个品类在最大的 API 厂商这里走向主流。TypeSafe AI 的 Jev 开了头。AWS 跟了 Strands Decider 2B,Cloudflare 跟了 Clef,都是开源权重。Musubi 周一发了做审核的 PolicyLM。现在 OpenAI 把同一个形态做成托管产品:从选项里挑、返回一个校准过的数、一次前向算完、便宜到能挡在每个请求前面。三种问题类型正好对上 agent 框架真正需要的东西。predicate 对应"这一步成了没",choice 对应路由,score 对应严重度或质量门。每个答案带置信度,拒答也作为带类型的答案返回而不是报错。
和这周其他事的时间点不是巧合。同一天 Docker Agent 的 v1.149.0 版本加了"OpenAI Decisions 作为原生评估后端",已经有框架把它当裁判而不是生成器用了。上周 Fast Models Slow Evidence 那篇论文测到决策模型做的门准确率能到 98%,而端到端 agent 只有 58%,这正是把门拆成一次便宜的独立调用、而不是让大模型给自己打分的理由。
要盯的是 OpenAI 会不会公布校准数字。Jev、Strands、Clef 都在 JevBench 上报 Brier 分数。Decisions 文档承诺给概率,但到现在没有任何公开测量说这些概率有多可信。对一个价值全在那个数字上的产品,这是缺的那一行。
链接:developers.openai.com/api/docs/guides/decisions
← 返回所有文章
这是决策模型这个品类在最大的 API 厂商这里走向主流。TypeSafe AI 的 Jev 开了头。AWS 跟了 Strands Decider 2B,Cloudflare 跟了 Clef,都是开源权重。Musubi 周一发了做审核的 PolicyLM。现在 OpenAI 把同一个形态做成托管产品:从选项里挑、返回一个校准过的数、一次前向算完、便宜到能挡在每个请求前面。三种问题类型正好对上 agent 框架真正需要的东西。predicate 对应"这一步成了没",choice 对应路由,score 对应严重度或质量门。每个答案带置信度,拒答也作为带类型的答案返回而不是报错。
和这周其他事的时间点不是巧合。同一天 Docker Agent 的 v1.149.0 版本加了"OpenAI Decisions 作为原生评估后端",已经有框架把它当裁判而不是生成器用了。上周 Fast Models Slow Evidence 那篇论文测到决策模型做的门准确率能到 98%,而端到端 agent 只有 58%,这正是把门拆成一次便宜的独立调用、而不是让大模型给自己打分的理由。
要盯的是 OpenAI 会不会公布校准数字。Jev、Strands、Clef 都在 JevBench 上报 Brier 分数。Decisions 文档承诺给概率,但到现在没有任何公开测量说这些概率有多可信。对一个价值全在那个数字上的产品,这是缺的那一行。
链接:developers.openai.com/api/docs/guides/decisions
评论