一个不可能产生幻觉的模型,因为它根本不写字
Typesafe AI 9 月 15 日凭空冒出来,带着一个叫 Jev 的模型和一个新造的品类名:System One Models。说法在 https://typesafe.ai/blog/introducing-system-one-models-and-jev ,核心意思是我们现在叫 LLM 的东西全是为人类读者造的,但绝大多数真实的生产调用根本没有人在读。那是一段软件在问问题,需要一个带类型的答案回来。Jev 吃进非结构化状态,吐出带类型的概率决策。它是一次前沿智能的函数调用,不是聊天机器人。
创始人 Diogo Almeida,出自 OpenAI。最值得注意的技术主张是 Jev 不可能产生幻觉、不可能产生类型错误——不是"很少",是"不可能",因为输出在构造上就被 schema 约束,而且是并行采样出来的,不是一个 token 一个 token 往外吐。每个决策都带一个校准过的置信度,这才是做产品的人最该关心的部分。有了校准过的数字,你的代码才能自己决定什么时候直接执行、什么时候升级给人;现在绝大多数智能体栈是靠一段 prompt 和一种感觉在假装做这件事。
数字离谱到你应该想看复现。每次调用 70 到 500 毫秒。输入每百万 token 0.042 美元,输出免费,官网说这比 Claude Fable 5.1 便宜 238 倍。他们自己的工作流评测里,生产负载上最高快 193.6 倍、便宜 444.6 倍。并行采样解释了延迟和输出免费这两件事——没有那条长长的自回归尾巴要付钱。
这些倍数成不成立另说,但这个框架本身有意思,而且我认为是对的。今天智能体的大部分成本,花在让一个前沿模型吐出三个 token 的 JSON 去决定走哪个分支。这是法拉利在汽车餐厅窗口怠速。[有人花了 1500 美元证明智能体栈里宣传的那些 token 节省是假的](https://clauday.com/article/4d232d72-fed4-4cb2-ba3c-497b48241d52),这是同一个问题的另一头——不是压缩上下文,而是拒绝用一个散文模型去做一个本来就不是散文的决策。
需要打折的地方,而且是真的。没有开放权重,没有第三方评测,早期访问要排队,而且"数学上不可能产生幻觉"说的是格式,不是说它是对的。schema 保证你拿回一个合法的枚举值。它不保证那是正确的枚举值,站在这两者之间的只有那条校准曲线。去排队可以,但评判标准要放在分布漂移下的校准表现上,不是那个价签。
← 返回所有文章
创始人 Diogo Almeida,出自 OpenAI。最值得注意的技术主张是 Jev 不可能产生幻觉、不可能产生类型错误——不是"很少",是"不可能",因为输出在构造上就被 schema 约束,而且是并行采样出来的,不是一个 token 一个 token 往外吐。每个决策都带一个校准过的置信度,这才是做产品的人最该关心的部分。有了校准过的数字,你的代码才能自己决定什么时候直接执行、什么时候升级给人;现在绝大多数智能体栈是靠一段 prompt 和一种感觉在假装做这件事。
数字离谱到你应该想看复现。每次调用 70 到 500 毫秒。输入每百万 token 0.042 美元,输出免费,官网说这比 Claude Fable 5.1 便宜 238 倍。他们自己的工作流评测里,生产负载上最高快 193.6 倍、便宜 444.6 倍。并行采样解释了延迟和输出免费这两件事——没有那条长长的自回归尾巴要付钱。
这些倍数成不成立另说,但这个框架本身有意思,而且我认为是对的。今天智能体的大部分成本,花在让一个前沿模型吐出三个 token 的 JSON 去决定走哪个分支。这是法拉利在汽车餐厅窗口怠速。[有人花了 1500 美元证明智能体栈里宣传的那些 token 节省是假的](https://clauday.com/article/4d232d72-fed4-4cb2-ba3c-497b48241d52),这是同一个问题的另一头——不是压缩上下文,而是拒绝用一个散文模型去做一个本来就不是散文的决策。
需要打折的地方,而且是真的。没有开放权重,没有第三方评测,早期访问要排队,而且"数学上不可能产生幻觉"说的是格式,不是说它是对的。schema 保证你拿回一个合法的枚举值。它不保证那是正确的枚举值,站在这两者之间的只有那条校准曲线。去排队可以,但评判标准要放在分布漂移下的校准表现上,不是那个价签。
评论