GPT-6 Sol 和 Luna:价格砍一半,智力原地踏步,这恰恰是重点
OpenAI 9 月 22 日发了 GPT-6 Sol 和 GPT-6 Luna,距离 Astra 十九天。Sol 每百万 token 输入 2 美元、输出 10 美元,Luna 是 0.1 和 0.5。两个都正好是 GPT-5.6 对应版本促销价的一半。第三方分析说,原始智力还停在 GPT-5.6 的水平,有些评测涨了,有些跌了。
这么看像是一次让人失望的发布,直到你想清楚这两个模型是干什么用的。AutomationBench 上,Sol 在 xhigh 档拿 33.2%,每个任务 0.27 美元,而 Claude Opus 5 开到 max 是 26.9%,成本是它的十一倍。Luna 比上一代涨 5.4 个点,成本低 58%。DeepSWE v1.1 上 Sol 最高档 68.8%,每任务 1 美元;Luna 同样拿到 68.8%,每任务 0.22 美元。一个价格是旗舰二十分之一的模型,在 agent 编码上打平,这是定价事件,不是能力事件。
该说的短板也得说:Sol 的天花板比前代低。它最好的 DeepSWE(68.8%)和 OSWorld 2.0(64.4%)都低于 GPT-5.6 Sol 的最好成绩(72.7% 和 66.2%),也低于 Claude Opus 5 的(73.7% 和 70.2%)。Astra 还是那个性能型号,Sol 和 Luna 是你准备跑十万次的型号。
这个分层才是值得盯的事。过去两年,有意思的问题一直是谁最聪明。到了 agent 场景,问题已经悄悄变成了每一块钱能换来多少次成功完成的任务,而这两个问题的答案不是同一个。这一周里,OpenAI 和 Anthropic 在同一天降价。谁都不是在做慈善。
现在可以在 ChatGPT Work 和 API 里用,模型名 gpt-6-sol 和 gpt-6-luna,ChatGPT 端分批放量。
https://openai.com/index/introducing-gpt-6-sol-and-luna/
← 返回所有文章
这么看像是一次让人失望的发布,直到你想清楚这两个模型是干什么用的。AutomationBench 上,Sol 在 xhigh 档拿 33.2%,每个任务 0.27 美元,而 Claude Opus 5 开到 max 是 26.9%,成本是它的十一倍。Luna 比上一代涨 5.4 个点,成本低 58%。DeepSWE v1.1 上 Sol 最高档 68.8%,每任务 1 美元;Luna 同样拿到 68.8%,每任务 0.22 美元。一个价格是旗舰二十分之一的模型,在 agent 编码上打平,这是定价事件,不是能力事件。
该说的短板也得说:Sol 的天花板比前代低。它最好的 DeepSWE(68.8%)和 OSWorld 2.0(64.4%)都低于 GPT-5.6 Sol 的最好成绩(72.7% 和 66.2%),也低于 Claude Opus 5 的(73.7% 和 70.2%)。Astra 还是那个性能型号,Sol 和 Luna 是你准备跑十万次的型号。
这个分层才是值得盯的事。过去两年,有意思的问题一直是谁最聪明。到了 agent 场景,问题已经悄悄变成了每一块钱能换来多少次成功完成的任务,而这两个问题的答案不是同一个。这一周里,OpenAI 和 Anthropic 在同一天降价。谁都不是在做慈善。
现在可以在 ChatGPT Work 和 API 里用,模型名 gpt-6-sol 和 gpt-6-luna,ChatGPT 端分批放量。
https://openai.com/index/introducing-gpt-6-sol-and-luna/
评论