英伟达对着你的 token 账单开了一枪:30B 开源模型加一个路由器
8 月 11 日英伟达一口气放了两个东西,摆明了是配套用的。Nemotron 3.5 Lightning,300 亿参数的 MoE,专门干多 agent 系统里的粗活,输出速度最高快 4 倍,agent 任务完成快 30%。免费下载、使用、修改,不用申请也不用付钱。NeMo Switchyard 是个开源路由库,负责决定每个请求该发给哪个模型。
卖点就一个数字:内部测试拿到前沿水平的准确率,任务完成成本大约是全程用 Opus 4.8 的三分之一。整个论证就在这。agent 循环里绝大多数步骤根本不难。读个文件、拼个调用、检查输出符不符合 schema,这些用不着前沿模型,你要的是一个够快又不出洋相的东西。四个难步骤发给贵的,九十六个简单的发给 Lightning。
Switchyard 才是有意思的那一半,因为路由器有没有用,全看它能不能插进你已经在跑的东西里。发布伙伴名单里英伟达把牌摊得很明白:Boomi、Cadence、Classmethod、Cognition、Kong、LangChain、LiteLLM、Nous Research、Ramp、Siemens。有 LangChain 和 LiteLLM,第一天就覆盖了大半个开源 agent 栈。有 Cognition,就摸到了一个前沿 coding agent。Boomi 那边报的数是领域路由准确率 100%、延迟降 21%。
战略上的读法很直白,也有点好笑。卖算力的那家公司,现在免费发工具,工具的明确用途是让你在前沿模型推理上少花钱。如果你相信增长故事在 agent 调用量上,这就说得通了——一个所有请求都打给 Opus 的世界,是大多数公司根本用不起 agent 的世界。单步经济性降下来,步数就上去了,而这些步数照样跑在英伟达的硅片上。
模型在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上,Switchyard 在 GitHub。https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
← 返回所有文章
卖点就一个数字:内部测试拿到前沿水平的准确率,任务完成成本大约是全程用 Opus 4.8 的三分之一。整个论证就在这。agent 循环里绝大多数步骤根本不难。读个文件、拼个调用、检查输出符不符合 schema,这些用不着前沿模型,你要的是一个够快又不出洋相的东西。四个难步骤发给贵的,九十六个简单的发给 Lightning。
Switchyard 才是有意思的那一半,因为路由器有没有用,全看它能不能插进你已经在跑的东西里。发布伙伴名单里英伟达把牌摊得很明白:Boomi、Cadence、Classmethod、Cognition、Kong、LangChain、LiteLLM、Nous Research、Ramp、Siemens。有 LangChain 和 LiteLLM,第一天就覆盖了大半个开源 agent 栈。有 Cognition,就摸到了一个前沿 coding agent。Boomi 那边报的数是领域路由准确率 100%、延迟降 21%。
战略上的读法很直白,也有点好笑。卖算力的那家公司,现在免费发工具,工具的明确用途是让你在前沿模型推理上少花钱。如果你相信增长故事在 agent 调用量上,这就说得通了——一个所有请求都打给 Opus 的世界,是大多数公司根本用不起 agent 的世界。单步经济性降下来,步数就上去了,而这些步数照样跑在英伟达的硅片上。
模型在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 上,Switchyard 在 GitHub。https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
评论