2026年9月19日AgentsFrameworkOpen SourceResearch

英伟达 SoL-Pi:一行模型都没改,agent 的 token 流量砍掉一半

SoL-Pi 是挂在 Pi harness 上的四个机制,把记录到的 token 流量压掉 44.7% 到 49.0%,同时在 GPT-5.6 Sol 和 Opus 5 上的表现跟原版 Pi 持平。API 成本降约三分之一。作者给的账是,相比原生 Codex 和 Claude Code 每小时省 8.75 到 13.50 美元。不重训、不微调、不换模型。英伟达十四位作者,arXiv 2609.20519,9 月 17 日提交,MIT 协议开源在 https://github.com/NVlabs/SoL-Pi。

四个机制值得一个个点名,因为它们各打一种浪费。Action Fusion 让一次编辑或写入在同一个工具调用里顺手跑完后续的校验命令,直接干掉一整类往返。ObservationPack 把重复出现的大段文本结果变成稳定句柄,可以按页精确召回,同一个文件被 dump 三次只收你一次钱。Evidence-Preserving Reducer 把长长的诊断日志压成回执,但只有当保留下来的每一句引用都还能和归档原文逐字对上,这次压缩才被接受——这是极少见的、不可能偷偷编造的那种摘要。Online Context Compact 让已完成的计划步骤在经过经济性和上下文窗口压力检查之后才进入压缩候选,而不是到点就压。

第三个机制才是有意思的,而且它干的事远不止省钱。agent 压缩长期存在的毛病是:agent 自己写一份摘要,回头又把它当可信上下文读回来,中间没有任何东西检查这份摘要是否忠于实际发生的事。强制要求每条保留引用都能和归档对上,等于在一个通常完全没有校验的位置插了一道校验。这是个小点子,但能推广到成本之外很远的地方。

评测跑在 EdgeBench 上,51 个任务,作者最在意的一句话是这些改进能迁移到开发时的场景之外。那个 44.7% 到 49.0% 该按"一家做 harness 的公司希望你相信 harness 很重要"来打折,这没问题,因为这几个机制描述得足够清楚,你可以自己重写一遍验。真正立住的是方向:眼下最便宜的能力增益不在权重里。

相关阅读:176 种 harness 配置那篇 https://clauday.com/zh/article/ad45df57-8be4-4c28-8947-09ac7fb0bea4
← 上一篇
Manus 融 5 亿美元、估值 40 亿,距北京叫停 Meta 收购只过了五个月
下一篇 →
扫了 176 种 harness 配置之后:强模型只给 bash,然后让开
← 返回所有文章

评论

加载中...
>_