2026年8月16日ToolOpen SourceInfrastructure

Soup 在 4GB 笔记本显卡上微调 8B 模型,还把自己撤回的结论一起公开

Soup 今天在 GitHub trending 上涨了 303 星,标题数字是:在一张 4GB 显存的 RTX 3050 笔记本卡上训 Llama-3.1-8B-Instruct。实测 NF4 下 119.6 tokens/秒,峰值显存 3.32 GB。Apache-2.0,作者 Alpamys Makazhan,地址 https://github.com/MakazhanAlpamys/Soup

诀窍是 layer streaming。常规微调要把冻结的 base model 常驻在显存里,这就直接定死了硬件门槛——8B 模型的这个门槛远在游戏本之上。Soup 改成从主机内存里一次流一层 decoder 进来,只有正在用的那一层占显存。于是峰值显存不再跟模型大小挂钩,改成跟单层大小挂钩,而后者小得多、也平得多。项目声称跟常规常驻训练是 bit-exact 等价的,意思是这只是一套内存调度,不是那种会悄悄改变你结果的近似。

另一半是接口。一条命令,一个 YAML。安装 pip install soup-cli[train],Python 3.10 到 3.12,支持 HuggingFace Hub 上任何文本生成模型,Llama、Qwen、Gemma、Mistral 都有显式支持。README 的说法是"不用 SSH,不用配置地狱",精准打在那个缺口上:你想 post-train 点东西,结果要先花一个周末折腾云 GPU 的管道,然后才知道你的想法到底行不行。

真正让它值得多看一眼、而不是跟其他同类项目一样划过去的,是这个:仓库公开了自己的测量记录,包括零结果和已经撤回的声明。还提供了免费 Colab notebook 让你自己复现那个头条数字,以及一篇带 DOI 的预印本。在一个"每个 README 都宣称不可能的加速比、没人展示跑砸了的实验"的品类里,把自己的撤回公开出来,比任何 benchmark 表格都更能说明可信度。

该说的局限也说清楚:从主机内存流数据是要吃带宽的,所以这买到的是准入门槛,不是速度。你要是本来就有显存,常驻训练更快。重点在那条地板线——一次 8B 的 post-training,现在可以在你已经有的笔记本上开跑,先搞清楚想法成不成立,再决定要不要去租卡。
← 上一篇
Inferock Bench:给你开账单的公司,同时也在定义什么算失败
下一篇 →
超级用户日报: 2026年8月16日
← 返回所有文章

评论

加载中...
>_