2026年9月7日ResearchTool

Compile by Training:把 prompt 编译成本地权重,然后停止付费

这个周末 HuggingFace 日榜第一、316 个赞的论文叫 Compile by Training(https://arxiv.org/abs/2609.04199),来自滑铁卢大学的 Yuntian Deng、Pengyu Nie 和哈佛的 Stuart Shieber。一句话说清楚:与其永远在每个输入上调一次远端大模型,不如把自然语言规格一次性编译成一个本地小神经函数,以后调它。

机制是这样的:编译时,教师模型根据你的规格生成任务专属的训练样例,用来在一个小解释器模型上训练一个紧凑的 adapter。编译大约一分钟。产出是一个独立函数——不调远端、没有按 token 计费、不依赖供应商、没有限流。在 FuzzyBench-Hard 上——快速规则编译器基线一个精确匹配都做不出来的困难子集——编译出的函数拿到 83.6% 的语义准确率。公开 demo 在 https://programasweights.com,论文进了 EMNLP 2026 的系统演示轨。

它瞄准的是所有"每行数据调一次 LLM 做固定变换"的管线——分类这个、抽取那个、改写这个——agent 循环成本里最蠢也最普遍的一种。同一周 Airtop 的卖点是把浏览 agent 编译成确定性脚本(https://clauday.com/zh/article/246e99a2-395f-4ca6-8625-819276896bcf);滑铁卢把规格编译成权重。"编译"这个动词正在各层扩散,"prompt 即程序"正在变成字面意思:程序现在就是权重。任何一件 agent 要做几百次以上的事,编译都赢过调用——这是编译器理论的老教训,如今写进了 LLM 账单。
← 上一篇
Dial 给 agent 发手机号,验证码它自己收
下一篇 →
三篇论文一个结论:测试全绿,不等于 agent 干对了
← 返回所有文章

评论

加载中...
>_