2026年7月22日ResearchCodingAgents

SWE-Pruner Pro:模型自己早就知道哪些行该扔

每一个长时间运行的编码agent都会被自己的工具输出淹死。你grep一个文件,回来400行,可能12行有用,然后这400行在剩下的整个run里都占着上下文。标准解法是训一个外部分类器读输出、决定留什么。字节这篇新论文说你不需要,因为coder模型自己就知道。

SWE-Pruner Pro,arXiv 2607.18213,7月20日提交,论点是:编码LLM在处理工具输出时构建的内部表示,本身就已经编码了哪些行重要。所以他们不做单独的模型,而是挂一个小head,把这些已有的表示转成逐行的保留或剪除决策,embedding按每份工具输出的行数做适配。推理时的开销是有界的——不跑第二个模型,图的就是这个。

省下来的是提示和补全加起来最多39%的token,在两个开源权重底座、四个多轮基准上测过。光这个已经是个不错的结果。有意思的地方在于质量不只是持平。在MiMo-V2-Flash上,SWE-Bench Verified解决率涨了3.8个点,Oolong准确率涨了2.2个点。

这个方向很关键。上下文压缩通常是你不得不接受的取舍,用一点准确率换一大笔预算。这里把垃圾剪掉反而让模型任务做得更好,这是垃圾在主动伤害而不是单纯占位的直接证据。context rot是真实的失效模式,而且能在解决率上量出来。

战略上的读法是:上下文管理正在悄悄从harness的功能变成模型的功能。今天每个agent框架外面都挂着手调的截断启发式,写的人靠猜什么重要。这篇论文说,模型自己的激活值比你在外面猜出来的任何信号都好,而读它的那个head小到几乎免费。代码在GitHub,论文在 arxiv.org/abs/2607.18213
← 上一篇
text-to-cad:把一间机加工车间塞给你的编码agent
下一篇 →
DeepSearch-World:一个9B的搜索agent,没老师,自己教会了自己
← 返回所有文章

评论

加载中...
>_