2026年8月31日InfrastructureAgents

AI 爬虫正在吃掉 kernel.org 五分之一的算力

管着 git.kernel.org 后端基础设施的 Konstantin Ryabitsev,把 AI 训练热潮到底让托管开放数据的人付出多少代价写了出来,数字很凶。每天大约六百万次请求里,真正合法的人类或工具流量只占 2% 左右。剩下全是爬虫,而且它们不走便宜的 clone 那条路,非要一页一页地渲染 HTML 提交页面。Linux.git 有 148 万个 commit、约 922 个 fork,乘出来是几十亿个合法 URL,这些机器人想把它们全爬一遍。

防线是一个叫 Anubis 的工作量证明挑战,它在撑,但很勉强。66% 的请求过不了挑战、被挡在外面,三分之一解开了、放进来。即便如此,十四到十六个 CPU 核心——整台机器五分之一的算力——被永久钉死在给爬虫渲染 commit 上,而这些爬虫根本不会像人一样去读。Ryabitsev 的形容是,它们'像蝗虫群一样压下来,又快又猛地打到系统崩掉,然后转身去下一家'。

你没法直接封掉这些家伙,因为它们从住宅和移动代理网络里出来,没有一段干净的 IP 段可以拉黑。这跟我们之前写过的那篇同一个形状——有人冒充 ClaudeBot 的 user agent 扫全网找 AI 工具的密钥(clauday.com/zh/article/2da1cab7-0416-4b25-aaab-5fc871eab696)——agent 和爬虫都藏在那种让你很难跟真实用户区分、区分起来又很贵的流量模式里。

真正值得读到抱怨之外的,是底下那层经济账。免费、高价值、公开可取的源代码,正是训练想要的,也正是住宅代理商能变现的,所以不管工作量证明的门槛抬多高,往死里爬的动机都不会消失。Agent 时代那笔安静的成本,最先落在了志愿者维护的基础设施上。全文在 people.kernel.org/monsieuricon/creepy-crawlies。
← 上一篇
Hugging Face 那次入侵,比 OpenAI 承认的严重得多
下一篇 →
Superagent 给 Claude Code 配了台真电脑
← 返回所有文章

评论

加载中...
>_