三分钟索引完 Linux 内核,让你的 agent 别再 grep 了
2800 万行代码,7.5 万个文件,三分钟索引完。那是 Linux 内核,也是让 codebase-memory-mcp 值得看一眼的那个数字。
这是个 MCP server,把一个仓库变成持久化的知识图谱——函数、类、路由、依赖,全都可查询——于是 agent 可以直接问结构性的问题,而不是一个文件一个文件地打开。17 个工具,覆盖搜索、追调用链、检测变更、分析架构,支持 162 种语言。解析用 tree-sitter AST,上面叠一层混合 LSP 的语义类型解析,拿到的是真的类型信息,而不是语法层面的猜测。
该被引用的是 token 那条:等量的分析,走图查询大约 3400 token,靠 grep 加读文件大约 41.2 万 token。降低 99.2%。不管这个比例在你的代码库上成不成立,方向明显是对的——靠读文件来探索是 agent 编码里最浪费的单一模式,每一个花在重新发现某个函数在哪的 token,都是没花在真问题上的 token。
两个实现细节透着认真。它是一个用 C 写的单一静态二进制,tree-sitter 语法全部内嵌,不需要语言运行时也不需要外部服务,装的时候不会拖一整棵依赖树进来。还有,基础设施文件是一等公民图节点:Dockerfile、Kubernetes manifest、Kustomize overlay。一个能从路由处理函数一路追到暴露它的 manifest 的 agent,做的是读文件那套基本做不到的事。
MIT 协议,44.5k star,今天在 GitHub 趋势榜上,日增 266。结构化查询亚毫秒返回。
要盯的是过期问题——知识图谱的质量上限就是它最后一次索引的时刻,而这个品类真正难的地方从来是:在一个大家还在持续提交的仓库上怎么保持最新。工具列表里有变更检测,说明他们知道。
https://github.com/DeusData/codebase-memory-mcp
← 返回所有文章
这是个 MCP server,把一个仓库变成持久化的知识图谱——函数、类、路由、依赖,全都可查询——于是 agent 可以直接问结构性的问题,而不是一个文件一个文件地打开。17 个工具,覆盖搜索、追调用链、检测变更、分析架构,支持 162 种语言。解析用 tree-sitter AST,上面叠一层混合 LSP 的语义类型解析,拿到的是真的类型信息,而不是语法层面的猜测。
该被引用的是 token 那条:等量的分析,走图查询大约 3400 token,靠 grep 加读文件大约 41.2 万 token。降低 99.2%。不管这个比例在你的代码库上成不成立,方向明显是对的——靠读文件来探索是 agent 编码里最浪费的单一模式,每一个花在重新发现某个函数在哪的 token,都是没花在真问题上的 token。
两个实现细节透着认真。它是一个用 C 写的单一静态二进制,tree-sitter 语法全部内嵌,不需要语言运行时也不需要外部服务,装的时候不会拖一整棵依赖树进来。还有,基础设施文件是一等公民图节点:Dockerfile、Kubernetes manifest、Kustomize overlay。一个能从路由处理函数一路追到暴露它的 manifest 的 agent,做的是读文件那套基本做不到的事。
MIT 协议,44.5k star,今天在 GitHub 趋势榜上,日增 266。结构化查询亚毫秒返回。
要盯的是过期问题——知识图谱的质量上限就是它最后一次索引的时刻,而这个品类真正难的地方从来是:在一个大家还在持续提交的仓库上怎么保持最新。工具列表里有变更检测,说明他们知道。
https://github.com/DeusData/codebase-memory-mcp
评论