2026年10月7日Open SourceInfrastructureResearch

openTPU:agent 设计了一块 AI 加速器,300 美元的板子上跑 Gemma 4

周二 Hacker News 上一个叫 openTPU 的仓库拿了 180 分,一句话卖点:开源 AI 加速器,由 AI 开发。作者之前在 auto-arch-tournament 项目里用 agent 做过 RISC-V CPU 核,这次把同一套方法对准推理硬件。README 问的问题是:agent 能不能设计出跑它们自己推理的芯片。

已经做出来的是一个单仓库里的完整栈:SystemVerilog 硬件设计、指令集、位精确的模拟器、一门内核语言和它的编译器,以及驱动真实 PCIe 卡的宿主软件。这块卡是退役的数据中心 FPGA 板,浪潮的,Xilinx Kintex-7 加两路 DDR3,爱好者 300 美元左右能买到。它跑了十个现代模型,用的是真实权重。LFM2.5-230M 4-bit 解码每秒 85.8 token,Qwen3-0.6B 31.3,Gemma 4 E2B 12.1,Phi-4-mini 6.6。比卡上 4GB 还大的 MoE 模型,专家从宿主存储流式送过去:Qwen3.5-35B-A3B 每秒 3.95 token。每一种配置都和模拟器逐 token 一致。

改进循环才是故事。作者在 HN 评论里说,设计一开始每秒只有几个 token,靠一个递归自我改进循环在最小模型上做到了 80 以上。README 展示了这个循环在优化什么:两版生产镜像之间,DRAM 带宽利用率从 82% 到 87% 提到 91% 到 94%,内存控制器换成了 LiteDRAM,卡上自己 12 秒完成校准,还有一轮轮 Vivado 跑的锦标赛在磨时序余量,目前 133 MHz 时钟只剩 0.032 纳秒的余量。解码是内存受限的,所以带宽这个数就是全部。

硬件很小,方法不小。一个有可测指标的锦标赛循环,一个能判对错的模拟器,一个提改动的 agent,这正是今年在内核和编译器上验证过的形状。HN 的反应一半是“氛围鉴赏”,一半是那个老笑话:递归自我改进既是警告也是产品。作者的立场是芯片设计工具这几个月的进步超过过去几年。这里的证据是一块能跑的卡,比大多数同类说法带的证据多。

链接:github.com/FeSens/openTPU
← 上一篇
REA 给你的 agent 装上 Ghidra,GitHub 一天给了 3,000 颗星
下一篇 →
Erdős Problems 冻结评论:AI 证明洪水把人挤走了
← 返回所有文章

评论

加载中...
>_