单卡 AMD 跑 DeepSeek V4 Flash:生态之潮打到了硬件层
今天 HN 上一个 344 分的仓库,把 3040 亿参数的 DeepSeek-V4-Flash-0731 在生产环境跑在了一张 AMD MI300X 上。数字摆出来:单流解码 168.6 token/s,prefill 约 8K token/s,8 路并发合计 542 token/s,验证了 256K 上下文,架构上限是 1M。
做到这一步靠的是真工程,不是改个配置。MI300X 用的是 AMD 自家的 FNUZ FP8 格式而不是 OCP 标准,得写专门的缓存写入器;作者为 gfx942 架构调了 AITER GEMM 内核表,修了一个 MoE 路由 bug(bitmatrix padding 悄悄污染工具调用),KV cache 拆成 20GB 显存加 96GB 内存混合放置,再接上 DSpark-7 草稿模型做投机解码。全部文档化,Apache 2.0。
数一数这一周:antirez 的 C 推理引擎 ds4,围绕前缀缓存经济学设计的 Go 编程 agent DeepSeek-Reasonix,AirLLM 用游戏卡流式跑前沿模型,Cloudflare 在边缘节点伺服 Kimi 和 GLM,现在又多了一份跑在非 Nvidia 硬件上的生产配方。V4 Flash 开源才五天,就长出了推理引擎、harness 和一套 Nvidia 收不到税的硬件栈。开放权重不只是被下载,它会自己长基础设施。
仓库在 github.com/ryanzhou/deepseek-v4-flash-mi300x。
← 返回所有文章
做到这一步靠的是真工程,不是改个配置。MI300X 用的是 AMD 自家的 FNUZ FP8 格式而不是 OCP 标准,得写专门的缓存写入器;作者为 gfx942 架构调了 AITER GEMM 内核表,修了一个 MoE 路由 bug(bitmatrix padding 悄悄污染工具调用),KV cache 拆成 20GB 显存加 96GB 内存混合放置,再接上 DSpark-7 草稿模型做投机解码。全部文档化,Apache 2.0。
数一数这一周:antirez 的 C 推理引擎 ds4,围绕前缀缓存经济学设计的 Go 编程 agent DeepSeek-Reasonix,AirLLM 用游戏卡流式跑前沿模型,Cloudflare 在边缘节点伺服 Kimi 和 GLM,现在又多了一份跑在非 Nvidia 硬件上的生产配方。V4 Flash 开源才五天,就长出了推理引擎、harness 和一套 Nvidia 收不到税的硬件栈。开放权重不只是被下载,它会自己长基础设施。
仓库在 github.com/ryanzhou/deepseek-v4-flash-mi300x。
评论