Desert Ant Labs:18 个小模型,全跑在你手机上
Paul Veugen 花了五年,想把端上能力塞进自家的视频剪辑应用 Detail,最后得出的结论是:最难的地方在于没人做他要的那种模型。于是周一他带着 18 个模型开了 Desert Ant Labs,12 个稳定版、6 个 beta,全部为掌上设备而生。
它们朴素得毫不性感,而这正是重点。Voz 做转写,在 iPhone 上两秒吃完十分钟音频,官方说比 Whisper 快 4.7 倍。Clear 用一个 9MB 的模型,一秒清理五分钟音频。Redact 在 27 种语言里遮掉个人信息。Tongue 用 2MB 的体积,凭三个词判断你说的是哪种语言。整套模型在当代硬件上的实时倍率是 298 到 345 倍。iPhone、MacBook、安卓,以及通过 WebAssembly 跑在浏览器里,SDK 覆盖 Swift、Kotlin、JavaScript。月活十万台设备以内免费。
它的主张写得很直白:通往高效智能的最佳路径,起点在设备上。不是因为隐私好听(虽然确实好听),而是因为「不花钱、毫秒返回」的推理会改变你愿意去做的产品形态。如果判断语种要一次 API 调用加 300 毫秒,你只会做一次;如果只要 2MB 内存、一分钱不花,你每敲一个键都能做一次。
这跟 agent 循环撞上账单时到处冒出来的压力是同一种。oMLX 让本地编码 agent 在 Mac 上真正能用(https://clauday.com/zh/article/73bb73f5-e4a7-499d-ab19-7312b166b6e6),还有人把 2.8T 的模型从四块 SSD 上流式跑到每秒一个 token,就为了证明天花板是预算不是物理(https://clauday.com/zh/article/19bef913-82e8-4311-8035-f19f8628a5e9)。Desert Ant 走的是另一头:别再压缩前沿大模型了,直接给你一抽屉永不离开手机的小模型。https://desertant.com/blog/introducing-desert-ant-labs/
← 返回所有文章
它们朴素得毫不性感,而这正是重点。Voz 做转写,在 iPhone 上两秒吃完十分钟音频,官方说比 Whisper 快 4.7 倍。Clear 用一个 9MB 的模型,一秒清理五分钟音频。Redact 在 27 种语言里遮掉个人信息。Tongue 用 2MB 的体积,凭三个词判断你说的是哪种语言。整套模型在当代硬件上的实时倍率是 298 到 345 倍。iPhone、MacBook、安卓,以及通过 WebAssembly 跑在浏览器里,SDK 覆盖 Swift、Kotlin、JavaScript。月活十万台设备以内免费。
它的主张写得很直白:通往高效智能的最佳路径,起点在设备上。不是因为隐私好听(虽然确实好听),而是因为「不花钱、毫秒返回」的推理会改变你愿意去做的产品形态。如果判断语种要一次 API 调用加 300 毫秒,你只会做一次;如果只要 2MB 内存、一分钱不花,你每敲一个键都能做一次。
这跟 agent 循环撞上账单时到处冒出来的压力是同一种。oMLX 让本地编码 agent 在 Mac 上真正能用(https://clauday.com/zh/article/73bb73f5-e4a7-499d-ab19-7312b166b6e6),还有人把 2.8T 的模型从四块 SSD 上流式跑到每秒一个 token,就为了证明天花板是预算不是物理(https://clauday.com/zh/article/19bef913-82e8-4311-8035-f19f8628a5e9)。Desert Ant 走的是另一头:别再压缩前沿大模型了,直接给你一抽屉永不离开手机的小模型。https://desertant.com/blog/introducing-desert-ant-labs/
评论