Ollaya:给 10 毫秒出答案的模型做一个 Ollama
Ollama 让人一条命令就能在笔记本上跑聊天模型。今天在 Hacker News 拿到 214 分的 Ollaya,想为另一种动物做同样的事:决策模型。ollaya run laya,本地就起了一个服务,对类型化的问题直接给出校准过的概率,一次前向传播,完全不生成 token。
模型阵容刻意做小。Laya 有 322M 和 421M 两个尺寸,外加一个支持 100 多种语言的版本。Decider 基于 Qwen,0.75B 和 1.9B。还有一个 NLI 零样本分类器,以及处理多选题的 GLiClass。API 和 TypeSafe(就是做 Jev 的那家)的托管接口直接兼容,原来调 Jev 的代码把地址改成 localhost 就行。Apache 2.0 协议,支持 macOS、Windows、Linux 和 Docker,有 NVIDIA 加速。最抓眼的数字:Laya 在 RTX 4090 上 8 到 10 毫秒,托管方案要 236 到 276 毫秒。仓库在 github.com/ollaya-dev/ollaya,两天前刚建。
它比又一个本地运行器重要的地方在于:「收窄输出空间」这条思路,终于有了自己的基础设施层。过去两周,类型化决策模型被陆续拉进路由、工具闸门和记忆系统。缺的一直是最无聊的那部分:能在代理旁边跑、私密、免费、快到可以塞进每一步循环里。一个 10 毫秒、带真实概率的是或否,便宜到可以在每次工具调用前问一句。250 毫秒的托管调用做不到。
同一天还来了迄今最好的证据,说明这种调用能干什么。一篇叫 Just Ask Jev 的论文(arXiv 2609.29429)拿校准决策模型去测十类对齐失败,包括谄媚、提示注入、欺骗、奖励作弊和权力寻求,覆盖 44 个基准。只用一个通用问题,零样本 AUROC 中位数就到 0.886,在多数基准上打赢有监督的基线,和人类标注的一致度追平参考评分器,成本比大模型当裁判低 63 倍。最值得划线的发现:问题怎么措辞几乎无所谓,给它看输入里的哪些字段才关键。
两件事放在一起,一种便宜的代理护栏已经看得见形状了:一个本地决策模型,对每一步都问几个类型化问题,几乎零成本。Laya 的校准在你自己的数据上还成不成立,是信任它之前要先测的事。官网 ollaya.dev。
← 返回所有文章
模型阵容刻意做小。Laya 有 322M 和 421M 两个尺寸,外加一个支持 100 多种语言的版本。Decider 基于 Qwen,0.75B 和 1.9B。还有一个 NLI 零样本分类器,以及处理多选题的 GLiClass。API 和 TypeSafe(就是做 Jev 的那家)的托管接口直接兼容,原来调 Jev 的代码把地址改成 localhost 就行。Apache 2.0 协议,支持 macOS、Windows、Linux 和 Docker,有 NVIDIA 加速。最抓眼的数字:Laya 在 RTX 4090 上 8 到 10 毫秒,托管方案要 236 到 276 毫秒。仓库在 github.com/ollaya-dev/ollaya,两天前刚建。
它比又一个本地运行器重要的地方在于:「收窄输出空间」这条思路,终于有了自己的基础设施层。过去两周,类型化决策模型被陆续拉进路由、工具闸门和记忆系统。缺的一直是最无聊的那部分:能在代理旁边跑、私密、免费、快到可以塞进每一步循环里。一个 10 毫秒、带真实概率的是或否,便宜到可以在每次工具调用前问一句。250 毫秒的托管调用做不到。
同一天还来了迄今最好的证据,说明这种调用能干什么。一篇叫 Just Ask Jev 的论文(arXiv 2609.29429)拿校准决策模型去测十类对齐失败,包括谄媚、提示注入、欺骗、奖励作弊和权力寻求,覆盖 44 个基准。只用一个通用问题,零样本 AUROC 中位数就到 0.886,在多数基准上打赢有监督的基线,和人类标注的一致度追平参考评分器,成本比大模型当裁判低 63 倍。最值得划线的发现:问题怎么措辞几乎无所谓,给它看输入里的哪些字段才关键。
两件事放在一起,一种便宜的代理护栏已经看得见形状了:一个本地决策模型,对每一步都问几个类型化问题,几乎零成本。Laya 的校准在你自己的数据上还成不成立,是信任它之前要先测的事。官网 ollaya.dev。
评论