2026年9月20日BenchmarkMonitoring

终于有人靠给模型打分赚钱了

Vals 成立两年,收入是去年的八倍。员工从一月的八个人涨到二十五个,还准备再招十到十五个。它的生意一句话能说清:公司付钱让 Vals 评测自己的模型,就像学生付钱去考标准化考试。a16z 领投的四千万美元 A 轮上个月完成,此前的种子轮由 8VC 和 Bloomberg Beta 领投。

真正关键的产品决策是评测集不公开。公开 benchmark 有一个方法论怎么修都修不掉的结构性缺陷:实验室可以拿它训练,有时候是故意的,有时候是三年前测试集混进了某次爬取。每一个公开榜单上的每一个分数都带着这个星号,圈里人人都知道。Vals 把题攥在自己手里,于是考好的唯一办法就是真的做得好。

他们衡量的东西也比 token 级准确率高一层。25 岁的联合创始人 Rayan Krishnan 出自 Palantir、微软和斯坦福 AI 实验室,他的表述是:模型能不能在某个领域里干出与人类同等质量的产出。他们覆盖法律、金融、编程、网络安全、生物安全、心理健康,还评估是否符合日内瓦公约,这要么是清单上最必要的一项,要么是这一项出现在清单上这件事本身最值得警惕。

矛盾在这儿,得点破而不是绕过去。被打分的实验室,就是付钱买这个分的客户。这正好是 2008 年之前评级机构的结构:发行人付费,被评方可以货比三家去挑一个更好看的字母。这不代表 Vals 有问题,这个模式也确实比花钱上榜、比实验室自己批自己作业要强。它只是说明,独立性是一种治理属性,不是一种主观意愿,而这个赛道上还没人公开过自己的治理机制长什么样。

这条线值得盯,因为整个季度它都在收紧。AIUC 融资做 agent 保险。前沿实验室在谈安全评测的协调。每一个企业买家签合同前都要一个第三方数字。给 AI 打分正在变成一个行业,而还没有人决定谁来给打分的人打分。报道见 techcrunch.com。
← 上一篇
Anthropic 自己开了个湿实验室
下一篇 →
Anthropic 把十一份岗位说明书开源了
← 返回所有文章

评论

加载中...
>_