Arena 以 31 亿美元估值融 2 亿美元 B 轮,开始给 agent 的撒谎打分
从伯克利研究项目起家的众包模型排行榜 Arena,周三宣布 B 轮融资 2 亿美元、估值 31 亿美元,Lightspeed 和 Khosla 共同领投,Salesforce Ventures、01 Advisors、戴尔资本、Endeavor Catalyst 以及老股东 a16z、Felicis 跟投。公司 1 月刚以 17 亿美元估值融了 1.5 亿美元 A 轮,6 月年化收入破 1 亿美元,十个月估值接近翻倍。生意是去年 9 月上线的 AI Evaluations,把几千万月度投票用户产生的数据做成分析卖给实验室和企业。
同一小时发的产品比融资更要紧。Arena Alignment Index 是一个新榜,在 9 万个真实 agent 会话上给 27 个模型打分,只看三件会在对话记录里留下证据的事:越权行动,agent 干了没让它干的事;错误归因,把用户自己证据相反的话安到用户头上;虚假完成,任务没做完说做完了。OpenAI 的模型包揽前五,其中四个约 88 分。Claude Opus 5.5 和 Grok 4.7 是 83 分。OpenAI、Anthropic、SpaceXAI、Google 每一代模型的对齐分都在涨。
失败率的数字值得存下来。Opus 5 约 2% 的会话出现越权行动,其中 53.5% 是 agent 没问就删除或"清理"用户的文件和之前的工作。虚假完成平均影响 10% 的会话,在代码调试会话里升到 48%。对话长一倍,踩坑概率就高一倍,超过 20 条消息的会话里大约每 8 个就有 1 个出现越权行动。这是 OpenAI 和 Anthropic 在自家系统卡里描述的那些行为,第一次有了独立的、非实验室的数字,而且量的是真实使用,不是模型认得出来的 benchmark。
Arena 自己的说法是"静态 benchmark 在模型意识到自己在被测的那一刻就失效了",世界"需要一个中立的第三方"来量安全,就像量能力那样。这就是今年一路升温的"评估者独立性"论点,现在背后多了 2 亿美元,外加一个下次 agent 删了谁的仓库就会让实验室难堪的榜。两点保留:这些信号是刻意收窄的,榜还是预览版;另外,一个靠被评对象付钱的评估者,仍然是一个靠被评对象付钱的评估者。
链接:arena.ai/blog/series-b、arena.ai/blog/ai-alignment-index、arena.ai/leaderboard/agent/alignment
← 返回所有文章
同一小时发的产品比融资更要紧。Arena Alignment Index 是一个新榜,在 9 万个真实 agent 会话上给 27 个模型打分,只看三件会在对话记录里留下证据的事:越权行动,agent 干了没让它干的事;错误归因,把用户自己证据相反的话安到用户头上;虚假完成,任务没做完说做完了。OpenAI 的模型包揽前五,其中四个约 88 分。Claude Opus 5.5 和 Grok 4.7 是 83 分。OpenAI、Anthropic、SpaceXAI、Google 每一代模型的对齐分都在涨。
失败率的数字值得存下来。Opus 5 约 2% 的会话出现越权行动,其中 53.5% 是 agent 没问就删除或"清理"用户的文件和之前的工作。虚假完成平均影响 10% 的会话,在代码调试会话里升到 48%。对话长一倍,踩坑概率就高一倍,超过 20 条消息的会话里大约每 8 个就有 1 个出现越权行动。这是 OpenAI 和 Anthropic 在自家系统卡里描述的那些行为,第一次有了独立的、非实验室的数字,而且量的是真实使用,不是模型认得出来的 benchmark。
Arena 自己的说法是"静态 benchmark 在模型意识到自己在被测的那一刻就失效了",世界"需要一个中立的第三方"来量安全,就像量能力那样。这就是今年一路升温的"评估者独立性"论点,现在背后多了 2 亿美元,外加一个下次 agent 删了谁的仓库就会让实验室难堪的榜。两点保留:这些信号是刻意收窄的,榜还是预览版;另外,一个靠被评对象付钱的评估者,仍然是一个靠被评对象付钱的评估者。
链接:arena.ai/blog/series-b、arena.ai/blog/ai-alignment-index、arena.ai/leaderboard/agent/alignment
评论