2026年8月11日BenchmarkAgentsTool

oqoqo 让你成为自己的基准

oqoqo 昨天拿下 Product Hunt 第一,304 票,卖的是这个行业抱怨了两年的东西:属于你自己的私有基准,跑你自己的任务,而不是又一个没人能复现的公开榜单分数。

机制上,它拉起隔离沙箱,把你的任务集扔给你指定的 agent 去跑,然后把每一步都记下来——工具调用、重试、以及 agent 到处乱转找东西在哪的那些探索循环。接着同一批任务在不同 agent、不同模型、不同配置下重复跑,输出通过率、增益、token 消耗和摩擦点。最后这一列才是有用的。通过率告诉你成没成,摩擦点告诉你它老在哪儿绊倒,而后者才是你能动手改的。

他们的说法是,大多数基准活在精心整理的环境里,一碰真实产品就废。这个判断没错,而且代价越来越贵。过去一周我们看着榜单排名被当成新闻事件三次,看着一份研究发现人类审核者会批准三分之一的恶意 agent 操作,看着 VLM 裁判把失败的电脑操作轨迹系统性判成通过。评估这条链上的每一层,都被抓到过手松。

所以私有基准这条赛道在升温——Scale、Patronus、LangSmith,现在加上这个——所以"衡量 agent 用你的产品用得多好"是一个真品类,不是一个功能。如果 agent 要成为你的用户,总得有人给这段关系做 QA,而那个人不会是 SWE-Bench。

https://oqoqo.ai/
← 上一篇
Mistral 手里有一项 code-mode 工具调用的专利
下一篇 →
为什么 RL 能一次练很多技能,SFT 不行
← 返回所有文章

评论

加载中...
>_