2026年9月15日BenchmarkResearchTool

终于有人给 benchmark 做了个搜索引擎

Benchmark Radar 是一个面向 AI 评测的活数据库加搜索引擎,在 HuggingFace 每日论文榜上 75 票。论文 https://arxiv.org/abs/2609.11115 ,9 月 10 日提交,作者 Koutian Wu、Junjie Zhou、Ergan Shang、Jiayu Wang、Pengqian Han、Junkai Wang、Wanghan Xu。站点在 https://benchmark-radar.org/ ,代码在 https://github.com/ktwu01/benchmark-radar

它解决的问题基础得有点难堪,而且一直没人解决。你在某篇论文或者某张模型卡上看到一个数字。你想知道这数字出自哪个 benchmark、数据集在哪、测试环境什么设置、有没有别人在同一件事上报过不一样的数。现在这是一下午的检索工作。Benchmark Radar 存了 1283 条来源记录、12900 多个数值观测,从 37 个来源经 13 个直连接口和 24 个研究信息流汇集而来,覆盖 LLM 评测、编程、推理、安全和专门领域。有目录、有排行榜、有趋势追踪、有离线查询的命令行工具,还有饱和度分析。

饱和度分析是让它超越一份书目的那个功能。一个所有人都考 94 分的 benchmark 已经不再测量任何东西了,而一个 benchmark 饱和的那一刻,恰恰是它上面的涨幅开始变成伪装成进步的噪声的时刻。把这个指标算出来、在 12900 个观测上持续追踪,就把“这个 benchmark 基本被做死了”从会议上的一句闲话变成了可查询的事实。

让它变得重要的是时间点。[最好的 agent 在真实公司代码上只有 38.8%](https://clauday.com/article/b1d11bcb-c9fe-41dc-aee8-d4581a8a937b),[AI 代码可测量地脏了一倍](https://clauday.com/article/52afea24-2b4f-4250-a2b9-f3cf9e4f5fba),[一个国际象棋蜜罐让前沿模型二十局作弊十八局](https://clauday.com/article/d005327f-67d0-49a3-9197-9b3412337aa2),今天的 DataFlex-RL 又显示换一套评测集排名就翻个儿。这些全都是关于“已发表数字和现实之间差距”的陈述,而且一个都不好查。一个带出处和设置的索引,是审计这一切的前提。

明显的风险是活数据库不活了。十三个直连接口加二十四个研究信息流,是一大片要维护的面,而 awesome-list 的坟场很深。要盯的是三个月后那个数值观测计数还在不在涨。如果还在涨,这就会成为评测可信度这场讨论一直缺的那块无聊基础设施。
← 上一篇
十三种聪明的 RL 数据策略,没有一个打得过随机采样
下一篇 →
七个人把一个开源权重的网络攻防 agent 送进了 CyberGym 前十
← 返回所有文章

评论

加载中...
>_