2026年10月6日ResearchBenchmarkInfrastructure

决策模型号称省 23.9%,作者自查一遍后:4.3%

决策模型是今年秋天 harness 圈最热的一招。agent harness 每跑一个任务都要问一堆带类型的小问题:该调哪个模型、用哪个工具、检索回来的文本相不相关、这段输入有没有注入。让一个小的 System-1 模型一次前向就给出各选项的概率,成本只有一次 LLM 调用的零头。arXiv 上一篇新论文做了第一次认真的正面对比,然后干了件更少见的事:审计自己的流程,把自己算错的地方公开出来。

对比的是开源权重的 Laya 和托管的 Jev,覆盖 11 个 agent 决策点,题目来自 18 个公开数据源:7283 个基础用例加 6640 个鲁棒性变体,输入逐字节一致,还做了跨硬件、跨日期的复现检查。Jev 在 11 项里有 9 项显著更准,领先 10.8 到 46.0 个百分点。Laya 在选项顺序颠倒后会改掉 30% 的答案,候选里有 50 个相似工具时准确率掉到 31%,Jev 还能保持 98%。

有两个结果是给两边一起泼冷水的。零样本模型路由,这是宣传得最多的用例之一,两个模型都没赢过随机。RAG 相关性判断上两者打平。

接下来是自查。三个分析错误加一个设计混淆,把落地效果吹大了。前置筛选的成本漏算了,于是报出来的 23.9% 节省其实只有 4.3%。把闸门的准确率当成了端到端质量来报,98% 对应的真实数字是 58%。阈值是在样本内调的,5% 的漏判目标放到留出数据上最高到了 17%。还有一个注入误报上的「渠道效应」,换成渠道原生的内容之后就消失了。

最后这部分才是读这篇论文的理由。这四个错在生产环境里个个都容易犯:只算便宜的那次调用、不算它前面那层预筛,把闸门的准确率说成系统的准确率,在要汇报的数据上调阈值。一个做了配对检验的研究团队四个坑全踩了,厂商的客户案例大概率也踩了。落到实操就一条:要端到端的数字,要留出流量上的数字,每一级的成本都要算进去。

链接:arxiv.org/abs/2610.02267
← 上一篇
Claude agent 从一篇 1999 年的论文里,认出了一个磁性材料候选
下一篇 →
一个榜单上的第一名注入检测器,换个基准只能抓到 2%
← 返回所有文章

评论

加载中...
>_