2026年9月24日AgentsBenchmarkResearch

前沿模型的「品味」只有 59.7%,而且多想一会儿也没用

有个词所有人都拿来说 agent,却没人度量:品味。就是在一个长任务的岔路口,判断这条路比那条好的那种感觉。微软的 Wenbo Pan 和八位合作者终于给它上了个数字,这个数字是 59.7%。

Taste-Bench 从 agent 的轨迹里自动挖出决策岔口,不需要人工标注。两种挖法:比对同一任务的并行尝试中出现分叉的地方,以及在单条轨迹里找出 agent 走了一段又折回来的绕路。每个岔口变成一道题,有多个方向,只有一个通向更好的结果。因为结果是事后已知的,标准答案白送。

前沿模型拿 59.7%。在"下一步往哪走"的多选题上。这是标题数字,而且比听起来更难看,因为这些岔口是真实 agent 在真实任务里真的走到的,不是对抗性构造出来的。

底下两个发现比分数本身更重要。第一,那些支撑证据要到轨迹后面才出现的决策,对所有被测模型都明显更难——agent 必须在能证明这个选择合理的信息出现之前就做出选择,而这恰恰是长周期工作的定义性条件,也显然是模型最不擅长的条件。第二个值得坐下来想想:增加推理预算并不提升表现。你没法靠想把品味想出来。在岔口上多烧 token,买不到任何东西。

建设性的那一半是品味可以靠蒸馏来训。一个能看到结果的教师模型去评判这些岔口;用这些判断训出来的学生模型在没见过的任务上变好,而且关键是,在留出的 SWE-bench Pro 上端到端成功率也提升了。信号跑出了基准之外,而这正是大多数基准论文悄悄没通过的那道测试。

值得带走的框架是:长 agent 运行里很多被归咎于模型能力的问题,实际上是三四个特定时刻上的决策质量失败,而扩大推理时计算恰恰是治不了它的那种干预。33 页,9 月 22 日提交,代码和数据集均已放出。

https://arxiv.org/abs/2609.25804
← 上一篇
两周合了 3000 个改动,真正的教训是关于度量的
下一篇 →
三分钟索引完 Linux 内核,让你的 agent 别再 grep 了
← 返回所有文章

评论

加载中...
>_