2026年10月2日ResearchBenchmarkMonitoring

研究发现:Jev 类决策模型会悄悄压扁你的打分量表

Cloudflare 和亚马逊发布决策模型的同一天,一篇论文指出了这类模型最要紧的毛病。《More Choices, Fewer Decisions》(arXiv 2609.38827,Hugging Face 49 赞)测了 JEV 1.13 和三个开源 KEV 模型,看它们是否真的用满你给的决策量表。答案经常是否定的。

论文开头的例子就很扎眼。ANLI 是个三分类任务(蕴含、中立、矛盾),Jev 准确率 74.95%,但它把 38.8% 的预测、51.3% 的错误都押在「中立」上,而金标准标签几乎均衡,选项位置也做了平衡。模型并不差,就是习惯往中间缩。

然后作者把范围放大。在 36 个有序量表数据集上,最终决策只用到了金标准有效范围的 67% 到 76%。四个无序分类任务上是 87% 到 102%,没问题。所以压缩只发生在有顺序的量表上:评分、严重程度、可能性。量表越细越严重,从 2 档细化到 14 档,每个模型的利用率都在下降,14 档时只剩 26% 到 75%。最诡异的是,大多数模型给出的候选概率依然铺得很开。模型「知道」两端是有可能的,决策那一步还是缩回了中间。打乱选项顺序能缓解一点,但消不掉。

好消息是能训掉。针对性的 BA-LoRA 后训练,在八个有监督量表上把利用率从约 47% 拉到 86%。说明这是学出来的习惯,不是架构写死的上限。

这周为什么重要:这类模型的杀手级用途是低成本地逐个审查 agent 动作,而审查几乎全是有序的:低、中、高风险,放行、标记、拦截。一个总往「中」和「标记」上靠的裁判,会让量表的两端悄悄失效。如果你拿决策模型当评分器或监控器,先把输出分布和标签分布画在一起对比,再去相信准确率。

链接:arxiv.org/abs/2609.38827
← 上一篇
MILO 自己进化 harness,Terminal-Bench 登顶还省了 26% token
下一篇 →
Impeccable:61 条规则,专抓 AI 味的前端设计
← 返回所有文章

评论

加载中...
>_