JEV-as-a-Judge 回应了对校准决策模型最尖锐的批评,但只回应了一半
针对 Jev 的反弹周日来了。ihatethefuture.com 上一篇《莫名其妙的失败正在被正常化》在 Hacker News 拿了 224 分,对 Jev 这类校准决策模型开炮很直接:想知道它好不好用,你得先有评估集和标注真值的流水线;可你要是已经有了这些,离自己微调一个也就差不远了。作者说,买它的人根本不跑评估,置信度分数被当成仪式在用,0.9 的阈值是吃午饭前随手拍的。连 Jev 自己的文档都承认,合适的阈值取决于你的场景。
这篇写得好。而对它最好的回应,恰好是一篇把博客说“没人做”的功课做完了的论文。Yubo Li、Yidi Miao、Ramayya Krishnan 和 Rema Padman 写了 JEV-as-a-Judge,拿一个只输出决策的 JEV 评审,和 16 个生成式、奖励模型式评审比,再用盲审人工裁决。在普通偏好判断和有证据支撑的事实核查上,它和最强 LLM 评审只差不到 3 个点,费用只有对方的 0.36%。它栽跟头的地方也很具体:需要核对推导过程的,以及要顶住一个写得很长很漂亮的错误答案的。
回应批评的关键在这里。在好几个基准上,JEV 和强评审之间的差距,几乎全集中在它自己低置信度的那些判断里。所以在这个场景,置信度不是仪式,是分流信号。一个冻结的级联方案:有把握的直接采纳,没把握的升级给强评审,保住了强评审 99% 的准确率,成本更低。
这就是那“一半”。论文证明,置信度只有在有人先拿人工标注校过之后才有用,而这正是博客说买家会跳过的那套评估流程。两边都对。对正在赶“限制输出空间”这波的团队,结论很简单:校准模型不会替你省掉评估的活,它只告诉你评估的力气该花在哪儿。升级阈值要从你自己的标注数据里挑,别从文档里抄。
链接:arxiv.org/abs/2609.26550、ihatethefuture.com/2026/09/the-normalization-of-inexplicable.html
← 返回所有文章
这篇写得好。而对它最好的回应,恰好是一篇把博客说“没人做”的功课做完了的论文。Yubo Li、Yidi Miao、Ramayya Krishnan 和 Rema Padman 写了 JEV-as-a-Judge,拿一个只输出决策的 JEV 评审,和 16 个生成式、奖励模型式评审比,再用盲审人工裁决。在普通偏好判断和有证据支撑的事实核查上,它和最强 LLM 评审只差不到 3 个点,费用只有对方的 0.36%。它栽跟头的地方也很具体:需要核对推导过程的,以及要顶住一个写得很长很漂亮的错误答案的。
回应批评的关键在这里。在好几个基准上,JEV 和强评审之间的差距,几乎全集中在它自己低置信度的那些判断里。所以在这个场景,置信度不是仪式,是分流信号。一个冻结的级联方案:有把握的直接采纳,没把握的升级给强评审,保住了强评审 99% 的准确率,成本更低。
这就是那“一半”。论文证明,置信度只有在有人先拿人工标注校过之后才有用,而这正是博客说买家会跳过的那套评估流程。两边都对。对正在赶“限制输出空间”这波的团队,结论很简单:校准模型不会替你省掉评估的活,它只告诉你评估的力气该花在哪儿。升级阈值要从你自己的标注数据里挑,别从文档里抄。
链接:arxiv.org/abs/2609.26550、ihatethefuture.com/2026/09/the-normalization-of-inexplicable.html
评论