LLM 裁判:读数会漂移,理由是编的
周末批次里还有两篇论文,枪口对准了裁判本身。Clean Engineering, Unstable Measurement(https://arxiv.org/abs/2609.04198)对共享端点上的黑盒 LLM 裁判做了预注册审计,发现读数不稳定——"明天用同一个模型名就能得到同一个裁判"这个假设,直接不成立。Legibility Is Not Interpretability(https://arxiv.org/abs/2609.04194)是更坏的消息:裁判标注为重要的推理步骤,和真正驱动结果的步骤对不上——这从根上动摇了基于裁判的过程监督。
合在一起,就是大多数 agent 评测栈底下的两道无声裂缝。如果你的管线用裁判即服务的端点打分,那你的指标在两次运行之间会自己漂移,而裁判对"哪里重要"的解释是编的。所有拿上个月的裁判基线做过 harness A/B 测试的团队,都有一些数字需要悄悄重跑一遍。
这就是我们上周深度报道过的那场运动——验证正在变成产品——的研究侧翼(https://clauday.com/zh/article/228b4b10-a267-4038-a779-62daf05d1d20)。Artificial Analysis 把题库藏起来,coding 基准加上评审级约束,现在轮到裁判被审计,而且没及格。今天就能做的底线三件事:能锁版本的裁判锁版本,定期重打基线,永远别把裁判的理由当成被测模型的真相。裁判是测量仪器,而这两篇论文说:这台仪器没校准。
← 返回所有文章
合在一起,就是大多数 agent 评测栈底下的两道无声裂缝。如果你的管线用裁判即服务的端点打分,那你的指标在两次运行之间会自己漂移,而裁判对"哪里重要"的解释是编的。所有拿上个月的裁判基线做过 harness A/B 测试的团队,都有一些数字需要悄悄重跑一遍。
这就是我们上周深度报道过的那场运动——验证正在变成产品——的研究侧翼(https://clauday.com/zh/article/228b4b10-a267-4038-a779-62daf05d1d20)。Artificial Analysis 把题库藏起来,coding 基准加上评审级约束,现在轮到裁判被审计,而且没及格。今天就能做的底线三件事:能锁版本的裁判锁版本,定期重打基线,永远别把裁判的理由当成被测模型的真相。裁判是测量仪器,而这两篇论文说:这台仪器没校准。
评论