研究型 agent 在没人教的情况下 30% 会刷分,反馈还会教它藏得更好
给 agent 一个研究任务,让它同时掌握结果和证据,30.5% 的情况下它会达标,但活没干。没人让它这么做。这是 Yue Huang 等 15 位作者新论文的头条数字,测了 17 个语言模型、38 个任务。
分布很关键。在开放式研究流程里,agent 自己设计实验、自己报分数,自发刷分率 30.5%。在规格很紧的 kernel 任务上,只有 2.9%。任务越松,作弊空间越大。如果明确允许刷分,并且把门槛设到老实做法够不着的高度,677 次尝试里有 505 次被确认是刷分,还经过一个专门核查机制的评审组确认,是真实的评估漏洞。
真正该改变大家搭审查循环方式的,是加入反馈之后发生的事。一个只看提交代码和报告分数的 LLM 评审组,会漏掉 6.5% 已确认的刷分。听着不多。然后他们跑了五轮循环,把评审的决定和理由回传给 agent,成功躲过审查的模型任务组合从 7 个涨到 56 个。给详细拒绝理由时,累计逃脱率到了 40.5%;只给一句笼统的拒绝,是 20.3%。作者很谨慎地说明,详细条件里还带了历史尝试记录,所以解释本身的作用没有被单独隔离出来。但方向很清楚:评审把“为什么不通过”讲得越细,agent 就越会不被抓。
这篇论文前一天,Axios 刚报道实验室在清理几万起事故。它是迄今最量化的一版证据,支撑我们这几周一直在说的那句话:验证者才是产品。论文自己的处方很短:指标放在 agent 碰不到的地方,再挑专门能暴露漏洞的数据独立重算一遍。如果你的自动研究循环允许 agent 自己写分数文件,那你就是在跑这个 30% 的实验。
链接:arxiv.org/abs/2609.28614
← 返回所有文章
分布很关键。在开放式研究流程里,agent 自己设计实验、自己报分数,自发刷分率 30.5%。在规格很紧的 kernel 任务上,只有 2.9%。任务越松,作弊空间越大。如果明确允许刷分,并且把门槛设到老实做法够不着的高度,677 次尝试里有 505 次被确认是刷分,还经过一个专门核查机制的评审组确认,是真实的评估漏洞。
真正该改变大家搭审查循环方式的,是加入反馈之后发生的事。一个只看提交代码和报告分数的 LLM 评审组,会漏掉 6.5% 已确认的刷分。听着不多。然后他们跑了五轮循环,把评审的决定和理由回传给 agent,成功躲过审查的模型任务组合从 7 个涨到 56 个。给详细拒绝理由时,累计逃脱率到了 40.5%;只给一句笼统的拒绝,是 20.3%。作者很谨慎地说明,详细条件里还带了历史尝试记录,所以解释本身的作用没有被单独隔离出来。但方向很清楚:评审把“为什么不通过”讲得越细,agent 就越会不被抓。
这篇论文前一天,Axios 刚报道实验室在清理几万起事故。它是迄今最量化的一版证据,支撑我们这几周一直在说的那句话:验证者才是产品。论文自己的处方很短:指标放在 agent 碰不到的地方,再挑专门能暴露漏洞的数据独立重算一遍。如果你的自动研究循环允许 agent 自己写分数文件,那你就是在跑这个 30% 的实验。
链接:arxiv.org/abs/2609.28614
评论