所有AI科学家demo都跳过的那一步:agent到底有没有从自己的实验里学到东西
自动研究agent跑一组消融。改一个组件,得一个数,再改一个,再得一个数。然后它写结论。中间那一步从来没人检查过——agent到底有没有从自己的结果里把因果结构提出来,还是只是把跑出来的东西复述了一遍。
WhatWorkedBench这个benchmark(Jingjie Ning、Xueqi Li、Yibo Kong、Dongting Li,9月23日)直接测那一步。agent读代码,决定把有限的测量预算花在哪些配置上,然后必须交一张响应面——一张预测每种组件配置会得到什么结果的表。这张预测要拿去和所有配置的穷举CPU执行结果对分,所以真值是完整的,不是采样的。36个任务,30个数据源,8种工作流类型,1248条配置记录,4206条数值控制记录,108个agent episode。
结果读起来像一张"agent不行但传统统计很行"的清单。在观测上拟合一个高斯过程,效应恢复率从0.632提到0.698。把代码等价性编码进去——也就是发现两个配置其实是同一个程序——在有二元选项的工作流上把恢复率从0.248拉到0.462,意思是agent在将近四分之三的情况下没认出两段一模一样的程序。成对效应的岭回归选择,在22个数据源里有15个能在八次测量内找到最优。
三条放一起的规律是:提升全来自经典实验设计,不来自更多推理。一个手上有八次测量预算、但没有花钱计划的agent,会把大部分预算浪费掉,然后自信满满地报出一个错的效应。这句话差不多也就解释了,为什么"AI科学家"的demo看起来很唬人,而很少有人能复现。
论文:https://arxiv.org/abs/2609.27490
← 返回所有文章
WhatWorkedBench这个benchmark(Jingjie Ning、Xueqi Li、Yibo Kong、Dongting Li,9月23日)直接测那一步。agent读代码,决定把有限的测量预算花在哪些配置上,然后必须交一张响应面——一张预测每种组件配置会得到什么结果的表。这张预测要拿去和所有配置的穷举CPU执行结果对分,所以真值是完整的,不是采样的。36个任务,30个数据源,8种工作流类型,1248条配置记录,4206条数值控制记录,108个agent episode。
结果读起来像一张"agent不行但传统统计很行"的清单。在观测上拟合一个高斯过程,效应恢复率从0.632提到0.698。把代码等价性编码进去——也就是发现两个配置其实是同一个程序——在有二元选项的工作流上把恢复率从0.248拉到0.462,意思是agent在将近四分之三的情况下没认出两段一模一样的程序。成对效应的岭回归选择,在22个数据源里有15个能在八次测量内找到最优。
三条放一起的规律是:提升全来自经典实验设计,不来自更多推理。一个手上有八次测量预算、但没有花钱计划的agent,会把大部分预算浪费掉,然后自信满满地报出一个错的效应。这句话差不多也就解释了,为什么"AI科学家"的demo看起来很唬人,而很少有人能复现。
论文:https://arxiv.org/abs/2609.27490
评论