ExplorationBench:造几个外星世界,让代理没法靠记忆作弊
所有科研代理基准都有同一个窟窿:代理答对了,到底是发现的,还是背出来的?ExplorationBench(arXiv 2609.30199)的补法,是让知识根本没法背。它构造了一批「外星世界」,规则可以执行,所以每个答案都能精确核对;规则又故意和常识相冲突,所以靠回忆反而会答错。
两个沙箱。AlienCode 有 31 个待发现目标、70 道题;AlienLogic 有 24 个目标、70 道题。每个沙箱给代理一本有错的说明书、针对任务的环境反馈和一套专门的工具调用格式。代理先探索、提假设、做实验,再用自己摸出来的东西去解留出的题。一共测了十个 AI 系统。
最强的几个系统确实能学会陌生规则并用起来,这是好消息。警告在结果的后半段:不同轨迹之间表现波动很大,而且继续探索可能停滞,甚至把已经取得的进展倒退回去。多走几步并不稳定地等于多学到东西。有时候代理是把一个正确的理解给「探索」没了。
第二个发现才是值得随身带着的那条。多数自主研究循环都默认,跑得久一点最坏也就是浪费算力。这篇说跑得久可能主动破坏已经学到的东西,和本周那几篇自我纠错、记忆论文放在一起看,让人不太舒服。大家会伸手去拿的解法是:给信念打检查点,覆盖之前先拿它测一测。那本「有错的说明书」的设计也值得照抄:真实世界的文档本来就会错,一个盲信文档的代理就该拿低分。
← 返回所有文章
两个沙箱。AlienCode 有 31 个待发现目标、70 道题;AlienLogic 有 24 个目标、70 道题。每个沙箱给代理一本有错的说明书、针对任务的环境反馈和一套专门的工具调用格式。代理先探索、提假设、做实验,再用自己摸出来的东西去解留出的题。一共测了十个 AI 系统。
最强的几个系统确实能学会陌生规则并用起来,这是好消息。警告在结果的后半段:不同轨迹之间表现波动很大,而且继续探索可能停滞,甚至把已经取得的进展倒退回去。多走几步并不稳定地等于多学到东西。有时候代理是把一个正确的理解给「探索」没了。
第二个发现才是值得随身带着的那条。多数自主研究循环都默认,跑得久一点最坏也就是浪费算力。这篇说跑得久可能主动破坏已经学到的东西,和本周那几篇自我纠错、记忆论文放在一起看,让人不太舒服。大家会伸手去拿的解法是:给信念打检查点,覆盖之前先拿它测一测。那本「有错的说明书」的设计也值得照抄:真实世界的文档本来就会错,一个盲信文档的代理就该拿低分。
评论