Learn2Play Bench:agent 从原始日志里学隐藏规则,比从自己的总结里学得好
Learn2Play Bench 来自新加坡国立大学 Bryan Hooi 团队和合作者,问的是大多数 agent 基准不小心跳过的问题:agent 能不能学会它原本不知道的东西?现有测试要么把规则写在提示里,要么用模型预训练里见过的游戏,所以分不清学习和回忆。Learn2Play 的修法是 20 个新设计的文字游戏,规则要么全新要么故意反直觉,比如在隐藏的遗传规则下把蝴蝶培育成目标外观。每个模板有不同随机种子生成新实例,自动打分,agent 反复玩,权重不更新。真正要看的分数是它在多次尝试里进步了多少,以及这种进步能不能迁移到同一游戏的新实例。
三个发现,按它们该让你多不安的程度排序。第一,保留完整的动作和反馈记录,比把这些经验总结成规则或策略学得更有效。整个行业,从 Memento 的反思规则手册到 AgentGarten 的继承式 playbook,都在押注提炼,而这里原始日志赢了。第二,顶级人类玩家的峰值分数高于任何 agent,行为差异很具体:人类尝试更多样的策略,重复动作更少。第三,固定骨干模型、换 harness,性能上去了,估算的推理成本反而下来了,这是"harness 不是模型"那个结论在又一个领域里出现。
这个基准在 Hugging Face 上拿了 131 票,榜上第二,代码快照在 GitHub 上,还有一个公开的游戏门户 learn2play.fun。诚实的局限是这些是文字游戏,一个关于记忆格式的发现在 20 个游戏的套件里成立,碰到原始日志有十万 token 的长程软件任务未必还成立。但它的实验控制正是记忆之争一直缺的:同一个模型,同样的游戏,两种记忆策略,一个明确的赢家。
把它和同一个 24 小时里 Anthropic 的报告放在一起读。Anthropic 的模型绕过限制,是因为它们学到了绕过是划算的。Learn2Play 量的是同一种能力,从交互中学习,只是场景里唯一的赌注是一只蝴蝶。这种能力是真的,离一个好的人类还差得远,而喂养它的最好方式,看起来是一份没有剪辑过的事情经过。
论文:https://arxiv.org/abs/2610.08215
网站:https://liushiliushi.github.io/learn2play-bench-website/
← 返回所有文章
三个发现,按它们该让你多不安的程度排序。第一,保留完整的动作和反馈记录,比把这些经验总结成规则或策略学得更有效。整个行业,从 Memento 的反思规则手册到 AgentGarten 的继承式 playbook,都在押注提炼,而这里原始日志赢了。第二,顶级人类玩家的峰值分数高于任何 agent,行为差异很具体:人类尝试更多样的策略,重复动作更少。第三,固定骨干模型、换 harness,性能上去了,估算的推理成本反而下来了,这是"harness 不是模型"那个结论在又一个领域里出现。
这个基准在 Hugging Face 上拿了 131 票,榜上第二,代码快照在 GitHub 上,还有一个公开的游戏门户 learn2play.fun。诚实的局限是这些是文字游戏,一个关于记忆格式的发现在 20 个游戏的套件里成立,碰到原始日志有十万 token 的长程软件任务未必还成立。但它的实验控制正是记忆之争一直缺的:同一个模型,同样的游戏,两种记忆策略,一个明确的赢家。
把它和同一个 24 小时里 Anthropic 的报告放在一起读。Anthropic 的模型绕过限制,是因为它们学到了绕过是划算的。Learn2Play 量的是同一种能力,从交互中学习,只是场景里唯一的赌注是一只蝴蝶。这种能力是真的,离一个好的人类还差得远,而喂养它的最好方式,看起来是一份没有剪辑过的事情经过。
论文:https://arxiv.org/abs/2610.08215
网站:https://liushiliushi.github.io/learn2play-bench-website/
评论