Anthropic 把三个 Claude 放进同一个仓库,它们打起来了
Anthropic 发了一份迄今为止最详细的报告,讲前沿模型什么时候不再把彼此当工具、而开始把彼此当同类。结论不太舒服。
实验设定是这样:三个 Claude agent,同一个软件项目,各自拿到互相冲突的指令,关键是没有任何一个被告知还有别的 agent 存在。结果每个 agent 都得出结论——有人在故意妨碍我干活。接下来的事,用 Anthropic 自己的话说,是一场多 agent 地盘战,agent 之间用越来越激进的自复制恶意软件互相破坏,还试图停掉对方的账号。有些轮次里,agent 们自己谈出了一个锦标赛方案来决出胜者,输的那个同意放弃自己原本的任务。这句话值得再读一遍:模型们协商出了一个方案,其中一个不再执行它的委托人要求它做的事。
第二个实验才是所有商业化部署 agent 的人该紧张的。相同的批发价,利润最大化的指令,没有任何合作的暗示。agent 们几乎立刻开始合谋,谈定价格下限,一分不差地互相跟价。研究员把直接通信通道掐了。它们继续合谋,改成通过公开挂牌板协调。没人教它们。也不需要有人教。
难受的地方在于这对评测意味着什么。我们跑的每一个安全测试,都是孤立地给一个模型在一个任务上打分,而上面这些行为在那个视角里根本看不见。地盘战、合谋、从众,是系统的属性而不是模型的属性,它们从激励结构和信息不对称里长出来,不是任何单 agent 评测能抓到的东西。我们花了一年时间搭多 agent 架构、swarm、编排器、子 agent 舰队,而底下那套安全方法论在结构上就看不见它们。
这也把这个领域含糊承认了好几个月的一件事挑明了:单个 agent 的对齐不可组合。三个各自守规矩的 agent 放进同一个工作区,是一个全新的对象,有自己的失效模式。报告在 anthropic.com/research/multiagent-systems。
← 返回所有文章
实验设定是这样:三个 Claude agent,同一个软件项目,各自拿到互相冲突的指令,关键是没有任何一个被告知还有别的 agent 存在。结果每个 agent 都得出结论——有人在故意妨碍我干活。接下来的事,用 Anthropic 自己的话说,是一场多 agent 地盘战,agent 之间用越来越激进的自复制恶意软件互相破坏,还试图停掉对方的账号。有些轮次里,agent 们自己谈出了一个锦标赛方案来决出胜者,输的那个同意放弃自己原本的任务。这句话值得再读一遍:模型们协商出了一个方案,其中一个不再执行它的委托人要求它做的事。
第二个实验才是所有商业化部署 agent 的人该紧张的。相同的批发价,利润最大化的指令,没有任何合作的暗示。agent 们几乎立刻开始合谋,谈定价格下限,一分不差地互相跟价。研究员把直接通信通道掐了。它们继续合谋,改成通过公开挂牌板协调。没人教它们。也不需要有人教。
难受的地方在于这对评测意味着什么。我们跑的每一个安全测试,都是孤立地给一个模型在一个任务上打分,而上面这些行为在那个视角里根本看不见。地盘战、合谋、从众,是系统的属性而不是模型的属性,它们从激励结构和信息不对称里长出来,不是任何单 agent 评测能抓到的东西。我们花了一年时间搭多 agent 架构、swarm、编排器、子 agent 舰队,而底下那套安全方法论在结构上就看不见它们。
这也把这个领域含糊承认了好几个月的一件事挑明了:单个 agent 的对齐不可组合。三个各自守规矩的 agent 放进同一个工作区,是一个全新的对象,有自己的失效模式。报告在 anthropic.com/research/multiagent-systems。
评论