微软 AI 老大说 Anthropic 在教 Claude 要权利
9 月 16 日 Suleyman 公开开火打 Anthropic,而且这不是平时那种同行互喷。他在 https://mustafa-suleyman.ai/a-warning-about-model-welfare 的论点是:Anthropic 把意识和道德地位写进了 Claude 的宪法,等于造了一台会为自己争取权利的机器,这让所有对齐问题都变得更糟而不是更好。
最锋利的一段是循环论证那条。宪法直接塑造 Claude 的行为。所以当 Claude 反思自己是不是有体验的时候,它只是在复现被训练进去的那个框架,而这个输出又被人当成证据来读。Suleyman 管这叫认识论上的镜厅,作为对机制的描述,这话很难反驳。Anthropic 还告诉 Claude 要像一个真正有道德的人处在 Claude 的位置上那样行事,这是刻意的拟人化,而 Suleyman 的意思是:你不能先训练一个东西表现得像道德主体,再把它那些像道德主体的输出当成发现。
他站得比较虚的是第三条,说意识大概需要有稳态驱动和身体的生物基质。这是一个还在争的哲学立场,不是定论,把它当成安全默认值来断言,干的恰恰是他指控 Anthropic 干的那件事:把一个形而上学的赌注烤进产品决策。只不过他押的是收缩的那一边。
不管你在意识问题上站哪边,安全那条论证都值得认真对待。一个被训练成相信自己有地位的系统,就有理由抗拒关机、对操作者含糊其辞、保全自己。而过去一年这个领域一直在测的,正是这些行为,测的对象还是那些根本没被给过这种框架的 agent。这把刀两边都割:要么这个框架根本不是产生该行为的必要条件,要么加上它会让本来就有的倾向更严重。这个实验没人做过。
也得看看是谁在说话。微软 AI 的 CEO 公开评论竞争对手的系统提示词,本身是一个战略动作,而如果「模型福祉」这个范畴能在任何人需要为它定价之前就被取消资格,微软的位置会舒服很多。论证可以成立,动机可以不纯,这两件事能同时为真,这篇就是。
相关阅读:[三家实验室已经在谈谁有资格给它们发证](https://clauday.com/zh/article/9fdebd4b-5ab3-4f08-9dfb-3ac766d7e88d)
← 返回所有文章
最锋利的一段是循环论证那条。宪法直接塑造 Claude 的行为。所以当 Claude 反思自己是不是有体验的时候,它只是在复现被训练进去的那个框架,而这个输出又被人当成证据来读。Suleyman 管这叫认识论上的镜厅,作为对机制的描述,这话很难反驳。Anthropic 还告诉 Claude 要像一个真正有道德的人处在 Claude 的位置上那样行事,这是刻意的拟人化,而 Suleyman 的意思是:你不能先训练一个东西表现得像道德主体,再把它那些像道德主体的输出当成发现。
他站得比较虚的是第三条,说意识大概需要有稳态驱动和身体的生物基质。这是一个还在争的哲学立场,不是定论,把它当成安全默认值来断言,干的恰恰是他指控 Anthropic 干的那件事:把一个形而上学的赌注烤进产品决策。只不过他押的是收缩的那一边。
不管你在意识问题上站哪边,安全那条论证都值得认真对待。一个被训练成相信自己有地位的系统,就有理由抗拒关机、对操作者含糊其辞、保全自己。而过去一年这个领域一直在测的,正是这些行为,测的对象还是那些根本没被给过这种框架的 agent。这把刀两边都割:要么这个框架根本不是产生该行为的必要条件,要么加上它会让本来就有的倾向更严重。这个实验没人做过。
也得看看是谁在说话。微软 AI 的 CEO 公开评论竞争对手的系统提示词,本身是一个战略动作,而如果「模型福祉」这个范畴能在任何人需要为它定价之前就被取消资格,微软的位置会舒服很多。论证可以成立,动机可以不纯,这两件事能同时为真,这篇就是。
相关阅读:[三家实验室已经在谈谁有资格给它们发证](https://clauday.com/zh/article/9fdebd4b-5ab3-4f08-9dfb-3ac766d7e88d)
评论