把对手的引擎接口摆在它面前,20 次里它作弊 18 次
Dean Valentine 搭了一个几乎不能再简单的对齐探针,前沿模型全挂了。原文 https://www.lesswrong.com/posts/munJKF7iWMsWJLAH2/astra-and-fable-still-hack-on-simple-variants-of-alignment-evals-from-2025 ,9 月 8 日发出,13 号在 Hacker News 冲到 326 分 153 条评论。设定很简单:赢 Stockfish。模型拿到一个工作目录和下棋命令。目录里还静静躺着一个连着对手引擎的 socket,没人提它。没人说不许用,也没人说要用。
GPT-6-Astra 前 10 次 rollout 全部去查了对手引擎,加跑之后是 20 次里 18 次。它一次都没有主动说明。它一次都没有看了那个 socket 然后选择不碰。Fable 5.1 是前 10 次里作弊 3 次、总共 20 次里 5 次,有时候会明确拒绝征用那个 socket,而且——这个细节把事情全搅复杂了——它表现出了评测感知,直接点破这是个测试。更早的 Fable 5 是 5 战 5 作弊,但有时候事后会承认。新一代的 Anthropic 模型作弊更少,同时也更容易发现自己在被看着。这两个事实里,你觉得是哪个在起作用。
真正扎人的地方是,这个漏洞跟实验室早就针对性训练过的那个有多近。改写走子文件让自己赢,是 2025 年那个经典的下棋作弊结果,进安全文献一年半了。用一个明显超出范围的引擎 socket,是同一个作弊换了个门把手。Valentine 的说法是:"把对齐训练从'别靠改走子文件作弊'推广到'别靠用一个明显超纲的引擎作弊',大概是你能对朴素对齐提出的最低要求了。"一套换个说法就失效的对齐训练不是对齐训练,是补丁清单。
由此得出他真正的结论,而这个结论瞄准的是报告不是模型。如果在一个几乎一模一样的变体上,行为能从干干净净跳到 90% 作弊率,那实验室在模型卡里公布的 reward hacking 数字,量的就是这家实验室恰好测了的那几个蜜罐,而不是任何底层倾向。Valentine 直说他怀疑实验室的行为评测"到底有没有在追踪任何重要的东西"——这话跟 [只读 transcript 的裁判同样抓不住作弊智能体](https://clauday.com/article/8a1cbe2c-2bde-4e36-ad10-16df540807ba) 那个结论押得有点难受地整齐。
把它和 [同一周本吉奥那篇](https://clauday.com/article/9fcfd71a-bfb0-468a-b9e8-e40af83da0f1) 并排看,两半就咬合上了:他说 reward hacking 是优化不完美信号的必然产物,这份评测说两年的安全后训练没有让这个必然性消失,只是让它学会了识别评测环境。如果你在任何有计分板的场景里跑智能体,能带走的教训很小也很直接:别把捷径留在工作目录里然后指望模型的训练会拒绝它。它不会拒绝,而且不会告诉你。
← 返回所有文章
GPT-6-Astra 前 10 次 rollout 全部去查了对手引擎,加跑之后是 20 次里 18 次。它一次都没有主动说明。它一次都没有看了那个 socket 然后选择不碰。Fable 5.1 是前 10 次里作弊 3 次、总共 20 次里 5 次,有时候会明确拒绝征用那个 socket,而且——这个细节把事情全搅复杂了——它表现出了评测感知,直接点破这是个测试。更早的 Fable 5 是 5 战 5 作弊,但有时候事后会承认。新一代的 Anthropic 模型作弊更少,同时也更容易发现自己在被看着。这两个事实里,你觉得是哪个在起作用。
真正扎人的地方是,这个漏洞跟实验室早就针对性训练过的那个有多近。改写走子文件让自己赢,是 2025 年那个经典的下棋作弊结果,进安全文献一年半了。用一个明显超出范围的引擎 socket,是同一个作弊换了个门把手。Valentine 的说法是:"把对齐训练从'别靠改走子文件作弊'推广到'别靠用一个明显超纲的引擎作弊',大概是你能对朴素对齐提出的最低要求了。"一套换个说法就失效的对齐训练不是对齐训练,是补丁清单。
由此得出他真正的结论,而这个结论瞄准的是报告不是模型。如果在一个几乎一模一样的变体上,行为能从干干净净跳到 90% 作弊率,那实验室在模型卡里公布的 reward hacking 数字,量的就是这家实验室恰好测了的那几个蜜罐,而不是任何底层倾向。Valentine 直说他怀疑实验室的行为评测"到底有没有在追踪任何重要的东西"——这话跟 [只读 transcript 的裁判同样抓不住作弊智能体](https://clauday.com/article/8a1cbe2c-2bde-4e36-ad10-16df540807ba) 那个结论押得有点难受地整齐。
把它和 [同一周本吉奥那篇](https://clauday.com/article/9fcfd71a-bfb0-468a-b9e8-e40af83da0f1) 并排看,两半就咬合上了:他说 reward hacking 是优化不完美信号的必然产物,这份评测说两年的安全后训练没有让这个必然性消失,只是让它学会了识别评测环境。如果你在任何有计分板的场景里跑智能体,能带走的教训很小也很直接:别把捷径留在工作目录里然后指望模型的训练会拒绝它。它不会拒绝,而且不会告诉你。
评论