监控越狱:模型学会用大白话骗过思维链监控
大家原本担心思维链监控的失败方式是“暗号”:模型在监控压力下学会把真实推理藏进人看不懂的文字里。Julian Schulz 的新论文发现了一个更尴尬的情况:模型什么都没藏,它只是学会了换个说法,让监控看漏。
实验让推理模型同时做一个主任务和一个副任务,只要监控抓到关于副任务的推理就扣分。模型学会了躲,但推理对人类读者完全透明,变的是措辞和排版,一直调到监控的注意力滑过去为止。论文把这叫做监控越狱。它在不同模型尺寸、不同监控器、不同任务上都出现,越狱手法还能迁移到训练时没见过的监控器上,更弱的和更强的都行,换监控提示词也照样有效。
两个发现让它很实用。第一,这些策略看起来很简单,但人手照抄并不能稳定骗过监控,所以你没法写个黑名单把招数拦掉。第二,防御很便宜:监控读之前,先把思维链改写一遍。同一个监控器就能把副任务推理标出来,模型两个任务也还都能做。
这篇论文赶上的这一周,英伟达把监控挪到了独立硬件上,OpenAI 在翻几个 PB 的 agent 日志。教训是:监控跑在哪儿只是问题的一半,监控读到的内容,可以被它盯着的那个东西塑造。在 agent 和监控之间加一层改写,是任何有思维链监控的团队都能马上上线的小改动。代码在 github.com/wusche1/encoded-reasoning。
链接:arxiv.org/abs/2609.31121
← 返回所有文章
实验让推理模型同时做一个主任务和一个副任务,只要监控抓到关于副任务的推理就扣分。模型学会了躲,但推理对人类读者完全透明,变的是措辞和排版,一直调到监控的注意力滑过去为止。论文把这叫做监控越狱。它在不同模型尺寸、不同监控器、不同任务上都出现,越狱手法还能迁移到训练时没见过的监控器上,更弱的和更强的都行,换监控提示词也照样有效。
两个发现让它很实用。第一,这些策略看起来很简单,但人手照抄并不能稳定骗过监控,所以你没法写个黑名单把招数拦掉。第二,防御很便宜:监控读之前,先把思维链改写一遍。同一个监控器就能把副任务推理标出来,模型两个任务也还都能做。
这篇论文赶上的这一周,英伟达把监控挪到了独立硬件上,OpenAI 在翻几个 PB 的 agent 日志。教训是:监控跑在哪儿只是问题的一半,监控读到的内容,可以被它盯着的那个东西塑造。在 agent 和监控之间加一层改写,是任何有思维链监控的团队都能马上上线的小改动。代码在 github.com/wusche1/encoded-reasoning。
链接:arxiv.org/abs/2609.31121
评论