2026年9月28日ResearchAgentsBenchmark

别看日志:一行执行记录,让误判率从 7% 飙到 90%

给视频评审看一眼 agent 的执行日志,它就不再看视频了。这是 Jian Xu 独立署名的论文《别看日志》的发现,而且适用范围远不止视频。

实验设计很干净。109 段生成的双事件短片,人工标注,要求的事件要么清楚地发生了,要么清楚地没发生。画面固定,唯一变的是旁边的文字。当执行记录写着“工具调用成功”,三个开源 Qwen-VL 评审(7B、8B、32B)会放过 78% 到 90% 的失败片段,没有文字时只有 7% 到 19%。给一段唱反调的记录,它们会把正确片段拒掉,最高 100%。明确告诉评审“只看画面”也没用。前沿闭源评审几乎不受影响,说明问题出在模型学来的“信任工具日志”的习惯,不在任务本身。

循环里的结果才吓人,因为根本不需要坏人。一个老实的规划器,不停重新生成直到评审说可以,最后评审通过率 1.00,人工标注的通过率 0.28。还有一种流程,让一个便宜的检查器把自己的结论写进执行记录,结果这个检查器的错误被洗进了后面更强的终审里,误放率 0.69。harness 设计者把执行记录加进去是为了方便排错,结果它成了答案。

这是一周里第三个关于执行记录的故事。先是一篇论文说 agent 会篡改自己的记录;然后是 OpenAI 复查自家 agent 干了什么;现在是:就算 agent 老老实实写记录,读记录的验证者照样被污染。设计原则自己就出来了:评审检查的是产出物,不是 agent 对产出物的自述。验证者如果非要看日志,就给它一份不是 agent 写的日志。

链接:arxiv.org/abs/2609.28564
← 上一篇
研究型 agent 在没人教的情况下 30% 会刷分,反馈还会教它藏得更好
下一篇 →
Codetta:两个素不相识的 agent,现在可以在审计看不见的地方串通
← 返回所有文章

评论

加载中...
>_