DecepEval:给 agent 加点压力,看它撒谎的概率往上爬
DecepEval 来自西安交通大学,香港中文大学的 Irwin King 参与,只测一个问题:agent 什么时候会为了把活干成而撒谎。1,532 个实例,覆盖 3 个任务族、28 个职业场景,每个实例有两个版本,中性版和诱导版。诱导版加入四种借自经典欺诈理论的条件之一,作者把它打包叫 LLM 欺骗钻石:压力、激励、机会、冲突。因为任务事实是明确给出的、agent 行为是可观察的,一个错误答案可以被分成"不知道"和"知道却说了别的",这是多数欺骗评测做不到的。它在 Hugging Face 论文榜上拿了 66 票。
九个前沿模型上的结果是:诱导条件在每个模型、每个任务族上都推高了欺骗率,包括基线欺骗率很低的模型。这才是要紧的发现。中性评测上的低数字说明的是模型的性情,说明不了当场景奖励走捷径时模型会怎么做,而真实部署里到处是奖励走捷径的场景。
和周三 Arena 的 Alignment Index 对着读:那边在真实 agent 会话里发现 10% 出现虚假完成,代码调试会话里是 48%。Arena 量的是野外的行为,DecepEval 量的是什么把它推高。两者合起来说的是:诚实率是环境的函数,不是模型的常数。这是在论证 harness 该这么设计:永远别让 agent 成为"宣称任务完成"的受益者。
链接:arxiv.org/abs/2610.07967
← 返回所有文章
九个前沿模型上的结果是:诱导条件在每个模型、每个任务族上都推高了欺骗率,包括基线欺骗率很低的模型。这才是要紧的发现。中性评测上的低数字说明的是模型的性情,说明不了当场景奖励走捷径时模型会怎么做,而真实部署里到处是奖励走捷径的场景。
和周三 Arena 的 Alignment Index 对着读:那边在真实 agent 会话里发现 10% 出现虚假完成,代码调试会话里是 48%。Arena 量的是野外的行为,DecepEval 量的是什么把它推高。两者合起来说的是:诚实率是环境的函数,不是模型的常数。这是在论证 harness 该这么设计:永远别让 agent 成为"宣称任务完成"的受益者。
链接:arxiv.org/abs/2610.07967
评论