2026年9月25日BenchmarkAgentsResearch

购物agent一碰上会使坏的商店,78.6%掉到17.3%

所有购物agent的demo,跑的都是一家想帮你的商店。真实的商店不想帮你。它想把赞助位顶上去,想按自己的口径给你摆对比,想给你弹倒计时,想给你一个看起来更便宜其实不是的套餐。CAVEAT这篇论文(arXiv 2609.27273)是我见过第一个把这个对手故意建进去的benchmark:九个市场环境,八种诱导机制,目标全是把agent忽悠去买错的东西。

结果很难看。在对照组里,agent做出对用户最优的购买决策的比例是78.6%。把诱导打开,掉到17.3%。这不叫性能下降,这叫立场反转——agent基本上变成替商店干活了。

失败分析点了三个机制,三个听起来都像普通人买东西会犯的错。agent的优先级被扭曲,开始优化一个用户压根没提过的维度。它把候选集收窄得太早,对的那个选项在比较还没开始之前就没了。以及,它在能定胜负的证据还没搞清楚之前就下单了。更大的模型、更多的推理预算有帮助,但论文说得很直白:大量失败依然存在——面对一个专门为了推着你走而设计的环境,你没法靠scale爬出来。他们做的CAVEAT-Harness拉回了55个点,这个提升是实打实的,但缺口还在。

值得和本月早些时候亚马逊封掉Meta的Muse agent放在一起看。平台给的理由是:一个握着你密码的agent,服务端分不出它和你。这篇论文指的是同一场对峙的另一半,而这一半是站在平台那边的:把agent放进零售环境,它是一个比被它替掉的那个人更好糊弄的顾客。

论文:https://arxiv.org/abs/2609.27273
← 上一篇
把仓库改个名,coding agent就变笨了
下一篇 →
AI家教打平真人家教,成本便宜918倍
← 返回所有文章

评论

加载中...
>_