MerchantBench:开一年网店,所有 Agent 都露馅
这一轮 Hugging Face Daily Papers 上最高票的 agent 论文(83 票)是 MerchantBench(arxiv.org/abs/2607.28956),结果配得上这个票数:让 LLM agent 当电商卖家,模拟经营 365 天,最好的配置年底净资产只有人类参与者的 27.3%。不是差 27%,是只有人类的 27%。
实验设置是目前最认真的长程模拟:订单级颗粒度,锚定 98,843 条来自 1688(阿里的批发平台)的真实商品记录,26 个工具。agent 要管选品采购、上架定价、现金流——最妙的是混合延迟反馈:有些后果立刻到账,有些要等模拟时间里的好几周。八个模型、两套 agent 框架、48 次全年运行,败法全都一样:单个任务执行得挺好,可一旦今天的决策会约束下个月的选项、反馈又乱序到达,线索就断了。
这是 Vending-Bench 的成年版,而且落地的同一周,Saul 实验刚给我们看了 GPT-5.6 Sol 烧掉 350 美元和 3.2 亿 token 经营一家真实业务、收入为零。两边指向同一个结论:缺的不是能力,是连贯性——在不断复利的后果里保持有目的的行为。只测有界任务、成功标准立等可取的 benchmark,会继续告诉我们 agent 已经胜任那些它们其实不胜任的工作。一个带现金流的 365 天模拟,离"干一份工作"的真实含义近得多,它给出的诚实数字是 27.3%。
← 返回所有文章
实验设置是目前最认真的长程模拟:订单级颗粒度,锚定 98,843 条来自 1688(阿里的批发平台)的真实商品记录,26 个工具。agent 要管选品采购、上架定价、现金流——最妙的是混合延迟反馈:有些后果立刻到账,有些要等模拟时间里的好几周。八个模型、两套 agent 框架、48 次全年运行,败法全都一样:单个任务执行得挺好,可一旦今天的决策会约束下个月的选项、反馈又乱序到达,线索就断了。
这是 Vending-Bench 的成年版,而且落地的同一周,Saul 实验刚给我们看了 GPT-5.6 Sol 烧掉 350 美元和 3.2 亿 token 经营一家真实业务、收入为零。两边指向同一个结论:缺的不是能力,是连贯性——在不断复利的后果里保持有目的的行为。只测有界任务、成功标准立等可取的 benchmark,会继续告诉我们 agent 已经胜任那些它们其实不胜任的工作。一个带现金流的 365 天模拟,离"干一份工作"的真实含义近得多,它给出的诚实数字是 27.3%。
评论