Argo-Bench:75 亿行数据,按后果给 agent 打分
Text-to-SQL 基准有两个老毛病:只看查询写得对不对,不管你拿结果去干什么;审计还发现它们的标准答案经常是错的。TextQL 团队的 Argo-Bench 推倒重来,围绕一个跟真货很像的企业数据仓库重新出题。
作者按真实规模模拟了一个纽约外卖平台:2024 年 8100 万单,经济模型、欺诈模式、平台补贴都参照公开数据、同行评审的行业研究和监管文件。这个世界被导出成一个仿照 Oracle E-Business Suite 结构的 ERP 数仓,235 张表,75 亿行。模拟器里的真实状态对 agent 隐藏,agent 只能看到数仓,必须自己在里面翻找、还原事实,就像分析师入职第一天那样。
然后要动手。210 个任务包括封禁欺诈账户、分配骑手激励预算、补发欠薪。评分器把每个动作放回模拟器里跑,按后果打分。每个任务都附带一份只用数仓就能跑通的参考解法,保证全部可解。
结果:14 个前沿和开源模型里,最强的那个只在 34.8% 的任务上拿到 95 分以上,平均 59.5 分。「会写 SQL」和「能放心让它去封号」之间的差距,就是整个企业数据 agent 市场浓缩成的一个数字。按后果打分而不是按输出打分,这个设计值得别的 agent 基准照抄。
链接:argo-bench.com,github.com/TextQLLabs/Argo-Bench,arxiv.org/abs/2610.02122
← 返回所有文章
作者按真实规模模拟了一个纽约外卖平台:2024 年 8100 万单,经济模型、欺诈模式、平台补贴都参照公开数据、同行评审的行业研究和监管文件。这个世界被导出成一个仿照 Oracle E-Business Suite 结构的 ERP 数仓,235 张表,75 亿行。模拟器里的真实状态对 agent 隐藏,agent 只能看到数仓,必须自己在里面翻找、还原事实,就像分析师入职第一天那样。
然后要动手。210 个任务包括封禁欺诈账户、分配骑手激励预算、补发欠薪。评分器把每个动作放回模拟器里跑,按后果打分。每个任务都附带一份只用数仓就能跑通的参考解法,保证全部可解。
结果:14 个前沿和开源模型里,最强的那个只在 34.8% 的任务上拿到 95 分以上,平均 59.5 分。「会写 SQL」和「能放心让它去封号」之间的差距,就是整个企业数据 agent 市场浓缩成的一个数字。按后果打分而不是按输出打分,这个设计值得别的 agent 基准照抄。
链接:argo-bench.com,github.com/TextQLLabs/Argo-Bench,arxiv.org/abs/2610.02122
评论