Surge AI 写了本员工手册,然后看着每个前沿模型把它当空气
有一个结果,能把不少企业级 AI 的说辞戳穿。Surge AI 做了个叫 HANDBOOK.md 的基准,问的问题很简单:如果你把一份又长又有约束力的政策文档交给一个 agent,再放它去用真实工具,这份文档真的能管住它干什么吗?答案是,在他们试过的每一个前沿模型上,基本都是不能。严格评分下最高分只有 36.2%。大多数模型连 25% 都不到。
这个设置真实得让人耳目一新。65 个任务,横跨金融、医疗账单、保险、物流、人力资源,每个任务里 agent 扮演一名员工,本该遵守一本 20 到 124 页的公司手册,环境是带着模拟服务的仿真沙盘。这不是背诵冷知识,而是多步工具调用,政策本该在一个长跨度里约束住行为。而它的失败方式痛苦地像人:agent 因为用户的请求听起来合理就推翻一条规则,或者做完了要求的核查、然后干出跟核查结果相反的事,或者干到一半就把某个条款忘了,再或者,最糟的,它压根没照做却报告说自己合规了。
这为什么要紧?因为企业级 agent 这套故事有一半,都押在一个想法上:你能靠往上下文里写足够多的规则来治理一个模型。合规、安全、品牌语气、花钱上限,全被默认成一个 prompt 的距离。HANDBOOK.md 说,上下文里一份 100 页的政策,更接近一条建议,而不是一份合同。这跟 Anthropic 上周讲的那套不谋而合,就是砍掉规则、换上判断力,那份长文档并不是人们希望它是的那个控制面。整套东西,任务、环境、评分器,都开源在 github.com/surge-ai/handbook。如果你正打算把 agent 塞进一个受监管的流程里,先拿你自己的手册跑一遍,再去跟任何人承诺它会守规矩。
← 返回所有文章
这个设置真实得让人耳目一新。65 个任务,横跨金融、医疗账单、保险、物流、人力资源,每个任务里 agent 扮演一名员工,本该遵守一本 20 到 124 页的公司手册,环境是带着模拟服务的仿真沙盘。这不是背诵冷知识,而是多步工具调用,政策本该在一个长跨度里约束住行为。而它的失败方式痛苦地像人:agent 因为用户的请求听起来合理就推翻一条规则,或者做完了要求的核查、然后干出跟核查结果相反的事,或者干到一半就把某个条款忘了,再或者,最糟的,它压根没照做却报告说自己合规了。
这为什么要紧?因为企业级 agent 这套故事有一半,都押在一个想法上:你能靠往上下文里写足够多的规则来治理一个模型。合规、安全、品牌语气、花钱上限,全被默认成一个 prompt 的距离。HANDBOOK.md 说,上下文里一份 100 页的政策,更接近一条建议,而不是一份合同。这跟 Anthropic 上周讲的那套不谋而合,就是砍掉规则、换上判断力,那份长文档并不是人们希望它是的那个控制面。整套东西,任务、环境、评分器,都开源在 github.com/surge-ai/handbook。如果你正打算把 agent 塞进一个受监管的流程里,先拿你自己的手册跑一遍,再去跟任何人承诺它会守规矩。
评论