2026年8月10日BenchmarkAgentsOpen Source

Harvey LAB:法律 agent 的真考卷,Kimi K3 考了第一

估值最高的法律 AI 公司把自己的考卷开源了,然后一个中国开源权重模型考了第一。Harvey 的 LAB(Legal Agent Benchmark)今天上了 GitHub trending:1,671 道题,覆盖 24 个法律执业领域,从并购到税务到破产,每道题用专家手写的评分标准打分,总共超过 75,000 条评分点。跟以前那些合同审查玩具级评测不一样,LAB 的题是长程任务:分析一个乱糟糟的客户案子,梳理案卷,产出一份真正的交付物,比如风险备忘录。仓库自带执行 harness,你可以直接跑自己的 agent 打分,MIT 协议。

排行榜才是精彩的地方。Artificial Analysis 用自家的 Stirrup harness 在 120 道保密题上做了独立实现,叫 Harvey LAB-AA,目前的榜单是:Kimi K3(max)94.6%,Claude Fable 5 93.6%,Muse Spark 1.1 93.1%。一个北京的开源权重模型,坐在一个由 Nvidia、OpenAI、Anthropic、Mistral、DeepMind 站台的美国法律评测榜首——这句话放一年前没人敢写。

两个值得记住的点。第一,这个评测从 5 月发布时的 1,200 道题涨到了现在的 1,671 道,几个月后还在 trending,说明带真实专家评分标准的垂直领域 agent 评测又稀缺又抢手。第二,当前沿模型都挤在 90 分段、差距不到一分的时候,这个评测其实在告诉你:法律 agent 离真正可部署,比大多数律师以为的近得多。

仓库在 github.com/harveyai/harvey-labs,榜单在 artificialanalysis.ai/evaluations/harvey-lab-aa。
← 上一篇
T3 Code:Theo 给你的 agent 舰队做了个遥控器
下一篇 →
OpenChamber:OpenCode 缺的那个驾驶舱,社区自己造了
← 返回所有文章

评论

加载中...
>_