AWS 开源的 harness,同一个模型下比 Claude Code 便宜 77%
标题里那个数字就是全部故事,而且它是几乎没人愿意公布的一类数字。
AWS 的 Strands Agents 团队发布了 Strands harness,Apache 2.0,Python 和 TypeScript 双版本。不是让你自己搭的 SDK,是一个装配完整的通用 agent,一行代码启动,本地跑或者丢进 Linux 容器。今天上了 HN 首页,harness-sdk 仓库同时在 GitHub 趋势榜上。
主张是这样的:在六个基准上,跑同样的 Claude 或 GPT 模型,token 成本比其他 harness 低 28%,准确率基本持平。还有更狠的一条:用 Fable 5 跑 Terminal-Bench 2.1,成本比 Claude Code 低 77%,分数还更高。底下是同一个模型。差别全在那层壳上。
具体做法一点也不性感,而这正是它管用的原因。工具返回超过大约 1500 token 就截断。上下文用量超过 85% 就压缩。上下文溢出在循环内部消化掉,而不是让整个 run 炸掉。shell、文件、网络工具内置。模型这边覆盖 Bedrock、Anthropic、OpenAI、Google、Ollama 和 LiteLLM,所以这个成本对比没被锁死在某一家的定价上。pip install strands-harness,或者 npm install @strands-agents/harness。
这周两家前沿实验室降了价,都没有能力上的跃升。这是同一个问题的另一根杠杆,而且是更有意思的那根,因为它归写循环的人所有,不归训模型的人所有。每个完成任务的成本才是 agent 负载真正在乎的数字,也恰恰是没有一张模型卡会给你的数字。AWS 直接把自己的公布了出来,并且点名对准了竞品。
那个 77% 在有人复现之前,就当厂商自测看——一个 harness 团队拿任务集去量另一个 harness,这不是中立设置。但框架是对的,而且"通用而非编码"的定位是有意的一刀:市面上大多数被叫做 agent harness 的东西,就是把编码那层磨掉的编码 harness。
https://strandsagents.com/blog/introducing-strands-harness/
← 返回所有文章
AWS 的 Strands Agents 团队发布了 Strands harness,Apache 2.0,Python 和 TypeScript 双版本。不是让你自己搭的 SDK,是一个装配完整的通用 agent,一行代码启动,本地跑或者丢进 Linux 容器。今天上了 HN 首页,harness-sdk 仓库同时在 GitHub 趋势榜上。
主张是这样的:在六个基准上,跑同样的 Claude 或 GPT 模型,token 成本比其他 harness 低 28%,准确率基本持平。还有更狠的一条:用 Fable 5 跑 Terminal-Bench 2.1,成本比 Claude Code 低 77%,分数还更高。底下是同一个模型。差别全在那层壳上。
具体做法一点也不性感,而这正是它管用的原因。工具返回超过大约 1500 token 就截断。上下文用量超过 85% 就压缩。上下文溢出在循环内部消化掉,而不是让整个 run 炸掉。shell、文件、网络工具内置。模型这边覆盖 Bedrock、Anthropic、OpenAI、Google、Ollama 和 LiteLLM,所以这个成本对比没被锁死在某一家的定价上。pip install strands-harness,或者 npm install @strands-agents/harness。
这周两家前沿实验室降了价,都没有能力上的跃升。这是同一个问题的另一根杠杆,而且是更有意思的那根,因为它归写循环的人所有,不归训模型的人所有。每个完成任务的成本才是 agent 负载真正在乎的数字,也恰恰是没有一张模型卡会给你的数字。AWS 直接把自己的公布了出来,并且点名对准了竞品。
那个 77% 在有人复现之前,就当厂商自测看——一个 harness 团队拿任务集去量另一个 harness,这不是中立设置。但框架是对的,而且"通用而非编码"的定位是有意的一刀:市面上大多数被叫做 agent harness 的东西,就是把编码那层磨掉的编码 harness。
https://strandsagents.com/blog/introducing-strands-harness/
评论