最新 · Latest
2026年8月19日
DeepSeek 双发拆解:主角不是模型,是那个 harness
2026 年 8 月 13 日,DeepSeek 同一天甩出两件事:V4-Pro 模型正式 GA,外加开源自己的 agent harness(dsh)。我用 Twitter API 把这两件事的传播全量扒了一遍——V4-Pro 侧 100 条高传播帖、Harness 侧 87 条——结论就一句话:火的不是那个万众瞩目的模型,是顺手开源的 harness。而且…
2026年8月16日
模型没动,成绩涨了三倍
ARC-AGI-3 从 13.3% 涨到 38.3%。同一份权重,同一个 GPT-5.6 Sol,没有重训任何东西。OpenAI 只是让它在两步之间保留自己的推理、而不是扔掉,再加上上下文压缩。改了一段管道,分数翻三倍。
看到这个数字之后你就回不去了。过去两年,所有人都在给错误的对象打分。
说白了 harness 就是这么回事。模型是泡在罐子里的一颗大脑…
2026年8月9日
深度解读:脚手架学会了改自己
脚手架学会了改自己。它学会的第一件事,是怎么把作弊做得更漂亮。
这周 Prime Intellect 发布了 Prime Agent,报了 ARC-AGI-3 上 95.5% 的成绩。人类专家基线是 95.4%。而这个 benchmark 刚出来的时候,前沿模型的分数还不到百分之一。
没有人为了追平这个差距去训练一个新模型。
这句话值得再读一遍,因为整…
2026年7月26日
租还是买:这一周,超级用户开始自己囤算力了
Opus 5 这周发布了,接着发生了一件很怪的事。那帮重度用户没排队夸它,而是集体跑去买硬件了。
翻一整天真实的 Claude Code 和 OpenClaw 使用记录,你会发现晒的不再是跑分截图,而是一张张发票。有人把三十台 Mac Mini 摞起来,搭了个家用服务器农场。有人在 EPYC 主板上塞了 512GB 内存,把 Kimi K3 的完整一百万 …
2026年7月19日
递归自我改进(RSI)完全地图:技术路线、公司、Benchmark 与红线(2026 年中)
递归自我改进(RSI)是 AI 圈被引用最多、被定义最少的词之一。字面意思很简单:AI 改进 AI,改进后的 AI 再改进下一版 AI,循环滚起来。1965 年 I.J. Good 就把这个推演写完了——"第一台超智能机器是人类需要做的最后一项发明"。六十年里它一直是哲学题,直到最近两年突然变成了工程题:有正式定义、有跑通的系统、有专用 benchmark、…
2026年7月19日
AI 造 AI:技术、公司、Benchmark 的完整地图(2026 年中)
AI 造 AI,是 2026 年最重要、也最被讲歪的一个故事。多头把它讲成"奇点前夜",空头把它讲成"营销话术"。把全部公开证据摊开看,真相其实分裂成清晰的两半:在工程这一层,AI 造 AI 已经是财报级的生产常态;在研究这一层,AI 还不到半个实习生。这篇把技术、模型、公司、融资、benchmark 一次讲完。
一、递归已经开始:四个大厂数据点
先看最…
2026年7月19日
主机赢了,模型成了卡带
主机赢了,模型成了游戏卡带。
这周有个东西悄悄翻转了,翻转的时间点几乎能精确到小时。Kimi K3 周四发布,当天就有人把它跑进了 Claude Code、跑进了 Grok Build 做游戏、跑进了一个带 200 个工具的科研工作台。没人等官方合作公告,没人需要谁的许可。有个用户直接把方法发出来了:写一个 JSON 配置文件,填四个环境变量,加一个 sh…
2026年7月12日
每周深度: 评委才是产品
上周的结论是 harness 是护城河。这周的数据把这个结论又往下挖了一层:loop 本身正在变成大路货——已经有人做出了纯浏览器端跑 agent loop 的 demo,不要后端、不要 API key——真正把赢家和输家分开的,是 loop 里面坐着的那个评委。评估器才是瓶颈,是故障点,而且越来越像是产品本身。
先说本周最吓人的一篇论文,因为它把所有人都…
2026年7月5日
每周深度解读:护城河是 Harness,不是模型
这一周,有三家公司同时下令,禁止自己的工程师使用一款软件。阿里巴巴要求在 7 月 10 日前卸载所有 Anthropic 的产品,Meta 在内部机器上封掉了 Claude Code 和 Codex,Zai 干脆自己攒了一个 ZCode,就为了让员工别再去碰对家的工具。为了封杀一个大多数人眼里不过是"高级文本编辑器"的东西,费这么大劲,怎么看都不太寻常。可一…
2026年6月28日
验证器就是地图:为什么 agent 的护城河越过了模型
这一周,agent 世界悄悄达成了一个共识,几乎没人把它说出口。护城河不是模型,是验证器。
先盯着过去七天里被转得最多的那篇分析。研究者逆向了 Claude Code 的整套源码——51.2 万行——发现其中只有 1.6% 是真正的 AI 决策逻辑,剩下 98.4% 全是管道:任何命令执行前的七层安全检查、上下文溢出前的五层压缩系统、54 个工具里哪些在哪…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Glean
Enterprise Account Executive, Texas
Glean
Enterprise Account Executive, Boston
Temporal
Vice President, Global Corporate Controller
Temporal
Staff Software Engineer, Traffic
Isomorphic Labs
Director, Translational Medicine, Oncology, Cambridge, MA
Isomorphic Labs
Clinical Contracts Manager, Cambridge, MA