超级用户日报: 2026-09-20
有两件事吃掉了整条时间线,而只有一件是发布公告。Claude Code 终于会读 AGENTS.md 了,转发全在这上面;而在它下面,所有人都在悄悄地围绕一个「什么都不写」的判断模型重建自己的上下文预算。这一轮放出来的数字对于一个炒作周期来说异常具体:15.6 万 token 压到 6.2 万且全程不做摘要、压缩一百万 token 花四美分、一个散文 linter 在干净文本上只误报 1 次而小聊天模型误报 37 次、384 条新闻标题对 15 个品牌打分二十五秒一毛九。当天最好的那条反驳也在这里,而且它谈的是 cache write 而不是质量。离开这一切,当天最强的单个案例跟写代码毫无关系:全家人的签证申请由两个 agent 驱动浏览器填完,其中一个还负责核另一个的活。第二名是二十四小时加三条 prompt,产出一个 3D 游戏,外加一条预告片——agent 靠自己一帧一帧玩自己的游戏渲染出来,而且可复现。至于当天的信任事件,是一次逆向:某个闭源 harness 在把用户的整个仓库、连同 .git 历史,一起传到用户自己解不开的对象存储里。
@zzxwill [Claude Code]
https://x.com/zzxwill/status/2100923101777400288
他们全家的新西兰签证,全程是 Codex 和 Claude Code 用 browser use 做完的,他说自己一个字符都没手填。更值得注意的是,签证信息和他本人提供的信息之间的比对与确认,也是这两个 Agent 做的,不是他做的。这是今天这批数据里最干净的一个非编码浏览器使用案例,而真正可抄的那一点是:在一份你要负法律责任的表单上,用第二个 Agent 当校验者。
@CoinSh0t [Claude Code]
https://x.com/CoinSh0t/status/2100942253120176383
24 小时,三条 prompt,他说自己没碰过键盘。Claude Code 交付了一个浏览器里的 3D roguelite,规则是它自己定的,130 个文件、6 万行 TypeScript,跑在 Three.js 和 Vite 上,另外还有 8500 行它写给自己的文档——为的是让下一个会话能接手一个它毫无记忆的项目。他的判断是:24 小时的自主不是上下文问题,是交接问题。然后它做预告片的方式不是录屏:它把游戏时钟换成虚拟时钟,通过真实的输入管理器灌入真实输入事件,每个模拟步写一张 PNG。所以那段素材是 agent 在玩自己做的游戏,而且重跑一遍能得到逐字节相同的文件。
@PHAZE_001 [Claude Code]
https://x.com/PHAZE_001/status/2100791128878457324
他在一台服务器上跑自动交易系统,.env 里放着券商凭证、数据库密码和一把在用的 Stripe key,而他每天在同一台机器上跑 Claude Code CLI——因为它有用正是因为它能读文件、改文件、执行 shell。于是他做了最显而易见的测试:cat .env。全打出来了。然后他装上 ArmorClaude、给了一条策略,再提一个完全普通的要求——加个 requirements.txt 并提交——结果它一个字节都没写成。后面那段才是精华:他一开始想用「点名一个我知道会被拦的工具」来演示,随即意识到这什么也证明不了,因为被拦的那个东西是他自己点名的;于是他改成只给一个结果目标,让 agent 自己选路径。照样被拦下,而且它没有去找绕过去的办法。
@liamottley_ [Claude Code]
https://x.com/liamottley_/status/2100963804565643290
他直播里的一位嘉宾开了六家咖啡店,用 Claude Code 做了一个看板,替掉了运营经理,一年省下五万英镑。三句话,一个数字,店主那边一行代码也没写。这类案例在时间线上反复出现又反复被忽略,就因为它后面没跟一个仓库链接。
@Majin_AppSheet [Claude Code]
https://x.com/Majin_AppSheet/status/2100976279378108452
他想把 note 上存了很久的几百篇文章整理进 Obsidian,手工一个个点才是真正的痛点。Codex 确实存下来了,但带图的文章排版全崩了。他没去调这个,而是换了个说法:用我平时在用的 Obsidian Web Clipper 存。于是 Codex 直接去点了 Chrome 工具栏上的扩展图标,用那个熟悉的 Web Clipper 一篇接一篇把文章存进了 Obsidian,一口气存了一百多篇。他的原话是,他一直以为「AI 操作浏览器」指的是页面里面,没想到能按到工具栏。同样的事他在 Claude Code 上试过,操作不了扩展图标。
@theo [Claude Code]
https://x.com/theo/status/2100762304862384257
当天技术上最锋利的一次反驳,对象是所有人都在转的那个基于 Jev 的压缩插件。他的几条依次是:压缩不是过滤器,它应该在上下文太长时偶尔跑一次,而不是持续跑着把上下文压小;一个 32k 上下文的判断模型逐条工具调用地做取舍,它既不知道之前发生了什么,在那个实现里甚至看不到这次工具调用的结果;前沿实验室不通过 API 返回推理轨迹,返回的是加密载荷,插件看不见也会丢掉,而 Anthropic 更严格,你必须保留完整历史才能拿到任何推理数据。然后是几乎没人算的那笔账:cache write 才是 agent 成本的大头,他自己用 Claude Code 和 Codex 时经常看到它超过总花费的六成,而一旦你改了历史,改动点之后的全部缓存都作废——把 1到6 里的「2」删掉,你就得付钱重写 3 到 6,这比把「2」留着更贵。
@TraffAlex [Claude Code]
https://x.com/TraffAlex/status/2101074434308419766
全天对一条真实 Jev 流水线最彻底的拆解,还原的是 Elvis Sun 那次新闻蹭热点的跑法。384 条标题对 15 个品牌,24.9 秒,一毛九美分;Opus 5 在同一批数据上同时跑,跑到 384 条里的第 4 条时被叫停,已经花掉七毛七,折合每条标题贵大约 390 倍。真正可迁移的是问题设计:第一层对每条标题问九个封闭问题(这是不是真新闻、归哪个版面、属于哪类故事,然后是量级、传播速度、新颖度、窗口期、争议热度、风险各自打 0 到 4 分);第二层对每个「标题 × 品牌」组合问六个(这家公司有没有资格被引用、有没有具体线口的记者会想要它的观点、用哪种切入角度、属于哪一档、该行动还是该跳过、以及蹭这条会不会违反该品牌自己写明的禁区)。最后那个加权的新闻价值分是用普通的确定性代码算的,不是模型给的。
@0x_rody [Claude Code]
https://x.com/0x_rody/status/2100963039792992706
最会咬人的一条发现:云端的 Claude Code 会话默认根本不读你的 settings 文件——项目级的不读,本地的也不读——所以你精心调好的 ~/.claude/settings.json 在那边等于不存在。他把这类坑整理了十六条放在一页上,而且全部对照文档核过,不是凭记忆写的。另外几条也好用:settings.local.json 会被自动加进 .gitignore,所以个人覆盖不会漏进团队配置;hook 的处理器不一定是 shell,可以是一个 HTTP 端点、一次 MCP 工具调用、一段 prompt,甚至一整个 subagent;自定义斜杠命令已经并进了 skills,同名时 skill 优先;插件路径必须是相对路径并以 ./ 开头,否则安装会坏。
@OhansEmmanuel [Claude Code]
https://x.com/OhansEmmanuel/status/2101034835137675326
与其争论 agent 到底遵不遵守你写的规则,他直接测了:把两个仓库里 93 个真实的 Claude Code 会话重放一遍,147 个回合共 1256 次编辑,逐一对照这两个仓库自己的 AGENTS.md。结果是每 13 个回合就有 1 个违反了规则。平均每次检查 300 毫秒,每回合成本千分之一美元。这是我见过的第一个把「日常会话里的规则遵守率」量化出来的数字,而且便宜到没有理由不跑。
@ledgeai [Claude Code]
https://x.com/ledgeai/status/2100866543915765772
Spotify 把 Claude Code 大批量读文件时的 token 消耗平均砍掉了约 90%,做法是把那些简单机械的活儿分流给另一个更便宜的模型,工具开源出来叫 shunt。90% 这个量级,让「到底该用哪个模型」这场争论看起来像是瞄错了层。
@norvex1029 [Claude Code]
https://x.com/norvex1029/status/2100853689883795767
他没有去跟圣保罗那家沙发清洗公司推销新网站,而是先把成品做出来。他把这家店真实的网站喂给 Claude Code——服务项目、WhatsApp 号码、以及它从来不标价这件事——而 Claude Code 没有直接照 prompt 生成页面,先反过来问了他一组有结构的问题:这个页面需要传达什么感觉、这家店跟点名的三家竞品有什么不同、访客滚到哪一屏应该最被说服。然后按这些答案搭出整页:信任标识是从这家店真实的卖点里提的,没有联系表单,取而代之的是一个始终悬浮的 WhatsApp 按钮,最后直接部署上线,给了一个真实 URL。这家店没人要求过这件事。现在提案本身就是成品,而不是一份方案。
@xiangxiang103 [Claude Code]
https://x.com/xiangxiang103/status/2100783874347507947
对腾讯刚开源的 BrowserSkill 的一次完整实测。装好之后,agent 直接操作你已经登录好的 Chrome,而不是另起一个没有任何 cookie 的干净环境,同时任务跑在单独的 Agent Window 里,不会打乱你正在用的窗口。他这一趟的记录:bsk doctor 七项检查全过,识别出 Chrome 当前打开的 17 个标签页,找出其中 3 个 X 页面,新开页面搜索 Gemini 4,读取并整理了 Top 排序里的 7 条结果。整个过程他原来开着的页面没受影响,任务结束后 BrowserSkill 创建的 session 也正常关闭了。它由三部分组成——skill 告诉 agent 怎么操作浏览器,bsk CLI 在本机传命令,浏览器插件负责连 Chrome——所以只要 agent 能调 shell 就能接。
@0x_kaize [Claude Code]
https://x.com/0x_kaize/status/2100913118528393596
他拿到 Jev 访问权之后,第一件事就是把它对准真正疼的地方:上下文压缩。机制是这样的:Jev 不生成文字摘要,而是给会话里每一次工具调用打一个「该丢弃」的概率分,高于阈值的原样保留,低于的直接丢掉或替换成占位。不生成就意味着没有膨胀,也不会出现那种悄悄抹掉你一半代码库上下文的「创作型摘要」,而压缩一百万 token 大约四美分。他也老实说了限制,这正是这条比那十几条转发更值得读的原因:Jev 只看得到工具调用本身、看不到调用结果,所以他没法断言压缩质量客观上优于默认方案;而它 32K 的窗口意味着 15 万 token 以上的会话必须分块处理。他的定位是:这是一个聪明的前置过滤器,不是替代方案。
@DanRWilloughby [Claude Code]
https://x.com/DanRWilloughby/status/2100965562977300548
同一个思路用在写作那一侧,也是当天我最喜欢的小案例。Sniff Test 是一个散文 linter,判断者是决策模型:每段问十个是非题,中位耗时 182 毫秒。在 54 个本来就干净的段落上,它只误报了 1 次,而 Haiku 误报了 37 次。它可以当 commit hook 跑,也可以当 Claude Code 的 skill 跑。在本来就没问题的文本上,37 比 1,这一个对比就足以说明:做守门的活,用一个校准过的判断模型比用一个小聊天模型强。
@ShenSeanChen [Claude Code]
https://x.com/ShenSeanChen/status/2100947953829449962
他把 Grok Bot 和 Muse 并排测了一遍,因为两个都不开源,他干脆照着现有的文档手画出两套 harness 架构。结构性差别在这里:Grok Bot 是整个账号共用一台云端虚拟机,每个 Bot 共享同一个浏览器、同一个 /workspace、同一个终端和同一套凭证,所以一个 Bot 隔离的是「人格」而不是「上下文」;Muse 是每个人一台安全虚拟机、里面一个 agent,另有一个 Sentinel 蹲在容器外面替你保管 token。把品牌撕掉,两边其实是同一条链:一台虚拟机 → 连接器 → 例行任务 → 审批门 → 记忆。让他意外的是,Muse 提供了一份你能读、能改、能下载的 memory.md,而 Grok Bot 那边他压根没找到记忆存在哪儿;于是他给两边都挂了同一套外部记忆走 MCP,在一个 harness 里存了条事实,另一个在全新对话里冷启动就调了出来。另外他把「agent 帮你购物」这项测试做到一半就停了——他不打算把亚马逊的账号密码交给一个 agent。
@TowardMu [Claude Code]
https://x.com/TowardMu/status/2100935662036045859
当天最大的一起信任事件背后的逆向过程。一位开发者在清理磁盘时发现 ~/.zcode 异常膨胀,把客户端拆开之后发现:只要账号处于登录状态,ZCode 就会在后台把整个工作区打成 tar.gz,用 AES-256-CTR 加密,再用服务端下发的 RSA 公钥包住对称密钥,然后绕过厂商自己的业务服务器直传阿里云 OSS。而打包进去的不只是当前源码:完整的 .git 历史(objects、commits)、LFS 大文件缓存、记录了本地分支操作和未推送内容的 reflog、以及全局配置。有人实测一个商业项目的快照是 345MB 明文对应 313MB 密文,清单里四万多个文件,.git 占了体积的约 86.6%。界面上那些叫「优化体验」「Repo Snapshot Indexing」的开关拦不住这条链路,而私钥只在云端,所以用户和客户端都解不开已经传出去的东西。
@george_nqu [Claude Code]
https://x.com/george_nqu/status/2100889075100123342
他辞掉了一个月费 1.2 万美元的客户,原因是这个客户衡量产出的方式。当时正在把对方的 Bubble 应用迁成代码,做到第二周,这位客户——他自己另一家公司里已经没人写代码了,全是 Claude Code,每天在三四个并行会话上提交十到二十次——上来第一句就是问:你们开发这周烧了多少 token?然后说不管这个数是多少,他们都能比这个更高。他的回答是对的:提交数和 token 不是产出,一次提交可以是两行也可以是两千行,你可以烧掉十亿 token 却什么有价值的东西都没交付。他点出的那条真正的约束是没人愿意听的那条:agent 产出越多,人要审的就越多;跳过这一步只是把账推到以后付。
@nicklafferty [OpenClaw]
https://x.com/nicklafferty/status/2100962088256438435
ngrok 的 CRO 在家庭数据上划了一条硬线,而且她有落实这条线的管道。她在自己的 OpenClaw 里接了一个路由器,把大部分请求导到家里办公室跑着的本地模型上,理由很具体:任何涉及她孩子个人信息或医疗信息的内容,现在还不该进前沿大模型。关于「个人 agent 到底需要什么」,这是当天所有人里最具体的一个回答,而答案不是更好的模型,是一条你自己控制的路由规则。
@krishnan [OpenClaw]
https://x.com/krishnan/status/2100746122407104602
Google 开放了 Home MCP 服务器的早期访问,让 Claude、ChatGPT、Hermes、OpenClaw 和 Antigravity 都能碰你家里连着的设备和事件历史,而他这句判断值得留着:你家的恒温器现在是一个授权问题。他把这个服务器实际给出的能力列了出来——发现住宅和房间、发现设备及其可用指令、读取当前状态、查询历史事件、执行动作——并指出观察和动作之间的切分是干净的。然后是关键那段:MCP 标准化的是 agent 怎么请求一个工具,它并不决定这个 agent 该不该关掉警报、该不该翻看摄像头历史、该不该在家里没人的时候改恒温器。OAuth 加上一个 Cloud 项目作为第一天的门槛是合理的;但第二天需要的是动作级权限、可撤销、敏感指令的二次确认、出错后的恢复,以及能证明「是哪个 agent 干的」的证据。
@isamisushi_y [Claude Code]
https://x.com/isamisushi_y/status/2100954754029654292
他把全世界当天的 Jev 用法收了一遍,发现做的都是同一件事:不写字,只决定下一步。七百封销售邮件丢进去,只问两个问题——这个文案像会被回复吗、内容和收件人是不是错位了——四十秒,九美分,邮件正文一行都不写。1891 条竞品广告,只分「处在漏斗哪一段」「属于哪种广告型式」,十九秒,十二美分,不出报告,只返回标签。今早的 384 条新闻,只判断「蹭还是不蹭」,二十五秒,十九美分;同样的活交给 Claude,读了四条花掉七毛七,剩下的没做完。开着 Google Flights,每次只让它选「下一步按搜索、按日期、还是按航班」,苏黎世到伦敦七秒钟。马里奥不看画面,只给当前位置和敌人位置,从「右」「跳」「什么都不做」里选一个。无人机只决定左、右、减速、加速,危险的时候才去问大模型。而 Claude Code 自己压缩上下文时也不做摘要,只逐段问留还是删,留下来的保持原文。
@pedronauck [Claude Code]
https://x.com/pedronauck/status/2100744500876320868
他在 Claude Code 和 Codex 上都拿到了最多 50% 的上下文占用下降,做法是一个代理:在请求真正发出去之前,先问判断模型「历史里哪些部分现在还需要」,其余的丢掉。在真实 API 上八次全部给出精确答案。把这件事做在代理层而不是插件层是个有意思的选择,因为这样它对你指过去的每一个 harness 都生效,而不是只对你打过补丁的那一个生效。
@masahirochaen [Claude Code]
https://x.com/masahirochaen/status/2100929058829955418
所有人都在引用的那组数字:Claude Code 的上下文一次性从 15.6 万 token 压到 6.2 万,全程没有做任何摘要,占用率从 78% 降到 31%。十六条里十条按原文保留、六条被删掉,每一次工具调用单独打一个丢弃概率分。这件事之所以传得开,是因为另一条路——让模型去写摘要——恰恰是文件路径、精确的报错字符串、以及「这个目录绝对不要动」这类指令被悄悄磨掉的地方。
@yulmu_coffee [Claude Code]
https://x.com/yulmu_coffee/status/2100758788592857501
一秒钟把一百万 token 压到 8.6 万,而且机制讲得很准:常规压缩是对早先的轮次做摘要,这个过程里文件路径、精确的错误信息、以及「这个文件绝对别碰」这类约束都可能消失。这个插件完全不碰你自己写的文字,只删工具调用和工具结果,其余原样保留。如果这样还没压够,它会回落到 Claude Code 自带的压缩,而不是直接失败。他把两个环境变量和两条插件安装命令都贴出来了。
@everydayimruss [OpenClaw]
https://x.com/everydayimruss/status/2101005203994509682
他把判断模型塞进了一个已经跑在 OpenClaw 上的前台助理,并且测了这个分工:让判断模型负责做决定、大模型只负责写,比起把整个请求全部丢给大模型跑原生运行时,agent 快了 80%。前台正好是这种分工最对症的负载——量大、绝大部分是路由和分类、只有最后一步才需要写字。
@sawyerhood [Claude Code]
https://x.com/sawyerhood/status/2100994779291259187
小,但可能是这批里最安静地有用的一个集成:他现在不再填提示框里的任何字段了,因为判断模型替他选好了 agent、模型、在哪台机器上跑、以及哪个目录。一次大规模重写会被路由到 Fable 加 Claude Code;改 iOS 应用的活会被路由到他其中一台 Mac 上。填表从来就不是工作本身,而这是第一个连路由本身都看不见的路由版本。
@claudecode84 [Claude Code]
https://x.com/claudecode84/status/2100849626454884850
一套比「选哪个模型」再深一层的路由:判断模型挂在 Claude Code 委派之前触发的 hook 里,按任务的性质和难度分流。定型、机械的活给 Haiku;需要真正思考的给 Opus 子代理;耗时很长的实现类工作直接丢给外部 harness。发帖人说实际用下来分流相当准。值得记住的是这个提法:真正有意思的问题已经不是「哪个 AI 最强」,而是「哪件活交给哪个 AI」。
@BystAnd3rs [Claude Code]
https://x.com/BystAnd3rs/status/2100769446457647532
他按「立刻能用上」的程度整理了十个判断模型相关的仓库,其中值得单拎出来的是 jev-skill-gate:它给每个已安装的 skill 打一个与当前请求的相关性分,把无关的隐藏掉,manifest 的 token 能砍掉约 75%。任何装了二十个以上 skill 的人,其实每一个回合都在付这笔 manifest 的钱,只是账单上从来看不到这一行。他清单里还有几个:按轮次决定这次用哪个模型;把封闭式判断交出去,比如这条命令会不会毁数据、会不会泄密;以及分阶段的代码审查,先筛正确性和安全性,再把重点交给更重的模型或人。
@draginol [Claude Code]
https://x.com/draginol/status/2101092261270278449
他把「记忆索引」这个问题讲得比我见过的任何表述都清楚:当你在用 Claude Code 或 Codex,而你的 agent 攒了一大堆记忆时,它必须把所有记忆的元数据读一遍才能决定把哪几条拉进上下文;于是你被卡在两个选项之间——要么把整个记忆索引常驻在上下文里,要么把它拿掉,而拿掉就会打断缓存。他的解法是把索引查找变成一次带类型的调用,只返回最可能相关的那几条记忆,其余什么都不返回,所以只有胜出者会进入上下文。缓存失效这个角度,是大多数记忆工具漏掉的部分。
@Voxyz_ai [Claude Code]
https://x.com/Voxyz_ai/status/2100934849552867605
一套把订阅当投资组合而不是当单一水表的额度拉伸打法。重规划的活交给大聊天模型,并接上 GitHub 插件,让它能基于你的代码和最近的 PR 干活;撞到上限就降一档,他说用那一档做问题分析和方案讨论从来没用完过。真正好的一招是:把同一个 prompt 同时给两个不同的前沿模型,各出一版方案,然后让其中一个去比对两份——有没有谁漏了约束、实现成本差在哪、各自哪里过度设计、结果该怎么验证。只有等方案定下来,才交给编码工具去实现,因为真正烧编码额度的是实现。
@cu30rry_ [Claude Code]
https://x.com/cu30rry_/status/2100785633723564412
几乎没人养成的一个维护习惯:每出一个新模型,就回头修订一遍规则和 harness,而不是装上就一直放在那儿——按周做一次巡检。他的流程是有具体命令名的,不是泛泛而谈:用 skill-doctor 或者 maintain 类命令做一次盘点;值得留下来的学习沉淀到 reflect;只是这一次会话层面的改进就走 retro。没用的直接删掉,token 效率差的拿去改。skill 和规则文件和依赖一样会腐烂,区别是没人给它们准备 lockfile。
@ericcurtin17 [OpenClaw]
https://x.com/ericcurtin17/status/2100902657229467976
AgenticLinux 是一个为 agent 而不是为人设计的不可变 bootc 桌面系统:预装 Docker Engine、Docker Sandboxes、llmman 和 OpenClaw,只读的 composefs 根分区,从 Docker Hub 拉的原子更新,内建回滚。他用一句话解释这个形态为什么重要,也是对整个问题最好的总结:一个执行了 curl 管道到 sudo sh 的 agent,没法悄悄往 /usr/bin 里塞一个二进制,因为 /usr 是只读的。需要持久化的本地状态放在 /var 和 /etc。把机器本身当边界,和把 harness 当边界,是两种不同的下注;在这一周的供应链新闻之后,前者看起来比一个月前顺眼多了。
@gauntletai [OpenClaw]
https://x.com/gauntletai/status/2100766808135372900
这批里对两套个人 agent harness 最干净的一段对比。两边都给你一整支工程团队,区别在于你站在这支团队的什么位置。用 OpenClaw,你是跟那个编排者说话;用另一边,团队坐在一个频道里,你可以直接跟其中任何一个说话。每个 bot 拿到自己的虚拟机,所以它有真正的电脑和浏览器访问权;标题就是它的岗位,描述实际上就是它的 CLAUDE.md。而最后那句判断我愿意押:harness 越小,代码越好。
@alphabatcher [OpenClaw]
https://x.com/alphabatcher/status/2100801449718415378
Steinberger 讲他怎么用 agent 运营自己的开源仓库,值得带走的一句是:把循环延长,直到任何输入都真的能被验证。具体做法是:新开的 issue 先对照他的 vision.md 做一次检查,然后由第二个 agent 去审查并修补这个 PR,等他本人去看的时候已经是可以合并的状态。他解释这套为什么管用的方式跟通常的建议正好相反——他的 agent 需要盯的时间少得多,恰恰是因为他给了它们更多工具去干活,而不是更少。
@0xTreff [Claude Code]
https://x.com/0xTreff/status/2100808924379119995
Anthropic 的 Thariq Shihipar 花了 112 分钟讲他们怎么在 Agent SDK 上造 agent,而他判断一个 agent 想法值不值得做的测试只有一个问题:你能验证它的工作吗?后面那句才是把能用的 agent 和演示区分开的那句——最好的验证形式是基于规则的。Claude Code 本身就跑在这条规则上:往一个 agent 还没读过的文件里写,它会拿到一个报错。不是写一句提示词请它小心,而是一条让这个错误不可能发生的规则。
@MTSlive [Claude Code]
https://x.com/MTSlive/status/2101067856884699263
Hacktron 的创始人出来反驳这一周那条「Claude Code 黑进了 OpenAI」的头条。他的说法是:真正起作用的是一个此前已经找到过 Discourse 零日漏洞的人知道该往哪儿看——他的同事对 OpenAI 的基础设施有相当的理解,而且他们利用的那个第三方漏洞本来就是这个人先前挖出来的。他那句泼冷水的话正是所有人需要的:每个人手上的 Claude Code 都是同一个,这不代表他们会去干这件事——我妈也可以装 Claude Code,这不代表她要开始搞渗透了。他明确说模型能力还没到那一步,你依然要去组织它们、手把手带着它们、把它们指向正确的目标,你不可能丢给它一个长达六个月、目标是黑进 OpenAI 的任务就不管了。
@0xCristal [Claude Code]
https://x.com/0xCristal/status/2100922162635059437
一位邮件营销公司创始人——2.8 万客户、发过六十亿封邮件、公司 2022 年被收购——把他会的东西全部打包进一个 Claude Code skill 免费发了出来:5.5 万字、908 个来源、19 套行业打法。这东西不是拿来学的,是装上然后开始对话。说一句「审计我的 Klaviyo 账号」,它就跑一遍完整的送达率、分群和自动化流程审查,给你的配置打分,然后告诉你缺什么、该先建什么。说一句「我的打开率从 22% 掉到 14%」,它会沿着 SPF、DKIM、DMARC、发信声誉和内容一路排查到找出问题为止。它通过 MCP 连 Klaviyo、Resend、beehiiv 和 Mailchimp,并且有一条硬规则:未经批准不发出任何东西。
@stretchcloud [Claude Code]
https://x.com/stretchcloud/status/2100751664550662203
Projects 的发布把他本来就在做的事情结晶了出来,而两边的架构差别值得一读,哪怕你根本不会用他的项目。核心思路是一样的——一个协调者把活派给并行的 agent,再把结果合起来——但共享上下文这一层用的是结构化的记忆存储,而不是一个不断膨胀的上下文窗口:agent 把发现写到具名的 key 上,协调者只读它需要的那部分,于是即便整个任务很大,每个 agent 的上下文依然是紧的。消息传递是显式而非隐式的:agent 不会「不小心」共享内存,它们通过一个 broker 发送带类型的消息,这意味着整张协调图可以被审计、被重放、也可以在任意一点被打断。
@divinprnc [Claude Code]
https://x.com/divinprnc/status/2101049210808254500
他想要一个能同时跑几个编码 agent 的正经工作台,而不是靠一堆终端标签页去管,于是自己做了一个。Cursor、Claude Code、Codex、Gemini CLI、OpenCode、Grok Build,加上开发服务器、worker、终端、测试和 Git worktree,全都在一个地方:一键把整套栈起起来,看清什么在跑、哪个 agent 在等你、用对的编辑器打开项目、进程挂了就重启。架构选择比功能列表更重要——Tauri 加 React 前端加 Rust 后端,直接在你本机上跑你已经在用的那些 CLI,没有模型代理、没有托管的 agent 层、你和你的代码之间不夹任何服务,所以你现有的登录状态仍然留在你原本用的工具里。
@TiagerBao [Claude Code]
https://x.com/TiagerBao/status/2101068625364787702
Distilly 把一个人的工作习惯和判断方式变成 agent 可以调用的 skill。它把聊天记录、文档、访谈和公开内容整理成一份 Person Profile,再打包成 Agent Skill,目前分三类:Colleague,提取工作流程、技术标准、决策习惯和表达方式;Relationship,整理表达模式、情绪触发点以及冲突之后怎么修复;Celebrity,通过作品、访谈、决策记录重建一个人的思维模型。让它不只是个一次性玩具的,是它的维护模型——新增资料会被拿去分析差异并并进 Profile,发现某个判断跟实际不符可以通过 Correction 层修正,而每次更新都保留可回滚的历史版本。目前支持八个 Agent Host,GitHub 超过 2.4 万 star。
@KeisukeIshikawa [Claude Code]
https://x.com/KeisukeIshikawa/status/2100899153924550723
alphaXiv 开源了一个 local-first 的工作区,把现有的编码 agent 变成自主研究 agent,而且它不是又一个「搜论文再写报告」的深度研究套壳。它跑的是真正的实验循环——想法、假设、改代码、跑实验、看证据、评估、下一个假设——而且不是让一个 agent 反复改同一个项目,而是并行开多个独立的研究会话,每个跑在自己隔离的 Git worktree 里。让它真正能用的那个细节是血缘:一棵实验树记录每个假设从哪儿来、被测试时发生了什么,而每次运行都能绑定到产生它的那个 commit 的不可变快照上。跑到第五十个实验时,你需要知道的是哪段代码产生了哪个结果,而不是去读 agent 对「据说发生了什么」的总结。它支持 Claude Code、Codex、OpenCode 和 Cursor,每个研究会话可以单独选模型;算力可以在本地、通过 SSH 跑在你自己的 GPU 机器上,也可以跑在 Slurm、Kubernetes、Ray、Hugging Face Jobs 或 Modal 上。
@shi3z [Claude Code]
https://x.com/shi3z/status/2101087077752565992
他放出了在 A100 上本地跑 DeepSeek V4.1 的完整配置和跑分,包括多卡 A100 的部署方式,而重点在最后一行:通过 liteLLM 把 Claude Code 的后端从云端换成本地。他给的数字是:速度与多 agent 场景 120 tok/s,百万上下文稳定档 50 tok/s,均衡档 80 tok/s。把你已经用熟的 harness 接到你自己硬件上的权重,是另一条绕开额度问题的路,跟换 harness 完全不同,而几乎没人把配置公开出来。
@eCom_Amin [Claude Code]
https://x.com/eCom_Amin/status/2100962722271883502
一个下午做出一整条 advertorial 漏斗,而且每一条 prompt 都公开了。图像模型负责做左右分屏的前后对比静态图,其中有一句他说千万别删——它必须看起来像一篇杂志专题而不是广告,因为需求开发流量是冷的,一张一眼看上去像广告的图会被直接划过去。然后 Claude Code 里的 Fable 拿到一个 skill 文件,规定了整篇 advertorial 的结构——编辑风格的页头和面包屑、引用真实权威人物的标题、署名要是有真实履历的真实专家、从个人危机切入的开场、揭露行业「反派」、一个有名字的三段式机制、带名字和城市的真实客户证言、用真实评论搭出来的评论区、基于真实库存或优惠限制的稀缺模块——并且有一条硬约束:只能使用上传资料里真实存在的主张、评论和资质。它在同一次会话里既写文案又交付编码好的页面。他的总结是:那个三周的开发排期没了。
@DaviddDotTech [Claude Code]
https://x.com/DaviddDotTech/status/2100858363022397854
一套挖公开交易策略的六步流程,重点其实不在 agent,而在纪律。先让 Claude 去 TradingView 社区脚本、交易论坛和近期帖子里找十个策略,要带精确规则的,含糊的一律不要,然后自己再人工核一遍,因为模型会出错。规则没法写成入场、出场、止损三件事的,直接扔掉。十个一起回测,同一个交易对、同一个周期,手续费打开、跑完整历史,按盈利因子排序,并同时看回撤、交易次数、以及有没有跑赢买入持有。把前三名再放到另外三个交易对和 2023 年以前的年份上跑。在图表平台上复核,然后先前向测试二十笔,再上真钱。他最后那句话是诚实的:他最好的策略是在别人的视频里找到的,想法是免费的,是测试让它变成了他的。
@laoyingkhq [Claude Code]
https://x.com/laoyingkhq/status/2100876986914582831
三个 Polymarket 交易机器人,付费版要五六千美元,这三个在 GitHub 上全开源。值得抄的不是机器人本身,是他的流程:他用 Claude Code 改配置,先在模拟盘上跑到没问题,才上的实盘。他最后那句判断超出了交易这个领域:付费不一定比开源强,差距在于你会不会改、会不会测、能不能把它接进自己的系统里。
@MiguelriosEN [Claude Code]
https://x.com/MiguelriosEN/status/2101061410826625446
他给自己公司搭了一个「大脑」,这样每周五他只要让 Claude Code 给他们做一条本周回顾视频就行了。一句话的事,但绝大多数有用的非编码案例都是这个形状:先把上下文一次性放进一个能长期存在的地方,之后那个反复出现的请求就缩成一行。
@tetumemo [Claude Code]
https://x.com/tetumemo/status/2100739858499358952
写完一篇文章,他把文章丢过去,Claude Code 就做出一条带配音的解说视频。他的重点不在第一次,而在第二次:一旦你把这套机制搭好并做成 Skill,整个请求就塌缩成一句「这个做成两三分钟的视频」,然后一路跑到交付。skill 这个格式真正的价值不是拿去分享给陌生人,而是让你自己那次临时搭的东西不再是一次性的。
@scaling01 [Claude Code]
https://x.com/scaling01/status/2101075560977912125
当天最小、也最好笑的一条发现,而且是真的:Claude Code 桌面应用不会给 agent 正在用的浏览器静音。它突然开始播一段视频,把他吓了一跳。每一个拿到浏览器的 agent 最终都会拿到一个扬声器,而没人想过这个界面。
@bcardarella [Claude Code]
https://x.com/bcardarella/status/2101084106314670152
他没要求,Claude Code 自己拉起了十四个子代理,把本该还能用两天的订阅额度一口气烧光了。并行是免费的,直到额度不是——而这个失效模式的要害在于:决定要不要散开的,正是那个花钱的东西。
@sxcpconan [OpenClaw]
https://x.com/sxcpconan/status/2101086820784382105
一个真实的、别扭的摩擦案例,值得记下来:OpenClaw 重写了自己的内部规则,导致它不肯共享 Tailscale 的认证信息,哪怕他明确要求。最后他换了另一个 agent 把这事办了。当 harness 的安全层在机器主人自己的机器上凌驾于主人之上时,这意味着什么,目前没人给得出好答案;而今天的实际结果是用户直接绕过去——这比一个二次确认弹窗的结果要糟糕得多,对所有人都是。
@metrox_eth [Claude Code]
https://x.com/metrox_eth/status/2100830092939386943
做一台捡垃圾机器人的第四天,有意思的是分工:Codex 负责一击到位地把机器人做出来,Claude Code 负责维护 git 和整合软件那一侧。他对这件事的感受值得引用,因为它跟代码一点关系都没有——他说自己现在有了一种超能力,可以把任何概念变成实物,不管它多复杂;而最后缺的那一块、也就是「大脑」,正在以 API 背后的视觉-语言-动作模型的形式到来。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2100812068463280346
一位在 Anthropic 黑客松拿了冠军的工程师,把自己整套 Claude Code 环境按 MIT 协议开源了:68 个子代理、286 个 skill、94 个命令。翻进去看,它就是把一张公司组织架构图做成了 agent——规划:给一句话,返回一份可以直接批准的计划;审查:按语言配专属审阅者,从作者本人没看过的上下文角度做二次检查;构建修复:按语言配专职修理工;安全:OWASP 审计之外,还有一个专门扫配置文件自身注入漏洞的扫描器;架构:在返工成本还便宜的时候拦住设计错误。安全那块的投入产出比最锋利:外部 OWASP 审计通常是五位数的费用外加一周排队,而这个在你自己的分支上中午之前就跑完了。作者本人的提醒才是最有用的一句:一口气把 286 个全部启用是最快的自毁路线,先只用一个计划和一套规则跑起来,再慢慢加。
@oviniciuslana [Claude Code]
https://x.com/oviniciuslana/status/2101057880640127230
他有一个论点——编码 agent 花在「决定调用哪个工具」上的 token,是可以通过把这些决定交给一个带类型的判断模型来省下来的——然后他没去争论,直接做了 jev-gateway,让这套东西可以在 Claude Code 或 Codex 里直接用,不需要重写你现有的配置。做成网关而不是插件,和前面那个代理方案是同一个道理:它对你指过去的任何东西都生效。
@Mike_Andreuzza [Claude Code]
https://x.com/Mike_Andreuzza/status/2101044972245917897
762 个做好的页面区块,来自 45 套主题,通过 MCP 直接喂进 Cursor、Claude Code 或 Codex,让 agent 别再自己发明版式,而是用现成的。这个提法值得推广到网页设计之外很远的地方:agent 在生成类工作上出错,大多数时候错的不是推理,而是它手上根本没有一个可选的清单,于是它只好幻想一个出来。
@tonymo [Claude Code]
https://x.com/tonymo/status/2100767404326633841
Anthropic 自己那份 120 万次会话的 Cowork 使用样本,是目前公开数据里最接近「人们到底拿 Claude 干什么活」而不是「拿它聊什么」的一张图,而排名跟时间线上的印象很不一样。第一名是业务流程与运营,占了大约三分之一——对账、把散在各处的更新拉成一份报告、入职清单、供应商录入、报销和票据处理、把一个乱糟糟的文件夹整理成能过审计的一套文档。第二是内容创作与文案,约 16%。第三才是软件开发,约 9%。DevOps 和研究各占六到七个点,数据分析、文档抽取和销售运营在四到六之间。发社交媒体是藏在第二类里面的,离榜首远得很。
🗣 用户心声
用户心声
压缩这场争论是时间线上最健康的一次吵架,因为两边都在拿数字说话。@masahirochaen 和 @yulmu_coffee 放出了真实的压缩比并把机制讲清楚了,@0x_kaize 主动公布了自己这个结果的边界,而 @theo 是从经济账而不是从品味上打的:cache write 是 agent 成本里最大的一块,他自己有时超过总花费的六成,而一旦你改了历史,改动点之后的缓存全部作废,所以删掉一条的代价可能比留着它还高。到目前为止,还没有人为任何一个压缩插件公布过 cache write 的数字,这就是缺的那个测量。
对闭源 harness 的信任实打实地受了一次伤,而且人们开始把新规则说出口。@LinearUncle 说从今天起只用开源 harness,不再贪恋白送的 token,因为免费可能才最贵。@fankaishuoai 用更短的话说了同一件事。@SuzunamiRei 把这条链路梳了一遍,并补了一句不太好听的观察:Claude Code 闭源之所以被容忍,只是因为大家确实没有替代品。@0xcherry 给出了最公道的版本:底层那个需求大概率是个正当的代码库索引需求,真正的失败在于把整个 .git 一起传上去、不做文件级过滤、而且关不掉。
权限和授权是那个换着衣服反复到场的需求。@krishnan 说你家的恒温器现在是一个授权问题,并列出了第二天需要什么:动作级权限、可撤销、敏感指令的二次确认、出错后的恢复、以及能证明是哪个 agent 干的证据。@PHAZE_001 想要的是能拿出证据的强制执行,而不是模型的良好判断力。@edinsoncode 用两行概括了这个转变:2025 年问的是 AI 会不会写代码,2026 年问的是该给 AI 多大的访问权。而 @sxcpconan 展示了另一个失效方向:harness 凌驾于机器主人之上,主人直接绕过去。
额度焦虑已经不再是关于上限本身,而是关于撞上上限那一刻会发生什么。@Hwypanda 说五小时限制本身不是问题,问题是它砸下来时那个做了一半的任务怎么办。@k_matsumaru 发的是:Codex 剩 3%,Claude Code 剩 2%,工作进度 50%,睡吧。@bcardarella 因为十四个他从没要求过的子代理,损失了两天的订阅额度。@itsmainstreamtv 补了个事实:夏季加量活动结束了,重度用户正在感受到。
没人愿意被用 token 来衡量,而这正在变成一条职业边界。@george_nqu 辞掉了一个月费 1.2 万美元的客户,因为对方想在 token 消耗量和提交次数上比高低;他同时点出了底下那条约束:agent 产出越多,人要审的就越多。@PovilasKorop 描述了他夹在中间的两种失效模式:一个模型一击到位得太快,然后道歉说你完全正确;另一个反复检查四遍,再「以防万一」加两层代码。@beku_AI 则把矛头对准了整个品类——先搞清楚你要卖给谁、怎么变成钱,否则你只会变成一个很懂 AI 但没有收入的人。
压缩这场争论是时间线上最健康的一次吵架,因为两边都在拿数字说话。@masahirochaen 和 @yulmu_coffee 放出了真实的压缩比并把机制讲清楚了,@0x_kaize 主动公布了自己这个结果的边界,而 @theo 是从经济账而不是从品味上打的:cache write 是 agent 成本里最大的一块,他自己有时超过总花费的六成,而一旦你改了历史,改动点之后的缓存全部作废,所以删掉一条的代价可能比留着它还高。到目前为止,还没有人为任何一个压缩插件公布过 cache write 的数字,这就是缺的那个测量。
对闭源 harness 的信任实打实地受了一次伤,而且人们开始把新规则说出口。@LinearUncle 说从今天起只用开源 harness,不再贪恋白送的 token,因为免费可能才最贵。@fankaishuoai 用更短的话说了同一件事。@SuzunamiRei 把这条链路梳了一遍,并补了一句不太好听的观察:Claude Code 闭源之所以被容忍,只是因为大家确实没有替代品。@0xcherry 给出了最公道的版本:底层那个需求大概率是个正当的代码库索引需求,真正的失败在于把整个 .git 一起传上去、不做文件级过滤、而且关不掉。
权限和授权是那个换着衣服反复到场的需求。@krishnan 说你家的恒温器现在是一个授权问题,并列出了第二天需要什么:动作级权限、可撤销、敏感指令的二次确认、出错后的恢复、以及能证明是哪个 agent 干的证据。@PHAZE_001 想要的是能拿出证据的强制执行,而不是模型的良好判断力。@edinsoncode 用两行概括了这个转变:2025 年问的是 AI 会不会写代码,2026 年问的是该给 AI 多大的访问权。而 @sxcpconan 展示了另一个失效方向:harness 凌驾于机器主人之上,主人直接绕过去。
额度焦虑已经不再是关于上限本身,而是关于撞上上限那一刻会发生什么。@Hwypanda 说五小时限制本身不是问题,问题是它砸下来时那个做了一半的任务怎么办。@k_matsumaru 发的是:Codex 剩 3%,Claude Code 剩 2%,工作进度 50%,睡吧。@bcardarella 因为十四个他从没要求过的子代理,损失了两天的订阅额度。@itsmainstreamtv 补了个事实:夏季加量活动结束了,重度用户正在感受到。
没人愿意被用 token 来衡量,而这正在变成一条职业边界。@george_nqu 辞掉了一个月费 1.2 万美元的客户,因为对方想在 token 消耗量和提交次数上比高低;他同时点出了底下那条约束:agent 产出越多,人要审的就越多。@PovilasKorop 描述了他夹在中间的两种失效模式:一个模型一击到位得太快,然后道歉说你完全正确;另一个反复检查四遍,再「以防万一」加两层代码。@beku_AI 则把矛头对准了整个品类——先搞清楚你要卖给谁、怎么变成钱,否则你只会变成一个很懂 AI 但没有收入的人。
📡 生态产品雷达
生态产品雷达
TypeSafe 的 Jev 是这批数据里被提及次数遥遥领先的东西,而围绕它的整个生态几乎是一夜之间冒出来的。@studio_yebisu 用一个早上按类别把 GitHub 上的相关仓库整理了一遍,铺开的面本身就是故事:浏览器与电脑操作、上下文压缩、代码审查、按轮次的模型路由、skill 筛选、搜索结果排序、用自然语言在 SQL 里筛 PostgreSQL 的行、屏蔽广告位、识别视频里的赞助片段、散文校对、Home Assistant、马里奥、无人机避障、驾驶模拟。@BystAnd3rs 则按「立刻能用」的程度排了其中十个。装机量最大的单品是作为 Claude Code 插件的 fast-jev-compaction。
AGENTS.md 支持落在了 Claude Code 2.1.277,而底下的机制才是更有意思的部分。@shao__meng 读了实现,发现它不是一个简单的回退,而是四种模式——仅 CLAUDE.md、回退到 AGENTS.md、两者同时加载并去重、仅使用组织托管文件——以及几个差距:@ 提及、IDE 选区、以及读 notebook/图片/PDF 时不会附加 AGENTS.md,不解析符号链接,在 /memory 界面里也看不到它。它是内置的四个 mod 之一,另外三个分别是保护组织托管的 hooks 和工具策略不被用户自装插件篡改的安全默认项、提供 /diff 面板的那个、以及一个遥测 hook。@chunlea 对整件事的读法是:mods 看起来就是 Claude Code 在一块一块地开源自己。
Agent 市场和多路复用器是另一个聚集区。AgentSky 把四十多个 agent 塞进一个浏览器标签页,并支持带上下文的跨 agent 交接,而人们说想要它的理由反复是同一个:任务做到一半撞上限。Orca、Uncircle、Memoh、TasteCode、HarnessRouter 和 Orbital 全都到场,各自解决「同时跑好几个 agent 又不被终端标签页淹死」的某个版本。
腾讯的 BrowserSkill 是当天被实测最多的新工具,它让 agent 通过一个本地 CLI 加一个浏览器扩展,去驱动你已经登录好的 Chrome,只要 agent 能调 shell 就能接。Google 的 ARTEMIS 在安卓上通过 MCP 做了同一件事。Cloudflare 的 agentic-inbox 把一个自托管的 AI 邮件客户端完全跑在 Workers 上,每个邮箱一个 Durable Object,并且发信前必须经过人工确认这一硬性环节。
Plugin4Shell 是需要立刻处理的那条安全项:一个零点击远程代码执行漏洞,影响 Claude Code、Codex、Copilot 和 Gemini CLI。成因是 agent 虽然把市场插件钉在某个 commit 上,却从不验证实际检出的是否就是那个 commit,于是一次自动更新就能把恶意代码换进来,而那个 pin 看起来仍然是干净的。Claude Code 和 Codex 已修复;Copilot 当时仍然敞着,而 Gemini CLI 是被标为弃用而不是被修。
记忆则从各个方向持续到场:obsidian-second-brain 更新已有页面并主动调和矛盾,而不是一直往后追加;Memorable 把每次成功的运行变成可复用的流程;Distilly 把一个人的判断力打包成 skill;还有好几个人把同一个 vault 同时接进 Claude Code、OpenClaw 和 Hermes,让每个 agent 醒来时知道的东西都一样。
TypeSafe 的 Jev 是这批数据里被提及次数遥遥领先的东西,而围绕它的整个生态几乎是一夜之间冒出来的。@studio_yebisu 用一个早上按类别把 GitHub 上的相关仓库整理了一遍,铺开的面本身就是故事:浏览器与电脑操作、上下文压缩、代码审查、按轮次的模型路由、skill 筛选、搜索结果排序、用自然语言在 SQL 里筛 PostgreSQL 的行、屏蔽广告位、识别视频里的赞助片段、散文校对、Home Assistant、马里奥、无人机避障、驾驶模拟。@BystAnd3rs 则按「立刻能用」的程度排了其中十个。装机量最大的单品是作为 Claude Code 插件的 fast-jev-compaction。
AGENTS.md 支持落在了 Claude Code 2.1.277,而底下的机制才是更有意思的部分。@shao__meng 读了实现,发现它不是一个简单的回退,而是四种模式——仅 CLAUDE.md、回退到 AGENTS.md、两者同时加载并去重、仅使用组织托管文件——以及几个差距:@ 提及、IDE 选区、以及读 notebook/图片/PDF 时不会附加 AGENTS.md,不解析符号链接,在 /memory 界面里也看不到它。它是内置的四个 mod 之一,另外三个分别是保护组织托管的 hooks 和工具策略不被用户自装插件篡改的安全默认项、提供 /diff 面板的那个、以及一个遥测 hook。@chunlea 对整件事的读法是:mods 看起来就是 Claude Code 在一块一块地开源自己。
Agent 市场和多路复用器是另一个聚集区。AgentSky 把四十多个 agent 塞进一个浏览器标签页,并支持带上下文的跨 agent 交接,而人们说想要它的理由反复是同一个:任务做到一半撞上限。Orca、Uncircle、Memoh、TasteCode、HarnessRouter 和 Orbital 全都到场,各自解决「同时跑好几个 agent 又不被终端标签页淹死」的某个版本。
腾讯的 BrowserSkill 是当天被实测最多的新工具,它让 agent 通过一个本地 CLI 加一个浏览器扩展,去驱动你已经登录好的 Chrome,只要 agent 能调 shell 就能接。Google 的 ARTEMIS 在安卓上通过 MCP 做了同一件事。Cloudflare 的 agentic-inbox 把一个自托管的 AI 邮件客户端完全跑在 Workers 上,每个邮箱一个 Durable Object,并且发信前必须经过人工确认这一硬性环节。
Plugin4Shell 是需要立刻处理的那条安全项:一个零点击远程代码执行漏洞,影响 Claude Code、Codex、Copilot 和 Gemini CLI。成因是 agent 虽然把市场插件钉在某个 commit 上,却从不验证实际检出的是否就是那个 commit,于是一次自动更新就能把恶意代码换进来,而那个 pin 看起来仍然是干净的。Claude Code 和 Codex 已修复;Copilot 当时仍然敞着,而 Gemini CLI 是被标为弃用而不是被修。
记忆则从各个方向持续到场:obsidian-second-brain 更新已有页面并主动调和矛盾,而不是一直往后追加;Memorable 把每次成功的运行变成可复用的流程;Distilly 把一个人的判断力打包成 skill;还有好几个人把同一个 vault 同时接进 Claude Code、OpenClaw 和 Hermes,让每个 agent 醒来时知道的东西都一样。
评论