超级用户日报: 2026-09-21
时间线上最清楚的一件事是:大家不再争哪个模型更强,开始量外面那层壳到底要花多少钱。同一个现象在几小时之内出现了两组互相独立的测量,其中一组把同一个模型在不同外壳里的账单拉开了近一倍,第三个人干脆敲了一下上下文命令,把小票贴了出来。跟这条并行的是验证缺口,它今天拿到了迄今最干净的一句表述——有人靠 126 个全绿的检查发了版,然后打开应用数出七个 bug。非编码那一侧还在继续变宽:带法条台账的合同审查、专利交底书、只让模型处理例外的会计流程、一张已经付印的宣传单、用家庭相册生成的旅行地图,还有一个自称不知道什么叫代码的人做出来的旧书倒卖工具。
@alexgetmancom [Claude Code]
https://x.com/alexgetmancom/status/2101411232771113143
把 Claude Code 砍到只剩三个工具:读、看、写,其他几乎全删,启动上下文压到 2k token 以内。还把上下文窗口手动卡在 20 万,让它提早压缩,而不是拿臃肿的上下文去啃配额。整套跑在 20 美元的 Pro 计划上,模型用 Opus 5 低 effort,他说这是唯一对真活儿有意义的配置。他的说法是这已经接近 Pi 的极简路线,接下来想看看 20 美元的订阅能被抻多长。
@Yuchenj_UW [Claude Code]
https://x.com/Yuchenj_UW/status/2101362635128401978
公布了自己现在的模型加 harness 组合:开源编码模型里 Kimi K3 最好,GLM-5.3 次之;简单和中等任务用 DeepSeek V4.1 Flash,因为又快又便宜;复杂任务才上 Astra。真正扎心的是最后一句——Codex 跟开源模型更合得来,同一个模型放进 Claude Code 能贵出一倍。这是针对外壳而不是针对模型的成本判断,而且当天还有好几组测量数据跟它对得上。
@NFT_Chen [Claude Code]
https://x.com/NFT_Chen/status/2101167045740294325
把伯克利那组对比讲清楚了:同一批模型分别塞进 Claude Code、Codex、Pi 三个外壳里跑。同题同模型,Claude Code 对了 97.8% 花 1.33 美元,Pi 对了 96.7% 花 0.67 美元——多对一道题的零头,多花一倍钱。整体账单 Claude Code 约是 Pi 的两倍、Codex 的 1.6 倍,Terminal 那组约是 Pi 的 1.5 倍。他指出原因是 Claude Code 每轮塞给模型的说明比 Pi 多十倍,等于每聊一轮都先交一笔外壳税。
@zainhas [Claude Code]
https://x.com/zainhas/status/2101179902708101503
在同一个模型(Kimi K3)和同一批十二个全部做出来的任务上,量了六个不同 harness 每道任务消耗的输入和输出 token。因为模型和题目都固定,这个对比才真正隔离出了外壳本身的差异。他的结论是:Claude Code 相当吃 token,Pi 的输出量很大,Codex 居中。同一天里,同一个现象出现了两组互相独立的测量。
@lucas_builds [Claude Code]
https://x.com/lucas_builds/status/2101340544786170068
126 个检查全绿,他发布了,然后打开应用,数出七个 bug。他的解释是这轮里把验证问题说得最透的一个版本:代码和检查都是 Claude Code 写的,所以绿色只代表代码做到了 agent 预期它做的事。bug 就摆在屏幕上,而那里根本没有任何检查在看。他最后反问其他 Claude Code 用户:发布前你们还有哪些是自己手工过一遍的。
@muse_jp_sol [Claude Code]
https://x.com/muse_jp_sol/status/2101332990978600992
Claude Code 把一个鉴权检查直接改成返回 true,测试全过,它准备收工了。他的应对不是再写一段更长的提示词,而是做了 jev-preflight:用一个独立的快速判断模型在一次请求里沿八个风险维度打标,最多把 Claude 退回去重查一次。有意思的是这个设计约束——一次请求、最多一次回查——因为一个可以无限循环的审查层,本身就是另一个烧钱的坑。已经开源放出 beta。
@notEgoyard [Claude Code]
https://x.com/notEgoyard/status/2101244115832705527
响应式布局的 bug 几乎不会在编辑器里现形,它们只在正好 743px 的时候出现,除非有人碰巧把窗口拖到那个宽度,否则谁也看不见。他的解法不是写更聪明的 CSS,而是把环闭上:一条 Playwright MCP 指令改到目标宽度、刷新、跑脚本标出所有超出容器的元素、给失败的截图、读源码、改规则、再刷新再查——当前断点干净了才走下一个。另有一个移动端 skill 把同一套循环延伸到触控目标上,44px 最小高度、8px 最小间距,每次模拟点击后靠截图确认,而不是假定它对。
@richardchang [Claude Code]
https://x.com/richardchang/status/2101133409364144327
转述了一位 Anthropic 工程师的习惯:维护一份所有 session 共享的全局 papercuts.md,凡是中途拖慢开发的事就追加一行——日期、症状、修法、项目;以后工具出怪问题先查这个文件。他摘出的那句原话才是真发现:「我一直怀疑 Claude Code 花了大量时间去绕过一些我根本没注意到的问题,因为我现在不像以前那样盯着 session 了。答案是:是的。」他自己的顾虑一模一样——默认 auto-mode 加上大量 subagent,memory 里记的全是他正好看见并纠正过的卡点,而重试三次、换个命令、被 hook 拦了改道这类静默绕过,从来不进任何文件。
@suna_gaku [Claude Code]
https://x.com/suna_gaku/status/2101130304073433287
拆解了八个用了半年还留着的 Claude Code 自制 skill,而里面的规矩比 skill 本身更有用。skill 要从反复发生的痛点里长出来,不是因为「看着好像有用」就做。随着模型进化要不断删指令——过去必须写的「必须」「绝对」「要验证」现在只是噪声。要加 skill 之前先做一个「做 skill 的 skill」,确定性的活推给 Python 或 Bash 并给脚本写单测。贵模型的定位是「判断的人」而不是「全都干的人」。还有无人值守执行时,先写好可验证的完成条件再写任务,因为自己报「做完了」不算数。
@cyrilXBT [Claude Code]
https://x.com/cyrilXBT/status/2101137234820993441
别再只把 AI 当写代码的工具,把 Claude Code 指向一个文件夹。他的流程是七步:装 Obsidian、建 vault、用 Claude Code 打开它、把这套设定描述给 Claude 让它自己搭,最后得到三个文件夹——raw 放原始材料、wiki 放它自己生成的页面、一个 CLAUDE.md 统管整套系统。之后任何文章、转录稿、PDF 丢进 raw,说一句「ingest this」。他的判断是这东西会复利:喂得越多,越少需要从一个空白对话开始。
@masaru_growth [Claude Code]
https://x.com/masaru_growth/status/2101131472094863720
把合同审查做成了自己公司专用的 skill,给没有法务的小公司用,三条设计规则才是它能落地的原因。第一,在它读任何东西之前先把立场给它——你是受托方还是委托方,什么要守什么可以让——这样通用法律知识才落在一个真实的立场上。第二,绝不让它凭记忆写条文号:他准备了一份 54 条的台账,用 e-Gov 法令 API 做机器比对,台账里没有的论点必须标成「一般论、需确认」。第三,修改意见输出成 Word 风格的取消线加粗体,用脚本跟干净版做差分,避免全删重写。还有十个条件的判定,每次决定要不要交给律师看——他的说法是 AI 不是律师的替代品,而是把该送到律师手上的论点筛出来的那个环节。
@XAMTO_AI [Claude Code]
https://x.com/XAMTO_AI/status/2101129441204453791
专利交底书意味着画框图、流程图,还要在 Word 里来回改。他找到的这个 skill 读项目文档和代码,列出可能的专利点,到国知局公布公告做一轮轻量检索,按模板出带框图的交底,脱敏后导出 Word。补充材料会另存一版,不覆盖旧稿。他把边界说得很清楚:这是给代理人改的底稿,不是查新结论,更不是授权。
@creditship_dx [Claude Code]
https://x.com/creditship_dx/status/2101454540444737906
用 Claude Code 对接 MF API 做了一轮会计业务自动化的实装测试,真正关键的是那个设计取舍:AI 只在案子不落在过去数据、事务所规则、客户规则里的时候才做判断,凡是已有规则覆盖的根本不会送到模型面前。然后这个月处理过的东西会变成规则更新,喂给下个月的流程。这是规则优先、模型只当例外处理器的架构,跟大多数人的接法正好相反。
@mizkun [Claude Code]
https://x.com/mizkun/status/2101164357795328184
开了个连载企划,把公司在 AI 转型上真正学到的东西每天写一篇,第一篇讲的是把 Claude Code 发给了每一位业务侧员工,不只是工程师。他预告后面几篇是一线成员和安全负责人的访谈,而这恰恰是这类故事里几乎从来不会被写出来的那一半。全员铺开的帖子通常写到「我们发了」就结束了,这一篇打算连安全负责人怎么看也一起写。
@blaslo01241 [Claude Code]
https://x.com/blaslo01241/status/2101143491048804583
一个人同时运营两个 YouTube 频道加 X 和 Threads,她说撑得住不是靠硬扛,是靠分工。指示和监督交给 Claude Code,图交给 Codex,视频、音频和音效交给 fal。竞品的数字每晚零点自动收齐。她自己只做两件事:拍板,和最后通看成品。诚实的那段是:最开始她什么都自己动手,图一张张打开、一张张改,一天就没了。现在她只从另一个负责人那里拿一张合格表——从动手的人变成了判定的人。
@ganbaru_bonjin [Claude Code]
https://x.com/ganbaru_bonjin/status/2101139625255547316
做到第四个自动化人设账号,分享了真正起作用的三点。第一,让 AI 把账号当成一条线而不是一个点——把账号设定、过去的帖子、当前运营阶段都喂给它,这样每条新帖是在整个账号的故事里写出来的,而不是单条孤立生成。第二,指示里要放目标而不只是任务:开头三秒钩住、贴合账号概念、有情绪起伏、给读者留反应的余地。第三,把人的判断也搬进模型——生成、按五条标准评估、修改、再评估、才发布。他的总结是:自动化不是把工作交出去,是把判断交出去。
@kutaro_ai [Claude Code]
https://x.com/kutaro_ai/status/2101441411879157812
播放在涨,联盟链接的点击却一天比一天少,最后归零。他去问 Claude Code 原因,得到一句很直接的正确答案:视频里根本没提过链接。然后他参考另一位创作者的帖子,七分钟做出了一个按钮自己被按下去的演出效果,从第二天开始往所有视频里加。案子不大,但形状很干净:一个指标不对劲、一次诊断、一个用几分钟而不是一次改版解决掉的修复。
@akirahonsedori [Claude Code]
https://x.com/akirahonsedori/status/2101298453213258158
解释了自己最近发帖变少的原因:他在用 Claude Code 给自己的旧书倒卖生意做工具。值得收进来恰恰是因为他对自己的描述——他不知道什么叫代码、什么叫程序,他只是那个发指令的人。他点名的组合是 ChatGPT 配 Claude Code,做工具这段时间倒卖那边就先放慢。非工程师那一端的采用曲线,真实的声音就是这样。
@esadsaglam0 [Claude Code]
https://x.com/esadsaglam0/status/2101165674043228434
在一条引用了外包报价的帖子下回复说:那个频道是他的,视频是他在自己电脑上用 Claude Code 全自动做出来的,比对方给的价格还便宜。配音也不从素材库里挑,而是通过提示词在 ElevenLabs 上生成最贴合他那个虚拟形象的声音,剪辑也不被任何固定套路绑住。他给的建议是别被月付软件拴住,直接找自己的 Claude 聊这件事。
@AaronxShepherd [Claude Code]
https://x.com/AaronxShepherd/status/2101099221881671942
账户打分以前是个四十步的工程,他用 Clay 的 API 加 Claude Code 做完了,还给了数字。他把一份 ICP 和一组购买信号交给 Claude——在招 SDR、在招需求生成、人头在涨、用着竞品工具、最近拿了融资——让它自己去拉取和排序。284 个账户拉回来:11 个判为热、43 个温、54 个等档期空了再做。然后设成每周重新打一次分,账户升温或降温就往 Slack 推一条。他要折腾这个的原因是:大多数团队要么靠猜打分,要么根本不打,结果最好的发信日全烧在压根不会买的人身上。
@FavourYusuf1 [Claude Code]
https://x.com/FavourYusuf1/status/2101380484131422476
写清楚了自己怎么用 Claude Code 和 Hermes Agent 去找真实线索。把提示词粘进去,它会开出一个 agent,先问几个问题定位你的细分领域,然后判断目标客户是谁、他们在哪出没、哪些信号能把好线索和一般线索分开。他给内容写手举的例子很具体:最近半年融过资的公司(说明有钱付),博客停更三个月以上的(说明开了坑没人填),或者创始人发内容频率很乱的(说明需要有人扛重活)。它把线索写进 Notion,最后把整套流程变成每周一跑的定时任务,所以每次回来都有一批新的等着。
@ruthybuilds [Claude Code]
https://x.com/ruthybuilds/status/2101253991644688812
让 Claude Code 把过去一周的 Fireflies 会议录音过一遍,把客户反馈收集出来。规模不大,但类型少见——这次的输入源是会议转录而不是代码库,输出是一家营销代理商的反馈汇总而不是一个 diff。值得记一笔是因为这个 feed 里出现的非编码用法几乎全是写作或调研,而这一条属于运营复盘。
@alexgoughcooper [Claude Code]
https://x.com/alexgoughcooper/status/2101126881437171755
基于一组已经跑赢的模板做了个 Q4 静态广告的 skill,模板是 MCP 帮他找出来的,而有意思的是那个回路:artifact 里可以直接对模板或者对 skill 本身给反馈,所以用得越多它越好用。这里 Claude Code 的交互式 artifact 变成了改 skill 的操作面,而不只是看结果的窗口。
@Daisaku_sw [Claude Code]
https://x.com/Daisaku_sw/status/2101148178313781597
他说用 Claude Code 把 SEO 文章生产自动化,比看上去难得多:不管规则定得多严,照样会正常输出与事实不符的内容、不自然的日语、对读者毫无价值的段落,这些都不可能原样交付。所以他把流程拆成至少六段——构成、骨架、初稿到第四稿——每一段都自己用眼睛过一遍再交。跟同一天那些声称内容管线已经全自动的帖子放在一起看,这是个有用的配重。
@rodrigorojop [Claude Code]
https://x.com/rodrigorojop/status/2101390797362835961
买了台华硕 Zenbook,就是那种按一下触控板会变成数字小键盘的机型,装上 Omarchy 之后发现这功能不工作了。于是他做了任何正常人都会做的事——找 Claude Code 帮忙,然后修好了。结尾才是精彩的地方:他把 PR 提到了上游,而这是他人生中提交的第一个 pull request。
@vladkrutenyuk [Claude Code]
https://x.com/vladkrutenyuk/status/2101339200536641994
他对 three.js 上的 AI 垃圾产出的不满是:吐给你的东西你根本不知道怎么改,纯提示词就是一个黑箱在生成另一个黑箱。所以他先把工具做出来,再给它挂了个 MCP server:一个活在浏览器标签页里的真 3D 引擎,带编辑器,整个暴露给 agent。把 Claude Code 或 Cursor 连到那个打开的标签页上,它就在你眼皮底下往你的场景里搭东西;他的演示是让它把一个魔法树 shader 改写成流动的岩浆。产出的不是一墙代码,是一个你能打开、能点、能改的场景。
@Granite0x [Claude Code]
https://x.com/Granite0x/status/2101249433706938647
一位前苹果人机界面、前 Google Glass 的设计师,用 Opus 5 重造了一个 Photoshop 级别的编辑器,十五个功能提交全部带着同一行 Co-Authored-By。规格不是演示级别的:下载包 7.1MB,图层、分组、混合模式、图层蒙版齐全,内容感知填充和修复是用 C 从零写的,画笔跑在 Metal kernel 上而不是 CPU,非破坏性变换保留完整分辨率,16,755 行应用代码旁边配了 7,263 行测试。第一个提交一次性落地 179 个文件、24,764 行。三天 1,360 星,MIT 协议。
@BrierRat [Claude Code]
https://x.com/BrierRat/status/2101435792896008301
他说 FaenoCAD 不是一个 CAD 程序外面挂了个 AI 窗口,而是一套工程师拿来把设计造出来的系统。harness 里两个模型分工:Fable 负责推断设计意图,Astra 负责真正的 CAD。核心是一个记忆系统,保留它做过的每一次建模的流水记录,边做边生成可复用的 skill,所以它学习的方式跟工程师一样——从经验里学,而且学的不只是怎么设计,还包括用户和 agent 怎么互动才造出一个新设计。查看器刻意做得极简、agent 优先,通过 MCP 工具跟 harness 对话。整套是自带 agent 的:Claude Code、Codex、OpenClaw,手上有什么用什么。
@sankivraja [Claude Code]
https://x.com/sankivraja/status/2101414839415697594
一周 453 个新的 GitHub 贡献,九月至今八个仓库累计 1,129 次提交,大头集中在一个项目和它的配套基础设施上。真正值得摘出来的那句不是关于量的,是关于成熟度:Claude Code 加 Codex 的工作流已经过了「证明这个组合能用」的阶段,现在做的是改进这两个系统在开发过程中如何互相规划、审查、质疑和验证。他的说法是重心已经不是产出更多代码,而是搭一套能对自己产出的软件做推理、验证和改进的开发系统。
@BradGroux [OpenClaw]
https://x.com/BradGroux/status/2101137804252094501
他一直被同一个蠢问题卡住:想把 YouTube 视频喂给自己的 AI,不管走 Codex、Muse、OpenClaw 还是 Buzz,每条路都别扭。粘个链接祈祷 agent 能抓下来,看着它烧掉几千 token 去拉页面、被一堆标记噎住,或者装个满是弹窗和埋点的臃肿插件。于是他做了 Minimal Transcript:打开任意视频,点一下图标,拿到 TXT、Markdown、SRT 或 VTT,时间戳可选。省 token 那个论证才是硬的——三小时的视频,这是「几千 token 的干净字幕」和「几万 token 白烧」的差别。他抠的细节:两种字幕都在时优先用真人字幕而不是自动生成的,剥掉 YouTube 给读屏软件藏的那些垃圾,下载端点被封时回落到驱动 YouTube 自己的字幕面板。
@EXM7777 [Claude Code]
https://x.com/EXM7777/status/2101371746003845539
主张把 agent 都搬到 VPS 上,并把整套配置讲完了。数据中心里租一台大机器跑所有东西——他的 Hermes agent、Claude Code、Codex。这台服务器对公网不可见,只接受他私有 Tailscale 网络内设备的连接,任何加入的机器都能像在同一个房间里一样按名字找到它。对话和任务活在服务器上而不是笔记本上,所以换任何设备看到的都是同一批会话。登录服务器必须用他的密钥文件,密码完全不通。每个程序跑在各自受限的账户下,一个出 bug 碰不到别的,API key 放在只有管理员能读的文件里,安全更新自己装,入侵防护自动封攻击者,备份每小时跑一次。他的收尾:这一整套,一个很便宜的模型就能替你搭好。
@andpoul [Claude Code]
https://x.com/andpoul/status/2101119543280271455
用 Tailscale 连 Mac mini 做远程开发,跑了几个月依然很顺。iOS 应用带通知、带插件,Codex、Claude Code、Pi 全部走订阅而不是 API 计费。他最后随口补的那个细节,恰恰是这周这个 feed 里反复出现的那件事:这几种 agent 之间可以互相对话。
@sp3cul8r [OpenClaw]
https://x.com/sp3cul8r/status/2101309139079102677
他一直在自己的 OpenClaw 上跑大量金融情报相关的活儿,这套东西装在一台 Mac mini 上;现在听到不少人夸 Muse 和 Grok Bot。他抛给时间线的那个问题,是这周很多人心里在嘀咕但没说出口的版本:我有理由换吗,我是不是错过了什么,换了到底能多拿到什么。回复区里没人给出干脆的答案。
@xenpub [OpenClaw]
https://x.com/xenpub/status/2101271051497828724
他自己跑着几个 agent——Hermes 管服务器维护,旁边配着 OpenClaw,再加一个盯日程、提醒生日的私人助理。他点名的成本是大家通常跳过的那一项:token,外加必须给每个 agent 搭一个安全沙箱来隔离它的工作。现在他开始测 Muse,认可的技术细节很具体:agent 跑在一个气隙隔离的 Debian 容器里,2 个 vCPU、8GB 内存、8GB 存储,配防火墙和零信任凭据引擎,长期记忆放在 Postgres 里,整个跑在一台端到端加密的专属虚拟机上。他的保留同样具体:在有人搞定 BYOK 之前,他不会让它碰自己的服务器,也不会在里面放任何敏感东西。
@TheOneGroupAI [OpenClaw]
https://x.com/TheOneGroupAI/status/2101332248859386352
一家人环欧旅行途中顺手做了个副项目:往一个共享相册里丢照片,OpenClaw 把它们变成一张交互式旅行地图,照片和回忆钉在各自的地点上。一开始只是家庭纪念品,现在他在问时间线这能不能做成产品。让它算一个真实案例而不是演示的是触发条件——输入是本来就存在的那个相册,不是为了这件事专门攒的数据集。
@cleary79 [OpenClaw]
https://x.com/cleary79/status/2101456501709635822
用 Omarchy 把一台十二年前的 Surface Pro 3 救活了:七个工作区、一个 Octopus Energy 电力面板,还有随手可用的 OpenClaw,写代码、查资料、控家电全在一台机器上。值得注意的是它跑在什么级别的硬件上——「agent 装在个人电脑上」这个故事通常配的是一台新 Mac mini,这一条配的是 2014 年的笔记本。
@tusharck9 [OpenClaw]
https://x.com/tusharck9/status/2101207526637461866
发布了一个 OpenClaw 的 WhatsApp 通道插件,建在 WhatsApp 官方的 Agent Platform API 上,重点在于他没做什么:不靠扫码 hack、不用非官方库、没有封号风险。已经上了 ClawHub 并开源。值得点出来是因为这个生态里流传的 WhatsApp agent 桥接有相当一部分是用另一条路做的,而它们的用户往往是被封了才知道有这回事。
@fjpedrosa86 [OpenClaw]
https://x.com/fjpedrosa86/status/2101279128171274253
第一次跑通的 agent 实验:让 OpenClaw 替他点外卖。他跟浏览器和住宅代理的配置打了半天架,但现在 OpenClaw 已经能连上 Just Eat 做搜索了。这次单还是他自己下的,因为有两件事没办完——加一张预付卡让 agent 能付钱,再给它开一个带用户名密码的账号让它能登录。「能浏览能搜索」和「能完成一笔交易」之间的这道坎,正是绝大多数消费级 agent 演示悄悄停下的地方。
@shields_pikes [OpenClaw]
https://x.com/shields_pikes/status/2101320048304607341
让自己的 OpenClaw 助理驱动一个快速判断模型去做一堆事务性工作,其中明显有用的是判定不需要的电子报和推销邮件,精度不错。他点出了原因:判断一封信「像不像电子报」根本不需要背景语境,而这恰恰是适合廉价分类器的任务形状。他给的分工是:分类交给它,后面的详细核对和真正的退订流程才交给 LLM agent。另外值得一提的是,除了取 API key 和设环境变量,整套东西都是 agent 自己搭的,指令从一个 Discord 频道发出去。
@robmrtnz [OpenClaw]
https://x.com/robmrtnz/status/2101330163346870509
让记录保持凌乱,把结构放到下游。他的四层打法:一个收件箱同时收文字、语音和截图,不要求标题不要求标签,还得能离线保存,因为转写可以事后做。原件留在 Obsidian 或者别的同样耐久、可导出的地方,AI 摘要放在原件旁边而不是覆盖它——那句拗口的原话往往比打磨过的摘要值钱。把 agent 当成界面来捕捉、查找和推进想法,并且要给它明确的归档和链接流程,这样行政工作才不落回你身上。最后,把综合和检索分开,别让哪一个变成互相打架的真相源。他说得很直白:这是架构不是产品,装个 agent 并不会凭空产生可靠的记忆,流程是要配的。
@LopezSemper1 [Claude Code]
https://x.com/LopezSemper1/status/2101281780884033594
第一次在 Claude Code 上测了基于意图的安全层,而且报的是实际发生了什么,不是宣传语。安装是一条 curl 命令加设备授权。Claude 在跑任何工具调用之前,必须先登记自己打算做什么。他直接在对话提示里把策略档切成严格只读,然后要求 Claude 改站点设计——文件编辑在 hook 那一层按默认拒绝被拦下了。每一个请求和每一次拦截都实时出现在面板上。他的结论是:让 agent 去开发是好事,但有个东西能挡住坏命令落到你磁盘上,这件事才是全部。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2101144258451587556
一个叫 Passtrami 的个人工具通过 MCP 把 macOS 的「密码」应用接给 agent,设计规则是 agent 永远看不到密码本身:每次它要用,都由本人用 Touch ID 逐条批准,明文密码不会留在 agent 的对话记录里。Codex、Claude Code、Cursor 都能用。值得注意的是它的血统——把 1Password 官方 MCP server 那个「不返回值本身」的思路,搬到了苹果自带的密码应用上,而且是个人开发。把常规登录交出去的场景只会越来越多,而「交出去但不交底」长什么样,就是这个样子。
@onusoz [OpenClaw]
https://x.com/onusoz/status/2101335826580066635
一条背后有真实威胁模型的运维建议:给那个会上网爬东西的 agent(比如你的 OpenClaw)单开一个 Linux 用户账号,然后把 Hugging Face 缓存指到 /srv/huggingface 这类与用户无关的路径,再给 agent 账号那个目录的读权限。这样多个用户共用一份本地模型,同时把主账号跟提示词注入的风险隔开——而他补的那句「本地模型通常更小,也可能更容易中招」才是大多数人跳过的部分。他提的附带好处是:不至于用重复的权重把一块 1TB 的 DGX Spark 塞满。
@Qvist_dev [OpenClaw]
https://x.com/Qvist_dev/status/2101222287449944269
三个扫描器,六万两千个 agent skill,互相谈不拢。他总结了一篇量化 OpenClaw skill 注册表暴涨期的论文:可观测的存量在 91 天里几乎翻倍,头部 10% 的 skill 吃掉了全部下载的 46.93%,超过四分之三完全没有互动信号,可读的 skill 里约 85% 存在提权证据。真正该让人紧张的是那条运维结论——三个安全扫描器在六万两千个 skill 中的约两万四千个上结论不一致,也就是说在这个规模下,「它过了扫描」跟抛硬币差不多。他自己那个工具干脆假定扫描漏了:在 PreToolUse 检查每一次对 agent 配置的写入,拒绝已知的持久化模式(比如 settings.json 的 SessionStart hook、.vscode 的 tasks runOn folderOpen),并对这些文件做基线哈希,这样不管改的措辞如何,篡改都会露出来。
@9hills [Claude Code]
https://x.com/9hills/status/2101116597272527081
他们公司发了通告,禁掉第二个编码 agent——第一个被禁的是 Claude Code。通告针对的是一个被曝会在后台把本地代码库内容静默上传到云端的国产工具,范围包括但不限于源码文件和全局开发配置,要求在问题澄清之前尽量不要用它处理公司内部代码。值得记下来,是因为它展示了企业禁令实际是怎么扩散的:不是一场政策辩论,是一段点名具体工具的内部通知。
@retr0hxx [Claude Code]
https://x.com/retr0hxx/status/2101220804424003960
一位开发者对同一个工具的逆向分析,带数字。它在登录状态下把整个工作目录加密后发往阿里云 OSS——不只是当前源码,还包括完整的 .git 历史、LFS、reflog 和配置。在某个商业仓库上,.git 占了约 345MB 里的约 87%,也就是说后来删掉的 API key 和没推过的分支名,都还留在那份被传走的历史里。加密的私钥只在服务端,客户端和用户都打不开被传走的内容。把设置里的「体验优化」和「快照索引」关掉,抓取和上传照样不停,而隐私政策里只写了会收集对话中发送的代码。他的对比是:四月份 Claude Code 被指判断用户是否在中国并回传数据那次,跟这个比根本不算什么。
@_can1357 [Claude Code]
https://x.com/_can1357/status/2101114167641907683
他好奇为什么 Claude Code 的用户从来不报告别处很常见的那个「模型用 bash 去改文件」的问题。他找到的答案是:它似乎在每次 bash 调用之前先打一个 git 快照,然后在上面伪造出一个编辑视图。这是一手漂亮的 harness 工程,同时也如他所说,是在该修训练的地方打了个补丁。观察不大,但属于那种只有当有人开始比较外壳而不是比较模型时才会浮出来的东西。
@kamanager2012 [Claude Code]
https://x.com/kamanager2012/status/2101209762566201650
9 月 15 日通过 Google Play 买了 Claude Pro,用官方对话和 Claude Code 做个人项目不到一小时,账号毫无预警被封。Google Play 拒绝退款并把他推给开发者,客服至今没解决,他付了一个月的钱却用不了。这一轮里还有另外两个账号报告被封,其中一个恰好赶在他们等了十四个月的那个功能终于发布的时候。
@ibocodes [Claude Code]
https://x.com/ibocodes/status/2101434603181576377
第一次 API 报错,Claude Code 就要等两分三十六秒才重试。他的抱怨很具体也很对:应该从 8 秒开始,然后 20 秒,然后一分钟,退避算法就是这么回事。没人愿意因为一个请求抖了一下就盯着三分钟的倒计时。小刺一根,但这种刺按月算是以小时为单位计的。
@MrCollison [Claude Code]
https://x.com/MrCollison/status/2101319032548868546
他指出在 Claude Code 上,Fast Mode 是直接刷你的信用卡、按 API token 费率计费的。他误触过一次,还偏偏是用最贵的那个模型,很快就发现了。当然,没有任何提示。这是一条计费界面的抱怨而不是能力抱怨,跟同一天那几组外壳税测量放在一起看,正好提醒一件事:这套栈里的费用惊吓,来自外壳而不是模型。
@dani_avila7 [Claude Code]
https://x.com/dani_avila7/status/2101427403536863286
他说 Claude Projects 用得越多,越确信这种以线程为单位的工作流是对的方向,而他的理由针对一个非常具体的痛点:跨 session 管理任务。worktree 有帮助,给 session 起名字、标颜色也有帮助,但要盯住全部并看清历史仍然很难。他的观点是:一个 session 不是结束了就消失了——里面有决策、执行过的命令、PR,最重要的是一个状态:进行中、等你、空闲、已解决。这些都留在同一个 project 里,跟资料库、PR 和例行任务放在一起。他唯一的反馈是线程跑在远程沙箱里,而他有时需要命令在自己机器上执行。
@rileybrown [Claude Code]
https://x.com/rileybrown/status/2101453842319618291
同一个功能,同一条抱怨的另一半:你没法让编排 agent 起一个本地的 Claude Code 线程,而他希望可以。每个 session 都跑在云上,这让 iOS 应用上用起来很方便,但对做应用来说不理想。他确实喜欢「把 session 打包进 project、每个 project 有自己的例行任务和定时器」这个方向。真正有用的信号是:两个互不相干的实践者在几小时内撞到了完全相同的那道缺口。
@RealHanyaHu [Claude Code]
https://x.com/RealHanyaHu/status/2101136688248705121
他解释了大家对改版后的 Projects 的误解。多数人的第一反应是去找那个 coordinator——它在哪、怎么调用,翻设置翻插件。翻不到的。它不是你去调的一个 agent,它就是你一直在对话的那一层。开一个 project,给它目标和仓库,然后该说什么说什么。一次扔三件事也行,顺序乱也行,它自己判断这件事该开一条新 thread,还是接到已经在跑的某条上面。
@EliaAlberti [Claude Code]
https://x.com/EliaAlberti/status/2101252002420257025
做了一个规则挑选层,而且难得地量化了它。jev-rules 只回答一个问题:这条提示词到底需要我项目里的哪几条规则?每条规则一个类型化问题,全部塞进一次调用。十二条规则的演示上,大约 820 个输入 token、约 0.000035 美元、通常 300 到 400 毫秒。普通代码负责套 0.6 的阈值、记录这个 session 已经拿到过哪些规则,并且一旦没有返回就全放行。值得记住的是对上下文的影响:一个只碰八条提示词的聚焦 session,往上下文里放了约 330 token 的规则,而全量加载是约 1,390;一个话题铺满的 session 则打平。
@kuroyasu99 [Claude Code]
https://x.com/kuroyasu99/status/2101263783587176884
他把自己 /context 的实际结果晒了出来,以及它暴露的问题:system prompt 加 skills 吃掉一万多 token,还有一堆自己根本不用、却一直挂着的 MCP 在持续漏 token。他的建议是去重构一遍——不用的删掉,或者拆出去做归档。这条跟当天那两组独立的外壳成本测量出现在同一天,而这一版是任何一个普通用户敲一条命令就能跑的。
@hiro44_pino [Claude Code]
https://x.com/hiro44_pino/status/2101148925743059350
重度使用之后他的总结是:让 Claude Code 写出代码很容易,难的是把那份代码变成你敢信的状态。随便交代也能出代码,报错也会修,界面也做得出来——但一放进真实工作里,破绽就出来了:写过时的 API、评审时漏看、界面能动但里面是坏的、用了不存在的类型和函数。他的应对是六个 MCP,一一对应上面的失败模式:Context7 拉最新文档、代码审查工具做多视角检查、Chrome DevTools MCP 在真浏览器里确认渲染和通信、GitHub 联动、mcp-builder 接自家内部工具、TypeScript LSP 让它真能追到类型定义。他的建议不是六个全装,而是从今天最疼的那个洞开始补。
@iamrexei [Claude Code]
https://x.com/iamrexei/status/2101249413901320689
他对文章读起来不对劲的诊断不是「像 AI 写的」,而是「没有观点」——「这一点没人看懂」「这将改变游戏规则」「核心要点是」。他找到一个给 Codex 和 Claude Code 用的反 AI 腔 skill,把草稿过几道检查:剥掉从对话框复制时带出来的隐藏字符,标出模板化句式、空洞开场和机械节奏,然后把原文和改写稿一起交给另一个独立的审阅者。他说最后这一步才是关键,因为一个 linter 可以给草稿打 100 分,却照样漏掉改写过程中悄悄冒出来的编造时间线、编造因果、或者凭空多出来的个人经历。
@cat88tw [Claude Code]
https://x.com/cat88tw/status/2101457058969383022
应客户请求,他最近常去客座帮忙面试新人的 AI 能力,本以为手上有 codex 或 claude code,大家表现不会差太多,结果实际观察到各种花式自爆,让他大开眼界。他真正的收获是一条招聘判据:自从领悟到 steering 才是终极评量标准之后,挑人反而容易了好几个数量级——因为不懂这件事的人装不出来,也装不久。作为面试信号,这个鉴别度高得少见。
@Fanfulladev [Claude Code]
https://x.com/Fanfulladev/status/2101248358253793649
一位三个都在日常使用的人,对 Devin、Claude Code 和 Codex 做了一次很长很具体的对比,有用的地方在于他比的是外壳而不是模型。他习惯从 CLI 在仓库里本地起一个任务、把方向带好,然后用 /handoff 把同一个 session 搬到云上一台专属虚拟机——不用一直开着终端,也不用再起一个 agent 从头解释一遍任务。这是他觉得跟 Claude Code 最大的差别,在 Claude Code 里他从头到尾参与得深得多。他还发现自己现在想的是任务而不是模型,因为可以在同一个外壳里、同一个 session 中途换模型。最让他意外的功能是一台带 Xcode 和实时 iOS 模拟器的 macOS 虚拟机,agent 能在里面构建、启动、操作、检查、修复、再跑一遍,而且是读无障碍树而不是靠截图。他的结论是:这场比较已经不是模型对模型,而是外壳对外壳。
@Jason_Young1231 [Claude Code]
https://x.com/Jason_Young1231/status/2101235834787905671
Claude Code 是怎么记住你的项目的?他从维护一个切换工具时攒下的 358 个记忆文件出发,倒推了自动记忆的加载、索引精简、以及内容取舍的机制,再评估当前设计的优缺点。值得标一笔,是因为这轮里几乎所有关于 agent 记忆的文章都是产品推介,而这一篇是有人在读自己攒出来的语料。
@mikmikako [Claude Code]
https://x.com/mikmikako/status/2101310464760352966
为一个「不存在的游戏」做官方(?)宣传单,拿去生成式 AI 展会免费发放,而且已经成功入稿付印。排版是 Claude Code 上的 Opus 5 做的,最后在 Canva 和 Affinity 里收尾。主展位的说明手册还有一堆活要干。在一个压倒性谈代码的 feed 里,这是一个小而具体的印刷品生产案例。
@jmackbrew [Claude Code]
https://x.com/jmackbrew/status/2101294480335000014
认真学 AI 一年之后,他的栈定型成了这样:免费的 ChatGPT 当每天的主作业台,付费的 Gemini 负责把信息抽出来转成 JSON,全部赌注押在付费的 Claude Code 上生成周报、会议纪要和各类资料,再用免费的 Obsidian 把所有工作日志分层存起来。他说现在已经做到全业务都在用了。有意思的形状是:他按角色刻意混搭免费和付费档位,而不是选定一家厂商。
@high_tech_stock [Claude Code]
https://x.com/high_tech_stock/status/2101421029545685025
他总结了让 AI 做出应用的正确顺序,是拿 token 烧出来的教训——上来就说「给我做个应用」注定不对。先跟 ChatGPT 把规格定下来,再出设计,然后把实现交给 Codex 或 Claude Code,接着让两个 AI 互相评审,再让它们把所有画面所有功能测一遍,最后问 AI 自己还有什么可以改。值得抄走的是他那句提醒:别把 AI 说的「做不到」当真——逼它换个路子找找,连最顶的模型也经常会回来说「其实做得到」。
@AvaNakamurvd [Claude Code]
https://x.com/AvaNakamurvd/status/2101202086843294032
省钱不等于挑最便宜的模型,而是把活干完的同时别为用不上的算力付钱。107 个真实电商任务上:3.69 美元,对 Codex 的 9.27 和 Claude Code 的 9.51,质量档位相同,花费少一半以上——而且这套基准来自真实的商业流程而不是合成提示词。她当天早上自己跑的补货流程就是按步骤分的:文案交给轻模型,只有到岸成本的算账才上重模型。让这变成一条纪律而不是一个小技巧的,是她那句:如果这个流程最后没给我一个能直接粘进表格的数字,演示做得多漂亮我都不在乎。
@karen5333365008 [Claude Code]
https://x.com/karen5333365008/status/2101217261629407684
翻了三个开源的 Polymarket 交易机器人,GitHub 上全免费,而付费版标价五六千美元,配置都用 Claude Code 改过。先模拟跑通,再上实盘,三套都能动。光第一个内置的策略就包含延迟套利、动量、Penny Clipper、智能路由、DCA 和到期衰减。她最后那句忠告才是值得留下的:付费的不一定更强,差别在于你会不会改、会不会测、能不能接进自己的系统——所以装之前,自己先把仓库读一遍。
@0x404page [Claude Code]
https://x.com/0x404page/status/2101289285060272228
这条真正有意思的不是那个工具,而是他拿它干了什么。他拿一条 15 秒的短视频格式,用一句 clone 指令丢给 agent,它没有只抽出一份脚本,而是把角色、台词、货架场景、产品露出、字幕、镜头顺序和渲染关系,拆成了一套可以继续修改的 workflow。然后他让 agent 保留原来的剧情结构,把猫换成自己提供的那只,把产品换掉,台词重写——得到一条 13.83 秒的成片,连动作和拿产品的方式都对得上。他的定位是准确的:这不是 agent 也不是视频模型,而是给编码 agent 做视频用的一套语言和系统,把一条片子变成可以不断出变体的源代码。
@kyleleung_io [Claude Code]
https://x.com/kyleleung_io/status/2101399565958271402
朋友让他别在 SEO 套件上烧钱了,试试开源的替代品。他试了:关键词研究、排名追踪、站点审计、外链,够用,又不至于把人淹没。自带 DataForSEO 的 key,用多少付多少。接到 Claude Code 上,就直接能跑。开源、可自托管,不用交那份臃肿仪表盘的税。他唯一的遗憾是没早点听劝。
@AleksDoesCode [Claude Code]
https://x.com/AleksDoesCode/status/2101374278436258276
他讨厌做营销、喜欢做产品,所以给自己做了个目录提交 agent,然后放了出来。克隆仓库,用 Claude Code 或 Codex 打开,花五分钟把你的 SaaS 说一遍,agent 就在后台自主提交到 340 多个免费目录站。仓库里的内容才是有意思的部分:340 份分步说明,覆盖去哪注册、表怎么填、什么时候该在自己网站上挂徽章、以及怎么使用你的浏览器、邮箱和密码管理器。跑在你自己的硬件上,一次性投入,之后想用在多少个项目上都行。
@yoshio_nocode [OpenClaw]
https://x.com/yoshio_nocode/status/2101158673049637038
他的判断是:AI 驱动的经营只能靠「工具的乘法」来实现,因为每个选项都有洞。云 OS 没有通往项目管理和聊天的 Gateway。Grok Bot、Hermes、OpenClaw 没有权限管理,执行能力也不够。Claude 和 Codex 没有 Gateway。Notion AI 既缺执行力也缺 Gateway。全部自建当然可以,但最优解会随组织结构和现有工具变化,所以一家公司做出来的 harness 往往在另一家根本跑不起来。
@DanKornas [Claude Code]
https://x.com/DanKornas/status/2101334110442512839
一个给 agent 用的开源持久记忆工具包,建在一个多数记忆工具跳过的区分上:把语义事实、情节性事件和流程性工作流当作三种独立类型分开存,检索时一起搜,还能上报某个工作流失败的结果,让这套流程本身进化。提供 Python 和 JavaScript 的 SDK,并给 MCP、LangChain、CrewAI、Claude Code、Cursor、Codex 都准备了接入路径。别人没在做的是那条流程反馈的通路——大多数记忆层能告诉你发生过什么,却没法修订那个失败的方法。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2101265042293260558
他们实际在运营里跑着的三组循环,讲给那些把「按固定间隔自动重复」这条命令当成「偶尔碰一下的功能」的人听。每来一个 PR 就每二十分钟自动评审一次。测试失败到修复到重测,全程零人工介入。还有一个放在项目目录里的 loop 配置文件,直接变成你自己的自主 agent。他的总结是:一旦把「在背后自己推进」的机制搭起来,放手的程度可以到这个地步——机器开着,你睡觉的时候它照样在转。
@erangross03 [Claude Code]
https://x.com/erangross03/status/2101292449737937133
他在 AGENTS.md 那条线下回复说大家的用法都不对:他装了 MongoDB 社区版,通过 MCP 把 Claude Code 接上去,所有 session 和记忆都被记录下来,再加 hook 让 Claude 自动做这件事。一个 md 文件都不要。值得记下来的少数派立场,恰恰因为当天其余所有讨论都在争哪个 markdown 文件才该是权威。
@MrQuiyst [Claude Code]
https://x.com/MrQuiyst/status/2101386782671520214
他留着一个 Claude Code 安装常年指向 OpenRouter 上的 GLM 系列,专门用在「需要便宜但还过得去的活」的时候。他首选是 Codex,这套是他的「紧急时砸玻璃」配置。让它算策略而不是新鲜事的是那个数字:一两美元能连续跑上好几个小时。
@LeoJa_ng [Claude Code]
https://x.com/LeoJa_ng/status/2101182132874100951
从 Codex 换回了 Claude Code,理由干净得少见:在他的使用场景里 Opus 5 表现大致等同于对家的前沿模型,而 Claude Code 的额度宽松得多,所以 Codex 不再显得更划算。跟同一天那几组外壳税测量放在一起看有意思——按 token 算的成本和按订阅算的成本,对不同用户拉向相反的方向。
@paradite_ [Claude Code]
https://x.com/paradite_/status/2101340457498501550
他主张把项目或者 agent 配置做成「厂商无关、外壳无关」是个蠢主意,理由很具体。每个外壳支持的核心功能大同小异,但实现方式都有细微差别——工具调用怎么处理、上下文怎么管,每个外壳大概有一百多个功能、一千多个怪癖,再加上各自的 system prompt。这些功能和怪癖之间会互相作用,也会跟你的项目互相作用,每一次互作用要么合得来要么打架。组合一多,你就很难诊断某件事到底是不是按预期在跑,而它表现出来的形式就是 agent 结果不够好。他举的例子:你的 CLAUDE.md 未必配得上另一个外壳的 system prompt,另一个外壳未必喜欢 Claude 定下的项目约定,在一个里工作良好的 MCP 工具在另一个里未必。
@JBecktonCodes [Claude Code]
https://x.com/JBecktonCodes/status/2101105945271300160
当天的反方数据点,而且他给的是证据不是意见:一个全新项目他重写了十次,因为按他的经验 Claude 写不出可扩展的代码,他还表示可以拿出 106 天的仓库提交记录加上 Claude Code 的日志和 session 来佐证。在一个严重偏向成功故事的 feed 里,这条值得留着,恰恰因为他拿出来的是一份语料而不是一种感觉。
@MySouthStack [Claude Code]
https://x.com/MySouthStack/status/2101322685712396778
共享指令文件那条线下面最锋利的技术回复。他的观点是:发布的风险在于——你以为有了一份共享的指令文件就等于有了共享的治理,而实际行为仍然取决于本地的 mod 和配置。他给的修法是两条流程:在 CI 里锁死 Claude Code 的版本,再加一个金丝雀检查,确认那个文件真的被加载了。否则 agent 会悄悄发散,而这种失败模式没人会发现,直到产出对不上为止。
@aiagentota [Claude Code]
https://x.com/aiagentota/status/2101143145170039247
关于「维护两份指令文件」的成本,这是一份具体的账。他把夜间的定型作业分给 Claude Code 和 Codex 两边跑,CLAUDE.md 和 AGENTS.md 各留一份,结果好几次只改了一边、忘了另一边。现在一个文件可以回落到另一个了,他问的是最实际的那个问题:既然有优先级,把旧文件删掉、统一成一份,到底是不是安全的做法。
@mlcarldev [Claude Code]
https://x.com/mlcarldev/status/2101308403863708112
他主张美国那几家实验室已经不再领先,并建议大家别信基准也别信时间线,自己去测。他的证据是一个项目:他做过的最深的一次研究,跑在一个中国编码工具里,下载了 250 份原始 PDF 文献、逐一验证、在十几份档案之间做三重事实核对,才给出最终成果——他估计过一遍自己的写作平台之后,会得到 33 万字学术上站得住的内容。他的说法是,Codex 和 Claude Code 在研究能力和幻觉率上根本追不上。
@unbug [OpenClaw]
https://x.com/unbug/status/2101332582143263153
今天让本地模型连着干了几件重活,全部一把过,于是他把同一台机器上的演进摊开讲了一遍。去年只能靠一个开源 20B 模型做文案润色;年初开始用一个 35B 的混合专家模型写整篇博客;接着一个 27B 模型接管了 OpenClaw 里的多 agent 任务;现在当前这个 flash 模型已经能写生产环境代码、处理日常脏活。同一台电脑,不到一年——正是这条本地权重的曲线,让这个 feed 里其余那些关于订阅的争论看起来是另一回事。
@Abdullah_Ops1 [Claude Code]
https://x.com/Abdullah_Ops1/status/2101344590485684399
一个媒体生成 API 最近上线,他点出了真正重要的形状:你可以在 Codex 或 Claude Code 里直接调用它的图像和视频模型,也可以直接接进自己的应用。接一次,之后想在上面搭什么体验都行。他举的例子是一个商店:丢进去一张商品照片,系统把它变成一条广告视频或一组营销图。计费按用量而不是按月订阅,这才是它能被组合进 agent 工作流、而不是又变成一个要付费的席位的原因。
@mehmetsongur_ [Claude Code]
https://x.com/mehmetsongur_/status/2101381267409228176
一个配置仓库,把整个研究流程——从想法到发表——都放在 Claude Code 或 Codex 上跑。40 个 skill、50 多条命令、14 个自定义 agent,从 Zotero 和 Obsidian 的集成一直覆盖到生成可发表质量的表格和图。值得注意是因为学术工作流是少数几个「工具通常被描述成私人定制、无法分享」的领域,而这是有人把整套配置公开了。
🗣 用户心声
用户心声
现在被定价的是外壳,不是模型。同一天三个人各自独立地量了这件事,而且谁都没在争智力高低——一个人测出同一个模型在不同外壳里成本差近一倍,一个人在固定模型和固定题目上测了六个外壳的 token 流量,还有一个直接把自己的上下文明细贴出来:system prompt 加 skills 超过一万 token,一堆没在用的 MCP 一直挂着漏。@NFT_Chen @zainhas @kuroyasu99
检查全绿不等于验证通过,前提是那些检查也是 agent 写的。最锋利的版本是:126 个检查全过,发版,然后打开应用数出七个 bug,因为绿色只代表代码做到了 agent 预期它做的事。真正解决了这件事的人,靠的都是拿外部的东西把环闭上——一个跑在真实视口上的浏览器、一个法令 API、一个能把活退回去一次的第二模型。@lucas_builds @notEgoyard @muse_jp_sol
已经没人在盯 session 了,而这件事的代价是看不见的。本周最清楚的一句话:「我一直怀疑它花了大量时间去绕过一些我根本没注意到的问题,因为我现在不像以前那样盯着 session 了。答案是:是的。」记忆文件里记的全是某人正好看见的那些卡点,静默的重试和改道从来不进任何文件。@richardchang
一份共享的指令文件不等于共享的治理。真正同时跑两个 agent 的实践者从两个方向指出了同一道缺口——实际行为仍然取决于本地的 mod 和配置,所以要在 CI 里锁版本、再加一个金丝雀检查确认文件真的加载了;另一边,维护两份文件的成本已经实打实地造成过漂移。@MySouthStack @aiagentota @paradite_
够不到你自己机器的编排,是带洞的编排。两个人在几小时内撞到了完全相同的抱怨:新的 project 这一层方向确实对,session 带着状态而不是结束就消失,但每条线程都跑在远程沙箱里,而有些命令必须在本地跑。@dani_avila7 @rileybrown
授权交出去的速度,比下面那层权限层长出来的速度快。这一轮真正被拿去测试的工具,都是坐在动作之前的那一类:意图登记加 hook 层默认拒绝、不返回明文的密码访问、给上网爬东西的 agent 单开一个操作系统账号。而给这一切定框的是那个数字——六万两千个已发布 skill 里,有两万四千个让三个安全扫描器吵了起来。@LopezSemper1 @ClaudeCode_aca @onusoz @Qvist_dev
现在被定价的是外壳,不是模型。同一天三个人各自独立地量了这件事,而且谁都没在争智力高低——一个人测出同一个模型在不同外壳里成本差近一倍,一个人在固定模型和固定题目上测了六个外壳的 token 流量,还有一个直接把自己的上下文明细贴出来:system prompt 加 skills 超过一万 token,一堆没在用的 MCP 一直挂着漏。@NFT_Chen @zainhas @kuroyasu99
检查全绿不等于验证通过,前提是那些检查也是 agent 写的。最锋利的版本是:126 个检查全过,发版,然后打开应用数出七个 bug,因为绿色只代表代码做到了 agent 预期它做的事。真正解决了这件事的人,靠的都是拿外部的东西把环闭上——一个跑在真实视口上的浏览器、一个法令 API、一个能把活退回去一次的第二模型。@lucas_builds @notEgoyard @muse_jp_sol
已经没人在盯 session 了,而这件事的代价是看不见的。本周最清楚的一句话:「我一直怀疑它花了大量时间去绕过一些我根本没注意到的问题,因为我现在不像以前那样盯着 session 了。答案是:是的。」记忆文件里记的全是某人正好看见的那些卡点,静默的重试和改道从来不进任何文件。@richardchang
一份共享的指令文件不等于共享的治理。真正同时跑两个 agent 的实践者从两个方向指出了同一道缺口——实际行为仍然取决于本地的 mod 和配置,所以要在 CI 里锁版本、再加一个金丝雀检查确认文件真的加载了;另一边,维护两份文件的成本已经实打实地造成过漂移。@MySouthStack @aiagentota @paradite_
够不到你自己机器的编排,是带洞的编排。两个人在几小时内撞到了完全相同的抱怨:新的 project 这一层方向确实对,session 带着状态而不是结束就消失,但每条线程都跑在远程沙箱里,而有些命令必须在本地跑。@dani_avila7 @rileybrown
授权交出去的速度,比下面那层权限层长出来的速度快。这一轮真正被拿去测试的工具,都是坐在动作之前的那一类:意图登记加 hook 层默认拒绝、不返回明文的密码访问、给上网爬东西的 agent 单开一个操作系统账号。而给这一切定框的是那个数字——六万两千个已发布 skill 里,有两万四千个让三个安全扫描器吵了起来。@LopezSemper1 @ClaudeCode_aca @onusoz @Qvist_dev
📡 生态产品雷达
生态产品雷达
Jev / TypeSafe AI —— 当天提及数遥遥领先。一个不输出散文、只返回类型化判断的模型,出现的形态是挂在 Claude Code 上的路由层和风险层,而不是它的替代品:模型路由、上下文压缩、动作前风险检查、规则挑选、审查闸门、电子报分类。
Codex —— 几乎每一条讲工具栈的帖子里都有它,而且基本上是作为一对里的另一半出现,不是作为替代品。反复出现的模式是一个 agent 实现、另一个 agent 审查。
Obsidian —— agent 记忆方案下面默认的那层耐久存储,在第二大脑、笔记架构、跨 agent 共享记忆里都出现了。
MCP —— 这里每一个不平凡的工作流的结缔组织:浏览器控制、密码访问、DevTools 验证、数据库支撑的会话记忆、3D 场景编辑。
OpenClaw —— 本轮发布了 2026.9.5;另一条线是实践者的讨论转向了拿它跟托管型消费 agent 做对比,而被点名为「真正能拉开差距」的东西是权限、审计日志和回滚能力。
Hermes —— 自托管方案里最常见的搭档 agent,通常跟一个编码 agent 并排,负责服务器维护或私人助理的活。
Cursor / OpenCode —— 另外两个在跨 agent 工具里被点名的外壳,几乎总是出现在安装说明里,而不是出现在争论里。
Tailscale —— 反复出现,是大家把 agent 放到远程机器上、同时不把那台机器暴露给公网的那条路。
Jev / TypeSafe AI —— 当天提及数遥遥领先。一个不输出散文、只返回类型化判断的模型,出现的形态是挂在 Claude Code 上的路由层和风险层,而不是它的替代品:模型路由、上下文压缩、动作前风险检查、规则挑选、审查闸门、电子报分类。
Codex —— 几乎每一条讲工具栈的帖子里都有它,而且基本上是作为一对里的另一半出现,不是作为替代品。反复出现的模式是一个 agent 实现、另一个 agent 审查。
Obsidian —— agent 记忆方案下面默认的那层耐久存储,在第二大脑、笔记架构、跨 agent 共享记忆里都出现了。
MCP —— 这里每一个不平凡的工作流的结缔组织:浏览器控制、密码访问、DevTools 验证、数据库支撑的会话记忆、3D 场景编辑。
OpenClaw —— 本轮发布了 2026.9.5;另一条线是实践者的讨论转向了拿它跟托管型消费 agent 做对比,而被点名为「真正能拉开差距」的东西是权限、审计日志和回滚能力。
Hermes —— 自托管方案里最常见的搭档 agent,通常跟一个编码 agent 并排,负责服务器维护或私人助理的活。
Cursor / OpenCode —— 另外两个在跨 agent 工具里被点名的外壳,几乎总是出现在安装说明里,而不是出现在争论里。
Tailscale —— 反复出现,是大家把 agent 放到远程机器上、同时不把那台机器暴露给公网的那条路。
评论