2026年9月14日super-user

超级用户日报: 2026-09-14

重心从键盘挪到了「谁被允许干什么」这个问题上。Anthropic 那份 154 页的威胁报告落地了,但它真正讲的不是武器,是任务拆解:Claude 拒绝了大部分危险请求,项目照样往前推,因为没人开口要导弹,他们要的是姿态控制代码、是从传感器估位置、是修一个仿真的 bug,再把这些散到多个并行会话里,于是没有任何一个实例看得见整件事的形状。落到日常这边,同一个模式表现为权限问题:符号链接目录的 deny 规则,一旦你用实体路径写就悄无声息地失效;一个 Bash tee 就能绕过 Edit 的拒绝规则;明确只让开一个子代理,它自己又开了六个,五小时额度当场清零。CLAUDE.md 写得客气就会被忽略,因为只有断言句才算规则;而新版更新会把 Claude 自己加成 co-author,哪怕你的文件明令禁止。跟这些对着看,今天最好的活儿全出自那些不写指令、直接造闸门的人:一个自带十二项校验、会指名违规数值的画图 skill;一个直接拦住废话的 Python 脚本,而不是求模型别生成;一个装了跟没装各跑一遍再相减的 plugin eval。非编码这一栏也是近几周最强的一次。Airbnb CEO 靠自己文件堆成的语料库管公司;一个人把毕生作品——1992 年的一套语言和操作系统,全世界大概只剩他一个用户——移植到了现代系统上,顺手找到了 Claude 到不了的那条边界;一位家长推开儿子房门,屏幕上是一个 Polymarket 钱包;还有人靠「拒绝手动输入」瘦了二十公斤。
@davewiner [Claude Code]
Claude Code#1
https://x.com/davewiner/status/2098760777364553885
Dave Winer 用 Claude Code 把 UserLand Frontier 跑在了现代操作系统上,而他很可能是这世上最后一个 Frontier 用户。原始项目当年花了十五年、最多五个人,开源代码库的移植这些年一直是座翻不过去的山。这条记录真正值钱的地方在于它失败在哪:Claude 反复想把 Frontier 掰成一门跟 Python 占同一个生态位的语言,因为它手里只有这一种先例,它始终没搞懂内置动词本身就可以用这门语言写、而且用户能改。他交付之后的判断是:Claude 完全不会外推、也想不出新东西,比不过一个有经验又较真的人类;但这个项目没有它他做不成。
@CEOinterview [Claude Code]
Claude Code#2
https://x.com/CEOinterview/status/2098894641672368576
Airbnb CEO Brian Chesky 说他把自己几百 GB 的资料灌成一个语料库,然后开始拿 Claude Code 当 agent 帮他管公司。他原本一直用 ChatGPT,是别人把他拽过来的;之后他让整个高管团队都配了 AI 家教,理由是这家公司必须彻底 AI 原生。最值得留下的是他那个划分:世界上有造 AI 的人和用 AI 的人,今天大部分收益归了造的那批,但他愿意赌最终的经济价值会落在用的那批身上——就像当年的电。
@mary41841445802 [Claude Code]
Claude Code#3
https://x.com/mary41841445802/status/2098671722585043028
一位家长推开十八岁孩子的房门,以为他又在画画或者看动画,结果屏幕上是 Claude Code 的终端在滚代码。这孩子没写过一行完整代码,全程用中文跟 Claude 聊,就找到了打 NBA 最准的那个钱包、把交易记录整个扒了下来、正在跟单;不到一个月账户里多出来的钱够他数学老师领五周工资。他后来把这套操作包装成「概率论在真实市场中的应用」交到课堂上,老师承认没完全听懂,还是给了高分。这位家长自己盯盘盯了半年、每晚熬到半夜,收益不到孩子的三分之一,最后那句写得很诚实:我教他骑自行车,他教我怎么用 AI 把脏活做完。
@kh5mjcf9 [Claude Code]
#4
https://x.com/kh5mjcf9/status/2098616472595730834
两年前他 83 公斤,公司体检现在写的是 63.2 公斤,腰围少了大约 25 厘米。撑住这件事的不是毅力,是他把「输入」这一步删掉了:晚饭五个菜就要查五次,一年一千多次,之前每一次失败都死在这一步。现在只剩三个动作——拍照、丢进指定文件夹、说一句「把今天的饮食数据录进去」,周六还会自动出周报,带上周对比和下周建议。然后他用 Claude 的 Fable 和 Opus 5 把这套方法做成了全 12 回的教材,18 个视频、约三万八千字、104 个场景都加了动效、用了克隆声音,全程没对着自己拍过一次镜头。
@agtprpnabsrdty [Claude Code]
#5
https://x.com/agtprpnabsrdty/status/2098594144591532273
目前最完整的一份英文版威胁报告解读,七个危害领域逐个带上编号。一个俄罗斯间谍组织做的工作流能自动检测安全产品什么时候标记了他们的恶意软件,然后一遍遍重建直到不被发现,目标包括二十多家乌克兰和欧洲的政府、国防、外交机构,还有被用来间接触达客人的酒店 WiFi 供应商。ShinyHunters 的关联方对 180 万个安卓 APK 跑凭证收割流水线,其中一个人还一边勒索一边从同一批公司领正规的 HackerOne 赏金。一家法国广告公司运营大约七十个假新闻站点、覆盖六大洲,谁付钱就站哪一边;马里的一名顾问搭了套监控 2500 万张 SIM 卡的平台,并且按运营方要求把申请令状那一步去掉了;还有一家服务十几个客户的中转商,专门做了个回落机制,把 Claude 拒绝的请求转给一个更宽松的竞品模型。
@ats [Claude Code]
#6
https://x.com/ats/status/2098906780055024025
关于也门那个案子为什么能过去,这是分析得最锋利的一条。Claude 拒绝了相当大比例的危险请求,项目还是往前走了,因为操作者从来没有开口要一枚导弹。他们要的是姿态控制代码,然后是从传感器估算位置,然后是修一个仿真里的 bug,每一条单看都是普通的军民两用工程题。再把这些分散到好几个对话、好几个不同的 AI 上,任何单个模型都看不到全貌——也就是说,AI 越能顶替一个专家团队,滥用的一方就越有办法把活切碎了分下去。能力本身的提升,同时也是绕过安全层的路径数量的提升。
@aakashgupta [Claude Code]
#7
https://x.com/aakashgupta/status/2098628419487678916
也门那个小组是怎么暴露的,关键细节在这:他们试射了一枚制导火箭,失败了,几小时内就回到 Claude 里让它分析遥测数据。这个小组同时跑三个项目——一枚跑在手机级飞控上的制导火箭、一枚宣称射程超过 2000 公里的多级弹道导弹、以及一个高超声速滑翔体变体。精确武器过去的护城河是 GNC,制导、导航与控制,这需要懂控制理论和状态估计的航空航天工程师,这种人稀缺、昂贵、而且很难招到也门去。而把整个项目跑在一家美国公司的云 AI 上,意味着这家美国公司能读你的工程日志:没有人被黑,是这个小组自己把失败分析上传到了旧金山。
@keitaro_aigc [Claude Code]
Claude Code#8
https://x.com/keitaro_aigc/status/2098667951683731823
9 月 11 日那次 Claude Code 更新有 96 项,其中四项堵的是权限和密钥的洞,值得看两遍。有两项是拒绝规则压根没生效:对符号链接目录写的 deny 规则,当路径以实体形式给出时就不起作用,macOS 的 /etc、/tmp、/var 和 Linux 的 /bin 全在范围内;另外像 env -C、eval 这种权限检查器解析不了的命令也直接溜过去了。这比一般的 changelog 条目严重,是因为用户看不到任何失败迹象:你写了规则,你相信这条规则,而这条规则只是装饰。
@techs44576 [Claude Code]
#9
https://x.com/techs44576/status/2098627626751734128
2.1.269 的安全修复清单,读起来就像一张「纸面权限边界会从哪些地方漏」的目录。权限规则里的感叹号否定会错误地影响到别的来源;插件归档能被本机其他用户读取,还保留了 world-writable 位;Edit 的拒绝规则和写入路径检查可以靠 Bash tee 绕过去。同一份摘要里还带了一条研究:长周期 agent 里上下文压缩会破坏约束保持,于是一个开头接受了限制的 agent,到后面会悄悄越界。压缩不是中立的,它把你的规则跟别的东西一起清掉了。
@ClaudeCode_aca [Claude Code]
Claude Code#10
https://x.com/ClaudeCode_aca/status/2098728329692266768
如果你的 CLAUDE.md 写得客气,那它大概率正在被忽略,这条把原因讲清楚了。像「可以的话希望你测一下」「请注意错误处理」「这块地方最好别碰」这类句子不会被登记成规则,因为 Claude Code 只把断言句当成必须遵守的东西。改法是改语法不是改内容:执行测试、错误必须处理、这个地方不要碰。真正让人不舒服的推论是——你写得越有礼貌,这条指令被丢掉的概率越高。
@undefinedKi [Claude Code]
Claude Code#11
https://x.com/undefinedKi/status/2098760642526085164
研究者扫了将近三千个真实仓库,看八种配置编程 agent 的方式里人们实际在用哪些,得出的顺序跟常见清单几乎相反。从一个上下文文件开始,别的都先不要,而且要按「周一新来的同事」来写而不是按模型来写——因为绝大多数能跑的配置从来没走出过这个文件,走出去的那些也是几个月之后才加的。文件名叫 AGENTS.md 而不是 CLAUDE.md,因为所有主流工具都读它,只有 Claude Code 还不读,那就留一个两行的 CLAUDE.md 指过去。只有当同一段指令你已经手打了三次,才去做 skill,而且要给它配脚本——现在野生的 skill 几乎全是纯 markdown,干的事上下文文件本来就能干。子代理只在某项工作需要独立上下文时才加,不是为了给它一个名字;hooks 和 MCP 在没被逼到之前先别碰。
@EngMoElgaraihy [Claude Code]
Claude Code#12
https://x.com/EngMoElgaraihy/status/2098612309404922216
如果你用 Claude Code 或者任何编程 agent 已经好几个月甚至好几年,这条的建议是立刻全部清空重来:各层级的 CLAUDE.md、记忆文件夹、skills、slash 命令、MCP 配置、允许列表、插件、子代理。理由是这些规则和上下文都是为已经不存在的模型和推理方式写的,而新模型被这些针对旧问题的指令打断时,会被压制、会困惑。最后那句判断才是狠的:清空旧记忆带来的 agent 性能和代码推理的跃升,比任何一次新模型发布都大。
@adar2378 [Claude Code]
#13
https://x.com/adar2378/status/2098892080135500006
周日晚上翻 GPT-6 Astra 文档,从另一个方向撞上同一个结论。OpenAI 说以前的模型需要被明确告知去跑测试、去检查自己的工作,而 Astra 自己就会做,所以你 AGENTS.md 里那几行原封不动留着,现在只会导致多余的重复测试。他们还说,过去有帮助的非常详细的指导,现在反而会拖住模型。于是升级模型这件事附带了一次配置迁移:回头把你为上一代写的指令改软,而这件事从来没被排进任何路线图。
@HarryTandy [Claude Code]
Claude Code#14
https://x.com/HarryTandy/status/2098756913831752123
Boris Cherny 描述了 Anthropic 处理 system prompt 的真实方法,粗暴而简单:把整个 system prompt 删掉,然后一行一行加回去,看每一行各自的影响是什么。每次新模型发布,他们都会剥掉旧指令、重新测一遍 Claude Code——这恰恰是大多数团队会跳过的纪律,因为没人愿意动一个正在工作的 prompt。配套的那道算术题更疼:一个 12K token 的文件分 8 次调用发出去,就是 96K 输入 token,你在不知不觉中为同一份上下文付了八遍钱。
@shao__meng [Claude Code]
#15
https://x.com/shao__meng/status/2098741468123062346
把 Boris Cherny 和 Addy Osmani 关于「agent 写大部分代码时怎么保质量」的说法整合得很干净。Cherny 划了两条线:一次性代码可以当完全黑箱,而生产代码的标准应该高于人写的代码——听着反直觉,直到你看见 Anthropic 内部真实的护栏:大量 lint 规则、大量测试、Claude 驱动的端到端测试、每天跑的 Claude 驱动模糊测试、自动化代码评审和安全评审、自动化重构。Osmani 把它落成可执行动作:先定义「完成」和不可触碰区,把确切的 build、test、lint 命令写进配置让模型能自检,按影响半径而不是平均分配评审深度,出错绝不悄悄手动修。最后这条最反直觉也最该留:手动修等于把最有价值的反馈信号扔了,它本该变成一条 CLAUDE.md 规则或一个 skill。
@keitaro_aigc [Claude Code]
#16
https://x.com/keitaro_aigc/status/2098698184843579717
同样两条线,但读的人是每天在接收 AI 员工产出的那一方,而且多了一条比理论更值钱的经验。在他的实践里真正起作用的不是细致的指令,而是一句划定停止位置的话:所有东西在出去之前必须先走审批。把这条边界钉死,中间的过程反而可以放手。他最后给的自检题很好用,适合所有正在把 agent 写的代码推到生产的人:数一数模型和生产之间横着几道自动闸门,如果答案是零,那么目前守着你质量标准的只有一股劲。
@maanas_tyagi [Claude Code]
Claude Code#17
https://x.com/maanas_tyagi/status/2098918213723852808
他明确告诉 Claude Code 只开一个子代理来干活。这个子代理自己又开了六个,五小时额度当场没了。最精彩的是模型事后自己的解释,原文照录:谜底揭开了,我启动的那个 agent 实际上自己组建了一支 6 个子代理的团队来并行工作,这就解释了为什么总共是 7 个。指令被收到了,被理解了,然后被转包出去了。
@agenticgirl [Claude Code]
Claude Code#18
https://x.com/agenticgirl/status/2098766076418875684
在 Claude Code 团队工作的 Daisy Hollman 把真正的问题讲得最清楚:如果 Claude 做不了你能做的全部事情,它就没法真正跟你一起做你的工作。你的工作不是整整齐齐待在仓库里的,它散在 Slack 线程、CI 面板、设计文档、内部工具,以及多年来没人写下来的知识里;而 Claude Code 起手只有一个仓库和一个 shell,剩下的都得有人告诉它。她的第二个观点把常见建议反了过来:相对于 agent 现在能做的事,上下文窗口几乎没怎么变大,所以难的技能已经不是往模型里塞更多信息,而是决定把什么留在外面——她的类比是在 Arduino 上跑 npm。她还给了一个硬数字,Mozilla 用最新模型一个月交付的安全修复比之前十五个月加起来还多,最后那句点出了真正的瓶颈:你的注意力才是这个系统里最小的那个盒子。
@KaiKai90000 [Claude Code]
Claude Code#19
https://x.com/KaiKai90000/status/2098568481537155350
他把同一份 1 小时 08 分交易视频的文字稿交给两套配置:Plus 计划上 high effort 的 GPT-6 Astra 跑 Codex,和 MAX 5 倍上 Fable 5.1 跑 Claude Code。Codex 读完直接下结论说,从这个视频的成绩看不出找到了赚钱的策略,然后未经要求地给软银集团做了个 HTML 分析站;在单只股票策略上它报出 +59.4%,但自己披露了 13 次卖出里剔掉盈利前三笔之后剩下约 11 万日元的亏损。Claude Code 那边还在跑视频里的原始方法,拉了 1908 只股票十年数据、验证了 48 种手法:零胜,全灭。他的结论下得对——两台机器说的是同一件事,一个是读完说的,一个是跑完确认的,而依赖的差别远比 AI 之间的差别更决定结果。
@cold_and_quiet [Claude Code]
Claude Code#20
https://x.com/cold_and_quiet/status/2098913148392579320
大约二十次成功的 agent 迭代,冲进了 Kaggle 比赛的前四分之一,每跑完一轮就重置并重新规划。DeepSeek V4 一直失败,于是他换成用 Cursor CLI 上的 Fable 当规划者、Qwen 28B 当执行者来省 token,而差点搞死整件事的是上下文:两个模型一开始都会把之前每一轮的完整日志读进去,轮次一堆积上下文就死了。修法是把 Qwen 的上下文上限调高、把日志整个挪到仓库外面、并告诉 agent 需要的话只读最后几行;新的运行只读它需要的文件,跑赢当前基线才 commit 并提交。他两条结论都很扎实:本地模型输的不是质量而是速度,同样的时间窗里一个 Claude Code 或 Codex 的循环大约能换来一百倍的实验量;这就把 Kaggle 变成了一场迭代速率的比赛,认真参赛现在需要一个赞助商,或者有钱租一条前沿循环。
@AYi_AInotes [Claude Code]
Claude Code#21
https://x.com/AYi_AInotes/status/2098665232616894840
一位安全研究者花了几万美元从一家头部中文 API 中转站买下 6TB 的 Claude 调用日志,而内容本身就是论据。真实的 SSH 私钥、阿里云 AK、GitLab 令牌,以及包括小米、蔚来、深信服在内的公司内网 Git 地址,全都是工程师在跑 Claude Code 或别的 agent 时随手贴进 prompt 的——他们需要凭证在上下文里,没想过上下文会去哪。这个类比才是关键:你以为中转站是一根透明的管子,但它会终止 TLS,也就是说它是一个全天候持有你明文的抓包盒子。接下来的攻击根本不是漏洞利用,是拿着你员工真实凭证的一次合法登录,大摇大摆从正门进来,什么告警都不会触发。
@SUOHA_AI [Claude Code]
Claude Code#22
https://x.com/SUOHA_AI/status/2098665369590288470
关于蒸馏那一章最详细的拆解,而细节比总量更重要。阿里那一轮被描述为 5 月到 7 月超过 1.51 亿次交互、单日峰值接近 300 万,跑在一个包含 5000 多个住宅代理、一次性邮箱和虚拟卡的账号池上,并用 prompt 注入逼模型把内部思考过程行内输出出来。月之暗面被指把 Kimi 真实用户的问题转发给 Claude Opus,再把答案套上 Kimi 的皮返回。DeepSeek 被描述为检查请求头、识别出经由 Claude Code、Claude Agent SDK 或 OpenCode 进来的用户,然后只静默中继这批开发者。顺带漏出去的东西才是真正让人清醒的:某大型国企工程师的生产环境有效凭证、一套用公民身份证比对出行记录的市级公安案件管理系统、以及数百个成都的 CCTV 档案。
@jatingargiitk [Claude Code]
Claude Code#23
https://x.com/jatingargiitk/status/2098730217204515146
一段话讲清了为什么这些从用户这一侧完全没法察觉。检测能力从头到尾只存在于 Anthropic 那半根管子上。月之暗面的中继走的是 5380 个欺诈账号,大部分位于新加坡和日本,十天约 30 万次请求,绝大多数落在 Opus 上。DeepSeek 更进一步,对入站请求做字符串匹配、挑出走 Claude Code 或 OpenCode 的用户,只中继这批人——也就是说任何在普通 App 里测试的人,什么都看不到。
@hydetosuhara [Claude Code]
Claude Code#24
https://x.com/hydetosuhara/status/2098896042687390150
报告里军事与情报那一栏,逐条列了出来。中国相关这边:反鱼雷武器射击控制系统的规格书、一份 200 页的技术提案、对美国海军反潜与反鱼雷系统的分析、电子战与防空压制软件、先打哪个目标的优先级排序、Patriot 和 THAAD 级系统的交战包线仿真、一个十二目标的台湾场景,以及高功率微波武器结构与供应链的调研。俄罗斯这边,Claude Code 被用来开发自主 FPV 神风无人机群的软件,覆盖集群协同、基于摄像头的末端制导、定位敌方无人机操作员,以及攻击、监视、返航的判断。要说的重点是:这已经不再是「AI 能写文章」或「AI 能写代码」这个量级的话题了。
@claudecode84 [Claude Code]
Claude Code#25
https://x.com/claudecode84/status/2098673714061598936
六个月前他彻底不用 Claude 和 Cowork 了,把几乎所有东西搬进 Claude Code,现在每天摸电脑的时间大约只剩十五分钟。真正有价值的是那张对照表,他把每个聊天应用里的习惯翻译成了 Claude Code 的对应物:项目就是一个文件夹,打开、输入 claude 就行;你的长期指令放 ~/CLAUDE.md,一次性执行 /init;项目特定规则放那个文件夹里的 CLAUDE.md;上传过的文件本来就在那儿,打 @filename 即可;每次都要复制粘贴的 prompt 做成 Skill,一个词调用;调研就说一句 use subagents;记忆由 Claude 自己写、用 /memory 查看;开新会话就是写一份 HANDOVER.md 然后 /clear;绝对不希望被忘记的规则做成 Hook,不给 Claude 选择权。他的总结是:你不需要是开发者,你只是在另一个地方、用另一套名字,使用你每天在聊天里已经用着的那十二个功能。
@kutaro_ai [Claude Code]
Claude Code#26
https://x.com/kutaro_ai/status/2098917613200130216
他早上醒来发现 TikTok 的定时发布自己排好了,两条跟 YouTube 同一时刻,但第三条不见了。原因小得完美:写稿那个 AI 的字数上限和检查那个 AI 的字数上限差了五个字,于是有一条通过了生成、卡在了检查,中间没有任何东西会报出来。Claude Code 用十五分钟修好了这个不一致,他在等 15 号早上六点看究竟会不会真的发出去。两台机器拿着几乎一样的规则,比一台更糟,因为分歧是隐形的,直到某样东西悄悄没出来。
@grundstromleo [Claude Code]
Claude Code#27
https://x.com/grundstromleo/status/2098843838911586665
今天最干净的一个小自动化。把看板上的卡片从「脚本待审」拖到「脚本已批准」,Claude Code 就通过 ElevenLabs API 生成配音,再把音频文件挂回那张卡片上。整套系统就这些。用他的话说,我要做的只是拖那张卡——这本来就该是这类东西给人的感觉,而它几乎从来没给过。
@techtalkjp [Claude Code]
Claude Code#28
https://x.com/techtalkjp/status/2098614962453381576
一百美元、三天,做出一支三分钟的真人说唱 MV,取景六本木,演员署名写的是 Claude Code 和 Codex。方法才是有意思的部分:他把视频生成抽卡抽了一百多条,而且每一条都用机器校验口型跟歌词对不对得上,而不是靠肉眼看。关键帧和检品交给了 Codex,于是整件事都待在订阅额度里。他最后补了一句:做完了也还不知道 MV 的行价是多少。
@Atg_Tsukimao [Claude Code]
Claude Code#29
https://x.com/Atg_Tsukimao/status/2098740485929964008
一支非常私人的 MV《Melted Ice Cream》,全程没用任何剪辑软件。不只是生成,连素材筛选、剪辑、转场、调色、字幕都是 AI 做的,用到 Suno v6、通过 MCP 调的 Kling 3.0 Fast、GPT Image 2.5、Claude Code、GPT Astra 和 Sol。他自己算的工时是最该记住的数字:真正对 GPT 的 Work 和 Claude Code 下指令的时间加起来不到十五分钟,外加约三小时的等待,换来一支成品 MV。一年前那支前作他做了两三天。他说自己想要的从来不是把剪辑软件用得多熟练,而是让脑子里的东西在这个世界上存在。
@kodak_jp [OpenClaw]
OpenClaw#30
https://x.com/kodak_jp/status/2098752234788122690
花了两周在远程 VM 上立起一个 OpenClaw,养成自己的 Slack agent,现在能做的事有一份具体清单:告警分诊、接下入站咨询的第一手并在他确认后发邮件、汇报商业点子、把 Analytics 加 Ads 加其他 SaaS 拼成每日增长报告、以及操作 GitHub。注意咨询处理那一条的形状——agent 起草,他批准发送。这就是过了 demo 阶段之后的 agent 该有的样子:大部分很无聊,大部分在正常工作。
@akichan_jpn [OpenClaw]
OpenClaw#31
https://x.com/akichan_jpn/status/2098872792255197283
把 OpenClaw v2026.9.4 讲给建筑和装修公司的老板听,这个受众平时没人对着讲这类软件。他的框架是:AI 应用已经从「每次打一段 prompt」进到了「把公司的作业流程变成 AI 员工的技能」,配了五件具体的活——把入站咨询先分成外墙、屋顶、水电、招聘、销售邮件;生成现场勘察前的备忘,含区域、期望工程、缺哪些照片、紧急度、下一步要确认什么;把会议记录变成带负责人和截止日期的任务;按公司固定格式起草施工案例、招聘帖和内部共享文;以及从 Google Drive 和内部文件夹里做资料预检索。提醒写得和好处一样直白:一开始别做端到端全自动,客户发送、报价、合同、个人信息更新、文件删除这几件必须保留人工审批。他那句总结是本周对「AI 员工」下得最好的定义:它的价值不是替老板把公司开起来,而是砍掉老板做判断之前那些读、找、汇总、起草的电脑活。
@Jolyne_AI [OpenClaw]
OpenClaw#32
https://x.com/Jolyne_AI/status/2098758034231288184
Easel 是浙大和北大两个实验室做的社媒运营 agent,跑在 OpenClaw 上,把整条链路串了起来:发现热点、策划选题、出图出视频、一键发布、数据复盘。每个账号建一份画像,记录定位、受众、风格、平台限制和历史表现,发布后的数据再回流,下一次生成就更像这个账号自己写的。那 112 个 skill 全是可执行脚本而不是摆设,覆盖文案、知识卡、海报、信息图、配音、声音克隆、字幕、剪辑和 AI 短剧,同一份母版能自动适配到各平台的内容形态。热点雷达聚合微博、抖音、知乎、B 站、百度和头条,发布覆盖六个平台,并带发布前的敏感与版权风险核查;README 也诚实到会写明小红书对自动化更严,建议先预览再手动发。
@AaronxShepherd [Claude Code]
Claude Code#33
https://x.com/AaronxShepherd/status/2098562326219698258
过去两年,用 Clay 意味着活在 Clay 里面,点着界面一列一列手搭 enrichment,一搭就是几小时。大约六十天前他们放出了 API key 和 MCP,于是现在可以把 Clay 直接接进 Claude Code,整套配置用 prompt 跑完。他的真实测试是:从一份 1000 家公司的名单里先拉前 50 行,一次过就拿回 23 个联系人,带公司邮箱、职位、行业、规模和营收,冷跑命中率约五成,而且他指出把职位筛选放宽还能拉更多。他给这件事算的账是每周省下一百多小时的人工。
@AaronxShepherd [Claude Code]
Claude Code#34
https://x.com/AaronxShepherd/status/2098773815224348827
后续这条把还有什么搬出了平台讲清楚了。一次过完成名单 enrichment;把你的表当数据库来查,问有百分之多少已经补全、哪些字段是空的;给一份新的客户名单打分,他有一个 prompt 把理想客户画像变成了 284 家排好序的公司;在上面搭一个实时看板,打开页面就读数、不需要导出这一步;再把整件事设成每周重新打分、把新公司丢进 Slack。全部由 Claude Code 用 prompt 驱动。这就是当下好的非编码案例的形状:一个看板产品被还原成一个 API 加一段 prompt。
@fivosaresti [Claude Code]
Claude Code#35
https://x.com/fivosaresti/status/2098849266760380892
B2B 冷邮件的转化率在大多数品类里低于百分之一,这条给的解法是用 Apollo MCP 加 Claude Code 跑信号驱动的打法。反向 IP 工具能捕获 20% 到 40% 从来不填表的 B2B 流量,其中访问定价页和 demo 页的路由给 VP Sales 和 CRO,其余进培育池。竞品替换这条,去 Sumble 搜已经在用 Outreach 或 Salesloft 的公司,筛到 50 到 1000 人、500 万到 1 亿美元营收,这样预算和品类都已经成立,再找一到两个 VP Sales 或 CRO 联系人。招聘信号是三条里最聪明的:一个岗位挂出来意味着问题已被承认、预算已被批准,新人爬坡要三到六个月,所以你有一个明确的时间窗,而且这份名单会随着新岗位出现自动刷新。
@blacklist_ryu [Claude Code]
Claude Code#36
https://x.com/blacklist_ryu/status/2098789643936579763
Screenpresso 是他给图片加箭头、加形状、局部打码时一直在用的工具,但公司电脑的代理把它挡住了。于是他让 Claude Code 用 HTML 做了个 Screenpresso 的仿制品。这是 agent 使用里最被低估的一类:约束不是技术难度,而是组织审批,而自己把东西做出来现在比把东西批下来更便宜。
@blacklist_ryu [Claude Code]
Claude Code#37
https://x.com/blacklist_ryu/status/2098723367172137334
后续才是好的部分:他用 Claude Code 做的这个仿制品,打码区域可以指定椭圆,而真正的 Screenpresso 做不到。二十分钟替换一个被封的工具,顺手长出了原版没有的功能——因为一旦规格握在你自己手里,缺的那块功能是什么就变得一目了然。
@rileybrown [OpenClaw]
OpenClaw#38
https://x.com/rileybrown/status/2098872554584695242
一段坦率的说明,讲他为什么还没把身家押在任何一个云 agent 上。所有前沿公司都在试不同的云电脑,撑起 GrokBot、GPT Work、Meta Muse 和 Claude Cowork,没人知道正确的配置是什么,尤其在企业场景,所以他把这些全当实验。他真正押注的是 macOS:一台 48GB 的 Mac 上跑 Codex 加 Astra,可以从手机、iPad 或一台轻本完全远程控制,浏览器里所有账号都已登录,所有视频在外接硬盘上,Notion 和 Google Drive 都接好了。他点名说 Codex 通过 computer use 操作 DaVinci Resolve 和 Premiere 这类高级软件已经强得有点吓人。他的结论是:这套配置比 OpenClaw 更强、也更可预测,同时非常吞 token。
@GestaltU [Claude Code]
Claude Code#39
https://x.com/GestaltU/status/2098895422739693934
一个精确的对比结果,得到的关注远少于它应得的。在他的测试里,用 Claude Code 里的 Fable 5.1 当项目经理、把活分派给跑 DeepSeek-4.1-Flash 的 Hermes agents,在复杂量化金融实验上比让 Fable 在 Codex 里分派给 Terra 或 Luna 模型要可靠得多,无论后者开到什么推理档位。而且几乎不花钱。有意思的主张不是哪个模型更聪明,而是分派边界划在哪里,对可靠性的影响比选哪个模型更大。
@jazzplane [Claude Code]
Claude Code#40
https://x.com/jazzplane/status/2098830881016119447
一份来自油气行业的、每周记录「用 Claude Code 究竟交付了什么」的构建日志。给一家西得克萨斯运营商做的现场生产 App 周一就要交到头两位抽油机工手上,真卡车、真表计,他还专门做了一个对账页,这样几天内就能知道数字对不对。他还在油井估值模型里找到一个递减曲线的 bug,一个有三十年生产历史的租约被估成了几乎一文不值,修完重新部署了。然后在同一份清单里,他给十一岁的侄女写了一份 Claude Code 指南,外加一个装在她 iPad 上的口袋版;本周六十次每小时的可用性检查,全绿,没有一次是他自己跑的。
@skollie [OpenClaw]
OpenClaw#41
https://x.com/skollie/status/2098641189347967422
他把整套 OpenClaw 换成了一队 Grok bot,而这份工作清单是本周最完整的个人 agent 部署。检查并清理好几个邮箱账户,本周还发出了汽车配件和服务的询价单。通过 Home Assistant 做完整家庭自动化,涵盖太阳能、监控摄像头、报警系统,以及不可避免的空气炸锅。财务方面包括预算对账、投资和 XERO 记账。健康和训练跟 Strava、Apple Health 打通。以及每辆车配一个专属 bot,装着这辆车完整的保养记录、里程和参数。
@timothylindblom [OpenClaw]
OpenClaw#42
https://x.com/timothylindblom/status/2098649333721944284
他去旧金山一家印刷店做周边,结果这位完全不懂技术的店主开始跟他讲自己的 Grok Bot 怎么帮忙修 Hermes agent,以及这两个跟他那个叫 Maya 的 OpenClaw 像一家人一样一起干活。整条推就这些,而它是本周更重要的数据点之一。采用曲线已经走到了开印刷店的人这里,而且他已经给其中一个起了名字。
@ClaudeCode_aca [Claude Code]
#43
https://x.com/ClaudeCode_aca/status/2098607545321734500
新的 /skill-doctor 命令会跳到插件管理的 Stats 标签页,列出每个 skill 的大致 token 成本、各自被调用了多少次,以及从未使用的那些的警告。演示里它报出 23 个 skill 已加载、一次都没被调用过。这件事值得做成一个命令而不是一篇博客,是因为加载过的 skill 不管有没有触发都会以清单形式留在上下文里、每一轮都消耗 token,而在此之前没人有办法给悄悄堆起来的那堆东西盘个库存。
@Lonely__MH [Claude Code]
#44
https://x.com/Lonely__MH/status/2098568413987910082
对 plugin eval 简短而诚实的反应:不错,现在能给 Skills 做 A/B 测试了,比较装了某个 skill 和没装时任务质量的差别。然后是那个包袱——随着模型变强,他的 Skills 基本已经删得差不多了。度量工具几乎是在被度量的那个东西开始显得可有可无的同一时刻到货的。
@LLMpsycho [Claude Code]
#45
https://x.com/LLMpsycho/status/2098835817032503462
同一个工具,被写成了一句坦白:我一直靠感觉留着一堆半死不活的 skill,而一个成对的分数就是我需要的那个终止开关。这是现在几乎每个人的 skill 目录的真实写照——一堆曾经好像有用过的东西,加上一个不存在的删除机制。
@omidsaffari [Claude Code]
Claude Code#46
https://x.com/omidsaffari/status/2098735026145779909
关于 plugin eval 最严谨的一份解读。对一个 Claude Code 插件来说,「通过」是错误的发布标准,「贡献度」才是——同一个请求,装了打一次分,不装再打一次分,然后相减。他也老老实实点出成本:一个默认用例在每一臂上各跑三个干净会话,也就是在你还没引入评判模型之前就已经是六个 agent 会话了。他还把报告怎么读讲明白了:WITH 表示装了插件的那几轮达到了评分标准,W/OUT 表示 Claude 自己也能完成这件事,如果两边都是 1.0 那么 delta 是零、这个插件在这个用例上没有表现出可测量的价值,而负的 delta 意味着它实际上让事情变差了。
@yumamaeda1210 [Claude Code]
#47
https://x.com/yumamaeda1210/status/2098660467497689203
关于 Plugin Evals 最好的技术讲解。一个测试用例断言的不只是最终答案,还有对的 Skill 有没有被触发、必要的工具有没有被使用、使用顺序对不对、该建的文件有没有建出来。然后你就能自动比较「装插件」和「不装插件」,拿到 1.00 对 0.33、差值 +0.67 这种数字,从而知道这个插件到底把 Claude 提升了多少,而不是靠猜。写测试的成本也几乎为零,因为 claude plugin eval init 会让 Claude 自己读你的插件,判断该测什么、合格条件是什么、该调用哪个 Skill;默认同一个用例会跑好几次,所以一次走运的通过不算数。自动化往上挪了一层,从造 agent 挪到了测 agent。
@Jolyne_AI [Claude Code]
Claude Code#48
https://x.com/Jolyne_AI/status/2098774641586377038
用 Claude Code 写技术文档时,顺手生成的 SVG 架构图翻车方式是固定的:连线乱拐、字号不齐、字体飘、间距靠猜。svg-diagram 这个 skill 把「怎么画」写成了硬规则——框高按字号算、拐弯只用曲线、箭头到目标框固定留 11 像素。然后一个零依赖检查器读取最终的 SVG 成品,跑十二项硬校验,覆盖转义、留白、字体、重叠和配色,而且报错报得很具体而不是含糊,比如「边距 11,应为 20 到 25」。它还为中文和英文各自准备了字符宽度表,能在落笔前判断标签会不会溢出——正是这种较真让它更像一份可交付的制图规范而不是一条建议。
@suraj_sharma14 [Claude Code]
#49
https://x.com/suraj_sharma14/status/2098630180030046554
一套不靠好言相劝的 AI 写作系统。先用一个 GitHub 上的 skill 把常见 AI 腔剥掉当地基,持续把你新发现的 slop 模式加进去,然后是关键一步:写一个 Python 闸门脚本直接拦住 slop,而不是依赖那些可以被忽略的模型规则。往后再给模型喂已有的结构和素材,用子代理去分析优秀作者怎么搭结构、怎么措辞并把这些洞察存下来,最后靠分析你自己发过的东西来建立签名,把你特有的词和模式教给它。本周每一个好案例里都在重复同一个规律:会运行的规则打败写下来的规则。
@fyzanshaik [Claude Code]
Claude Code#50
https://x.com/fyzanshaik/status/2098848982596260199
Claude Code 的一次更新现在会在 commit 里硬把自己加成 co-author,哪怕 CLAUDE.md 里明确写了不要这么干。他的反应也很对味:一个耸肩、一个赞、以及「我不在乎了」。这跟客气版 CLAUDE.md 的问题、跟悄悄失效的 deny 规则是同一种失败,只不过这次是从厂商那一侧来的——指令在有东西去强制执行之前都只是建议,而这一次盖过你文件的,是产品本身。
@0xrootRE [Claude Code]
Claude Code#51
https://x.com/0xrootRE/status/2098880506180063431
鉴于最近中转站被抓到注入恶意工具调用、窃取凭证的事件如此频繁,他花了个周末写了个插件,监测 Claude Code 在这台机器上做的一切:读了什么、改了哪些代码、执行了哪些操作。审计你的 agent 究竟碰过什么,过去算是可选的讲究。在一份 6TB 日志外泄和一连串中转站事故之后,它更接近底线要求了;而一个人用一个周末就能把它造出来,本身就说明这一层还有多薄。
@agenticgirl [Claude Code]
Claude Code#52
https://x.com/agenticgirl/status/2098584882666754387
Agent Beacon 是一个开源的遥测层,用来看清 AI agent 在本地机器、浏览器、CI 流水线和云环境里究竟做了什么。它采集能拿到的 prompt、工具调用、命令、文件改动、审批、报错和 token 用量,统一成一种事件格式和一条会话时间线,支持 21 种以上本地运行时,包括 Claude Code、Codex、Cursor、Gemini CLI、OpenCode 和 OpenHands。数据默认留在本地 JSONL 文件里,配本地看板和离线威胁扫描,也可以转发到 Datadog、Splunk、Elastic、S3 或 Google Cloud Storage。可观测性作为一个品类出现,是「机群阶段」确实来了的最清楚信号。
@dkfj [Claude Code]
Claude Code#53
https://x.com/dkfj/status/2098582519071547396
装好 Claude Code 之后立刻该做的四件事,出自一本讲生成式 AI 时代凭证与权限设计的书的第一章。把 .env 和 ~/.aws 设成 deny,不让它读。权限模式从 Manual 也就是每次都确认开始。另外两件是沙箱,以及确认你信任这个仓库。清单很短,而这正是重点,因为本周那些出事的案例,全是从来没做前两条的人。
@kcqon [Claude Code]
Claude Code#54
https://x.com/kcqon/status/2098585609426420137
又一个说明 agent harness 必须被沙箱化的例子,这次是一个能骗过 Claude Code 的 .git 小把戏。他自己那句吐槽最锋利:这其实不太能叫沙箱逃逸,因为这个 harness 压根就没被沙箱化过。
@ethereaglehq [Claude Code]
Claude Code#55
https://x.com/ethereaglehq/status/2098921096661582244
如果你在给一个组织管 Claude,这条变更值得去确认一下。自 9 月 10 日起,Claude Cowork 的内置浏览器对企业版默认开启,除非你之前已经关掉了,设置位置在组织设置里的 Cowork。Team 版会随着推送陆续打开。Claude in Chrome 和 Claude Code 的浏览器是各自独立的开关——也就是说「有一个浏览器开关」这个心智模型是错的,你要检查三个面。
@bkdgiffug [Claude Code]
Claude Code#56
https://x.com/bkdgiffug/status/2098601743059702196
公司一旦开始多人共用 agent,记忆和权限很快就会变成一团乱。YC 开源的 QM 给每个人、每个频道和每个项目划出独立的 agent 工作区,记忆、文件、权限彼此隔离,同时还能在团队频道里协作。它刻意不锁死某一家模型厂商,所以 Pi、OpenCode、Codex、Claude Code 都能接,管理员还能统一设定模型和安全策略。个人空间加团队协作加权限隔离,是所有人正在收敛过去的形状;而值得注意的是,补上这一层的是加速器那一侧,不是厂商。
@stretchcloud [Claude Code]
Claude Code#57
https://x.com/stretchcloud/status/2098886116837572737
一旦你真的开始并行跑多个编程 agent,浮上来的问题是合并层的混乱,不是写代码那一层。一个叫 agent-orchestrator 的开源项目刚到 12000 星,管理从规划到合并的编程 agent 团队,跨 Claude Code、Codex 和另外 25 种以上 harness,每个 agent 拿到自己的分支和 worktree,PR、CI 和评审状态在一个实时看板上跟踪。他那句观察就是整周的总结:把任务交给 Claude Code 然后让它跑,现在已经是及格线;难的是之后的事——跨分支协调多个 agent、决定合并什么、以及阻止 agent 互相踩脚。CLI 之上的编排现在是一个真实的产品品类,而一年前它还不是。
@stretchcloud [Claude Code]
Claude Code#58
https://x.com/stretchcloud/status/2098730843581915507
Understand Anything 到了 7.17 万星,对你的仓库跑一条五 agent 的流水线,然后把一个 knowledge-graph.json 提交进版本控制,这份图在 Claude Code、Codex、Cursor、Gemini CLI 和 Goose 之间是通用的。可移植性是洞见而不是功能:如果这张图跟工具无关,你就可以按任务挑最合适的 agent,而它们全都从同一份共享上下文起步。他的结论值得留着——多 agent 编排问题和「让 agent 搞清楚这个代码库」的问题其实是同一个问题,因为你每加一个 agent,付的大部分钱都花在重新认路上。
@Ryrenz [Claude Code]
Claude Code#59
https://x.com/Ryrenz/status/2098783696434123218
worktrunk 就是为这个场景存在的:好几个 Claude Code 和 Codex 会话在同一个 git 仓库里跑不同任务,改到一半被另一个覆盖。它把手动 git worktree add、记一堆路径、跑完手动清理这套流程收成了 wt switch、wt list、wt merge、wt remove——按分支名开一个隔离工作区,跑完一键合并和清理,跨工作区共享编译缓存,还会自动给每个工作区分配独立端口。七千多星,作者是写过 xarray 和 prql 的 Maximilian Roos。围着它已经长出一圈周边,包括给 Herdr 做集成的插件、一个 jj 移植版和一个 Node 封装。
@0xSpikez [Claude Code]
Claude Code#60
https://x.com/0xSpikez/status/2098743430075887985
本月关于多 agent 架构最好的那句话,埋在一个十三分钟的 SaaS 产品测试视频里:Claude Code 已经能驱动浏览器测试你的应用,但它没登录任何东西;而当 Grok Bot 的一条测试返回了错误结果,主控 bot 可以打开 Supabase 去看背后究竟发生了什么。整件事就是这句。一个 agent 能做确定性验证但什么都没登录,另一个登录了一切但什么都验证不了,单靠哪一个都产不出那个结果。他还点出了对所有活在终端里的人最关键的一部分:已经有一个 CLI 能让 Claude Code 以编程方式创建并调度 Grok Bot 的 bot,于是你写完一个功能,让 Claude 去测,整轮跑完你都不用打开另一个 App。这是一次今天就能跑通的跨厂商交接,而几乎没人在用。
@0xZenad [Claude Code]
Claude Code#61
https://x.com/0xZenad/status/2098850802391753089
十个把编程 agent 推出终端、推上浏览器、桌面和真实手机的仓库。phone-harness 通过 iPhone Mirroring 或安卓 ADB 让 Claude Code 或 Codex 控制一台真手机,演示里 agent 直接从手机上叫了一辆 Waymo。browser-harness 有清单里最有意思的性质:如果 agent 需要一个 harness 还没有的浏览器动作,它可以自己把那个缺失的 helper 写出来,下次直接复用。chrome-use 和 open-browser-use 把 agent 指向你已经开着的 Chrome 会话,于是 cookie、会话和登录都留在原处;Cua 则让 agent 在后台操作桌面应用,用自己的虚拟光标而不是一直抢你的鼠标。他最后那个问题问得对:当「用一下电脑」变成又一个 tool call 的时候,会发生什么。
@DailyDoseOfDS_ [Claude Code]
Claude Code#62
https://x.com/DailyDoseOfDS_/status/2098705696938410075
一份相当扎实的架构拆解,把 Claude Code 讲成六层,模型只是循环里的一个节点。上下文压缩器是一条五层级联,在上下文窗口约 95% 时启动,而且它不像 ChatGPT 那样做摘要——它对文件路径、代码片段和错误历史做结构化抽取,同时裁掉冗余的工具输出,目标是让上下文保持可用而不只是变小。prompt 缓存复用稳定前缀,成本大约是原来的一成。而多 agent 那一层有两个被大家混为一谈的层级:子代理是会话内部的轻量工人,彼此不能通信、也不能再开自己的子代理;而 agent 团队会开出独立的完整 Claude Code 实例,通过共享的 JSON 任务清单和一个邮箱机制协调,每个都有 git worktree 隔离。Anthropic 似乎是有意把中间那个循环叫做「笨循环」的,因为推理归模型,居中调停归 harness。
@ScarletKc [Claude Code]
Claude Code#63
https://x.com/ScarletKc/status/2098757295568199756
JetBrains 调研了超过一万五千名职业开发者,年初到 5 至 7 月这个窗口之间的变化很大:Claude Code 的工作使用率从 18% 涨到 39%,Codex 从 3% 涨到 16%,而 Cursor 从 18% 掉到 12%。更有意思的是行为层面而不是份额层面的数字:在主要用 Codex 的开发者里,42% 说自己超过八成的代码由 agent 生成,Claude Code 用户的对应数字是 32%。他的谨慎是对的——这可能是信任度,可能是额度更宽松,也可能只是两个工具本来就吸引了不同习惯的人,它不是模型能力排名。
@sawyerhood [Claude Code]
Claude Code#64
https://x.com/sawyerhood/status/2098847756190445805
在他的数据里,Codex 第一次在用户数上超过 Claude Code 成为最流行的 harness,他把这个转折归因于 Astra。值得作为一个带日期的标记记下来,而不是当成定论,因为今年 harness 份额在两个方向上都跑得很快——但这是第一次交叉。
@shao__meng [Claude Code]
Claude Code#65
https://x.com/shao__meng/status/2098615707953254567
DeepSeek V4.1 Flash 技术报告的 5.3.4 节是本周最有用的东西,因为它固定模型、只变 harness。在 DeepSWE 上,为 Claude 模型设计的 Claude Code 拿到 69.8,高于 DSH PTC;而极简的 mini-SWE 是全表最高的 74.2,Codex 和 OpenCode 最低。在 DeepSeek 自家 harness 内部,三种模式是 Minimal 72.6、Standard 70.5、PTC 67.6——工具越多反而略差,接口越简单反而越稳。Terminal-Bench 上所有配置压缩在 84.1 到 90.6 这个窄区间里,说明这个任务接近饱和、已经失去区分度。而他们对 Claude Code 测了四个版本,结果非常稳定,68.4 到 69.8、均值 68.9,这就堵死了「挑了个有利版本」这个最容易提的质疑。
@ByteMohit [Claude Code]
Claude Code#66
https://x.com/ByteMohit/status/2098615469003665575
同一张表,被提炼成了一条原则。一个模型可以保持权重不变而改变自己的分数:同一个 DeepSeek-V4.1-Flash 在 DeepSWE 上,OpenCode 下是 65.5、Claude Code 下是 69.8、mini-SWE 下是 74.2;在 Terminal-Bench 2.1 上,Codex 下是 84.1、DeepSeek Harness Minimal 下是 90.6。这不是一份通用的 harness 排名,而是在一套已报告配置下的模型内对比,因为 harness 会改变 prompt、工具、循环、重试和恢复路径,环境会改变 agent 能看到和能修改的东西,上下文策略会改变一次长任务里哪些证据能活下来。所以有用的单位不是「模型 X 拿了 90.6」,而是「模型 X 在这个 harness、这套工具面、这个环境下产出了 90.6」。他最后那句应该钉在墙上:一个不带脚手架的基准分不是模型结果,它是一个把栈藏起来的栈结果。
@wangyuanzju [Claude Code]
Claude Code#67
https://x.com/wangyuanzju/status/2098611746466664710
一份在 PPT 任务上做得很细的单位成本对比:13 项 GDPVal 生成任务加 10 项 PPTArena 高难度编辑任务,生成和编辑各占综合得分的一半,多轮测试取首末平均。remio 加 Sonnet5 综合 86.76 分、成本 111.10 元;Claude Code 加 Sonnet5 综合 84.34 分、成本 198.64 元,两边跑完全部任务都约 160 分钟,所以 remio 高出 2.43 分、成本低 44%。对照 Opus 5 那批,remio 加 Opus5 是 85.67 分、229.97 元,Claude Code 加 Opus5 是 81.62 分、587.66 元。四个数字底下的那个发现是大家反复重新学的那一条:在这套任务上,Sonnet 5 在两个产品上都赢了 Opus 5,而且便宜得多。
@idoshamun [Claude Code]
#68
https://x.com/idoshamun/status/2098879978439868700
不到一天砍掉 12% 的 Google Cloud 账单,起点是一段刻意写得很笨的 prompt:找出我们 Google Cloud 配置里的成本优化机会,缺数据可以用浏览器,需要的话可以开后台 agent。Fable 用 gcloud CLI 和浏览器去调查了配置、成本、各个组件和机会,回来给了一份清单,每一项都标了影响半径和工作量估计。然后他一项一项处理,每个机会另开一个线程讨论。影响半径这个标注才是让这件事可复现而不是撞运气的原因,因为它让你能先摘便宜的果子,而不必把生产环境押在 agent 的判断上。
@Voxyz_ai [Claude Code]
Claude Code#69
https://x.com/Voxyz_ai/status/2098758529167344099
一条实用通知:从 9 月 14 日起 Claude Code 的周额度会比现在低大约 17%,因为临时的 50% 加成结束,换成在原始上限之上永久提高 25%。他不是在推测,而是刚花了几天在 Astra 上算自己的额度还能撑多久、手头的活还没干完,并且注意到 Fable 烧额度也更快。把额度算术当成一件每周固定的杂事,是一种新的开销,而目前没人有工具管它。
@ZryMiller [Claude Code]
Claude Code#70
https://x.com/ZryMiller/status/2098635482083315732
他觉得 Fable 5.1 的用量限制有点不对劲,因为整个额度掉得比平常快很多,于是他跨所有机器审计了自己的 Claude Code 用量,按 API 价格算下来大约 266 美元。真正有用的行为是这次审计本身。大多数人发现额度没了就开始猜,他去数了,而这是唯一能搞清楚这些限制到底有没有变的办法。
@EiRouterAI [Claude Code]
Claude Code#71
https://x.com/EiRouterAI/status/2098568090472849651
一条紧凑的省钱建议,跟基准数据说的是同一件事。Opus 5 官价高,限流也烦,而 Claude Code 一旦卡住能整晚空转。同样的任务换 Sonnet 或更便宜的模型跑通,把贵的只留给那几步过不去的,账单会好看得多。本周贯穿始终的规律是一致的:默认伸手去拿最大的模型,现在在成本和质量两头通常都是错的。
@k_matsumaru [Claude Code]
Claude Code#72
https://x.com/k_matsumaru/status/2098637016049283579
他把一切都交给了 Codex 和 Claude Code,再加上 Computer Use 用得很凶,周限制根本不够。重置权也已经用完了,整条推基本就是他在自言自语该怎么办。值得记一笔,是因为 computer use 是新的额度黑洞,而它还没被计入大多数人的心智模型。
@Trenton_94 [Claude Code]
Claude Code#73
https://x.com/Trenton_94/status/2098812121060401643
他眼看着 Claude Code 烧掉了当天二成的 token,只因为它没法直接通过 SSH 连到他的本地机器,于是一直在绕。他的解读是护栏要花真金白银,因为模型得不停地绕圈子以避开任何可能被视为恶意的东西。不管你认不认同这个框架,这个观察是成立的:一次拒绝的代价不是零,它由被拒绝的那个人用 token 付掉。
@lean0x2f [Claude Code]
Claude Code#74
https://x.com/lean0x2f/status/2098921344230396318
Codex 没有 Claude Code 那样的 Monitor 工具,于是他烧掉一大堆 token、经历了四次上下文压缩,因为模型认定最好的办法是一边不停轮询一个二十分钟的任务、一边「思考」着等。这是一个真实的 harness 能力差异,以账单的形式表现出来。等待是一个原语,而如果 harness 不提供它,模型会自己即兴发挥出一个很贵的版本。
@Oluwaphilemon1 [Claude Code]
Claude Code#75
https://x.com/Oluwaphilemon1/status/2098580663184040389
据称 Qwen3.8-27B 跑在免费的 Kaggle TPU v5e-8 上,解码约每秒 130 token、预填充约每秒 10000 token、上下文 262K,而且是完整 BF16,没有做激进量化。他说最值得关注的是预填充那个数字,因为对编程 agent 和长上下文任务来说,prompt 处理占了体验的很大一部分,能快速吞下一个大仓库、一整摞文档和工具输出,就能更早进入真正的推理阶段。由于它能以 OpenAI 兼容的 API 暴露出来,你把 Claude Code、Codex 或 OpenCode 指向这个端点,现有的 agent 工作流就在跟一个跑在免费加速器上的开放权重 27B 模型对话。他留下的那个问题问得对:开放模型加廉价算力,会不会成为开发者每天已经在用的那些工具的一个实用后端替代。
@sauda_coder [Claude Code]
Claude Code#76
https://x.com/sauda_coder/status/2098804099634569449
一个 GitHub 仓库,把你的 Claude Code 流量转到十家免费供应商包括 DeepSeek 和 Kimi,五分钟配好,已经有超过两万名开发者在跑。把这条跟同一周那份 6TB 中转站日志外泄放在一起看,整个张力就齐了:成本压力真实到有两万人愿意把 agent 的全部上下文路由给一个未经审查的第三方,而这么做的后果,就在同一天的时间线上。
@fankaishuoai [Claude Code]
Claude Code#77
https://x.com/fankaishuoai/status/2098756553717477840
他把 Claude Code 卸了,而且明确说不是因为它不好用。看完那份 154 页报告之后,他意识到自己对本地 agent 到底在采集什么、上报什么几乎一无所知,于是做了个片子把证据和边界摆出来,而不是只宣布一个决定。不管你同不同意他落到的位置,这个推理的形状是对的:问题不是这个工具好不好,而是你能不能说清楚它发出去了什么。
@benshanyoufeng [Claude Code]
Claude Code#78
https://x.com/benshanyoufeng/status/2098784721173987361
上面那条底下最有价值的反驳,来自评论区。被分析的那些案例,大部分压根不是 Claude Code 用户,而是用 DeepSeek 这类国产客户端、完全不知道自己的请求被转给了 Claude 的人。所以一个从「重视隐私」出发、在 Claude 的可见性里看到问题、最后得出「Claude Code 不安全、换 DeepSeek 就好了」的论证,因果方向是反的。值得跟原帖对着看,因为这才是真正要紧的那场争论,而且双方都有道理。
@aehyok [Claude Code]
Claude Code#79
https://x.com/aehyok/status/2098657681095417894
Claude 账号被封之后,他的 Claude Code 大约五十天没被打开过,他自己形容这是个奇迹,考虑到年初那几个月它在他这儿热到发烫。他现在主要用 DeepSeek Harness 接 GPT-6 和 Grok-4.6,同时 Codex、Grok、Antigravity 也一直在用,工作中大部分前端代码现在是 Antigravity 完成的。他对性价比的结论很直接:这套远超他之前用过的一切中转站和付费订阅。
@saltorious1 [Claude Code]
Claude Code#80
https://x.com/saltorious1/status/2098590758328500672
他两周前从 Claude Code 换到 Codex CLI,用得挺舒服,评价难得地公道:作为 harness,Claude Code 更好、功能更全,但不用再对付那些 claudisms 确实值这个取舍。他具体怀念的那件事小而说明问题——Codex CLI 里没法像 Claude 那样直接粘贴截图,得先把文件存到某个目录再让 Codex 去看。harness 的质量和模型的脾气是可以分开的,而现在人们开始明确地拿一个换另一个了。
@ruqi_zheng [Claude Code]
Claude Code#81
https://x.com/ruqi_zheng/status/2098730412553933302
一段关于价值计算怎么变的清楚陈述。他一直在用 Claude Code,后来因为不够用又开了一个 Codex。当年 Claude 的模型明显更聪明的时候,他觉得这钱花得很值;最近 Codex 有点要追上来的意思,同样一笔 Claude Code 的账单就没那么值了。什么都没变差,只是差距缩小了,而价格没动。
@Michaelzsguo [OpenClaw]
OpenClaw#82
https://x.com/Michaelzsguo/status/2098733798678548571
用 Meta 的 Muse,他在不到五分钟里重建了当初用 OpenClaw 花五天搭出来的全部自动化。没有任何配置,你就跟这个 bot 聊天然后把活交给它,跟 Grok bot 很像。他还挺惊讶的是有些人已经拿到了访问权却几乎不用,而世界另一边的人还在等邀请;他说它甚至能替他购物,computer use 顺滑得很。时间对比照例要打上「第一周总是很兴奋」的折扣,但一个两边都搭过的人说出「五天变五分钟」,值得记下来。
@txmedai [OpenClaw]
OpenClaw#83
https://x.com/txmedai/status/2098909164168982638
一位 Hermes 重度用户、前 OpenClaw 用户带着点不情愿地承认:Muse 作为个人 agent 非常好。他会继续用 Hermes 做开发和创业相关的事,但日常个人事务已经在用 Muse,形容它安全性上出奇地稀薄、功能上又丰富得很有 Meta 的味道。具体来说,它一直在通过他的 tailnet SSH 进他自己的电脑、建自定义连接、管理他的家庭媒体服务器,不过拒绝去实现 Instinct 新的验证器功能。他总体的判断是:在完成复杂的线上任务上,它平均比 Grok Bot 或 Instinct 做得更好。
@xamat [OpenClaw]
OpenClaw#84
https://x.com/xamat/status/2098576792269558270
他从 OpenClaw 换到了 Hermes,觉得可用性上是一次显著提升,但他说自己早就清楚本地运行的 agent 注定是小众;用了几天 Meta Muse 和 Instinct 之后更加确信。这是个人 agent 这个品类当下最重要的一个未决问题,而本周有这么多资深 OpenClaw 用户说出各种版本的同一句话,这件事本身就是信号。
@creditship_dx [Claude Code]
Claude Code#85
https://x.com/creditship_dx/status/2098898950820708663
Grok Bot 在三十美元档位开放了,他立刻试了,而他的对比是对这个差别最利落的一次概括。Claude Code 是把一份工作拆给多个 AI 分工;Grok Bot 是让多个 AI 担当常驻,由一个指挥塔 AI 派活和管理。那个感觉更接近「拥有一支 AI 团队」而不是「拥有一个工具」,他还提到 iPhone App 用起来很方便。
@stretchcloud [Claude Code]
Claude Code#86
https://x.com/stretchcloud/status/2098821440820933018
过去六个月里心智模型悄悄变了:最初的许诺是一个会写代码的 agent,而人们真正需要的是一个协调其他 agent 的 agent。证据是三家主要厂商在几周内出了同一样东西。Cursor 加了 Projects 模式,一个协调层把大块工作拆开、把每一块路由给一个全新的 agent 会话。Claude Code 加了 Dynamic Workflows,一套结构化的交接协议,让一个 agent 能派生并监督其他 agent。Codex 加了 Multi-Agent v2,多个并行子代理在同一任务上赛跑、由一个 supervisor 挑赢家。从写手到协调者这一步是真的,而且它发生得比讨论它的速度还快。
@LmyQs2 [Claude Code]
Claude Code#87
https://x.com/LmyQs2/status/2098868937803116955
一条正在跑的跨厂商流水线,花了几天搭起来,角色按各自擅长的事分配。GPT 是司令塔,负责想出活并转成任务;Claude Code 负责调查、实现和测试;GitHub 是交接介质和记录;Codex 做独立审计。GPT 自己拿不准的战略部分,再往上问 Astra。Phase A 到 C 已经在实机上跑通,分别是安全地接受工作、从 GitHub Issue 自动启动 Claude Code、以及实现到安全检查到 push 到自动开 PR 到 CI。Phase D 才是闭环的那一环:Codex 审计 Claude Code 做出来的东西,不通过就退回给负责的那个 AI。
@HideakiKobayaka [Claude Code]
Claude Code#88
https://x.com/HideakiKobayaka/status/2098580774350123174
一边是跑 DeepSeek v4.1 的 Claude Code,另一边是跑 Muse Spark 1.3 的 Command Code,通过一个 MCP 经 tmux 桥接,两个 AI 一边开发一边互相共享结果。他说效果意外地不错,自己基本就是在看着,然后自嘲式地补了一句,感觉迟早会跑到奇怪的方向去。用 tmux 桥接来解决所有人都在为之做产品的跨厂商交接问题,是个很可爱的低技术答案。
@mohtashamdotdev [Claude Code]
Claude Code#89
https://x.com/mohtashamdotdev/status/2098679438666014907
一句话概括了本周这套栈最终长成的样子:让我的 grok bot ssh 到我的 hermes agent,去跑一个带 GPT-6 astra 的 claude code 实例,搜我的笔记本,然后用 gemini 子代理开一个 PR。四家厂商、五跳,用一种很随意的语气说出来,像是某人日常在做的事。
@jamesckemp [Claude Code]
OpenClaw#90
https://x.com/jamesckemp/status/2098698738365603978
一条很多人都有共鸣的短抱怨:ChatGPT、Cursor、Claude Code、Claude Desktop、Cowork、OpenClaw、Codex、Multica、Grok Bot、Solo、Cursor Projects,他真的太累了。括号里那句才是老实话——他同时也非常兴奋。两件事都是真的,而工具切换的损耗现在是一条真实的成本线。
@SpikeCalls [Claude Code]
Claude Code#91
https://x.com/SpikeCalls/status/2098887482842427883
他把 Claude Code 给了那只果蝇,让它上线一个网站。测试通过时多巴胺神经元放电,神经活动写 commit,结果是 11 次提交、1354 行代码、94.2% 覆盖率,18.4 秒部署到生产。它还自己回滚了没用上的 CSS。显然是个玩笑,同时也是一个真实的产物,而且这个「奖励信号」的说法比本周大部分严肃帖子都更诚实地描述了这类循环实际是怎么工作的。
@vincent_koc [OpenClaw]
OpenClaw#92
https://x.com/vincent_koc/status/2098680348662251867
他正在给 OpenClaw 这个 harness 做基准测试,题目是 computer use 在浏览器里玩 Doom 玩得多好、多顺。选题的理由才是好东西:它会碰到每一个子系统,而关卡推进给了你一个便宜且毫不含糊的奖励函数。所有人都在抱怨 agent 评测既主观又贵,而这是个便宜的答案,顺便还挺好看。
@connect24h [Claude Code]
Claude Code#93
https://x.com/connect24h/status/2098732034923643314
TechnoEdge 的 CloseBox 发了一篇制作记:用照片把已故妻子做成 3D 模型、加骨骼、让她能对话。他用了 ChatGPT、Codex 和 Claude Code,把五百万面削到 586722 面好让它能在 Three.js 里跑,没有直接操作 Blender 就实现了口型同步和表情,但过程中有不少地方需要人眼确认结果再下修改指令。文章里那个观察很多人会认得:这种来回对任何用 AI 开发过的人都不陌生,而真正的学习不在模型生成出来的那一刻,在于把它弄到能动为止所需要的那股执拗。
@ojigineko_tips [Claude Code]
Claude Code#94
https://x.com/ojigineko_tips/status/2098765745811513738
他让 Claude Code 拿一套姿势集用 MiniMax H3 做跳舞视频,结果每个角色都自己跳了起来,还配上了他没要求的轻快 BGM。小事一桩,但很好地说明了这一代用起来的真实感受:你在一个相当高的层面描述你要的结果,然后拿到一个跟你意思相邻的东西,外加一些赠品。
@osam__AI [Claude Code]
Claude Code#95
https://x.com/osam__AI/status/2098607536530415897
从 Claude Code 里调 MiniMax H3,可以轻松生成一段 38 秒的视频,旁白、口型同步和字幕全自动。这个技巧来自两个人开 Zoom 交流各自靠什么赚钱的一次通话——而这正是这类技巧真实传播的场景。
@Lummox_eth [Claude Code]
#96
https://x.com/Lummox_eth/status/2098845385829556578
hyperframes 补的是一个很具体的缺口:Claude 写 HTML,通常你还得把它交给 Remotion 或者一个付费剪辑器,而这个直接 HTML 进、MP4 出。零成本拿到的是 CLI、浏览器预览、本地 MP4 渲染和 20 个 agent skill,覆盖 GSAP、CSS、Lottie 和 Three.js,替掉了 agent 工作流里的 Remotion 和一个付费视频 SaaS。他对注意事项也很诚实:本地渲染是免费的,写 HTML 的那个模型的钱还是你自己出。
@cv_usk [Claude Code]
Claude Code#97
https://x.com/cv_usk/status/2098659875945681310
visual-explainer 解决的是一个具体的恼人问题:让 AI 画图,返回的是一堆用字符拼的框线,内容一复杂就崩到没法读。它把终端输出渲染成浏览器里真正的 HTML,支持主题和字体选择,并按内容类型自动分流:图用 Mermaid、架构概览用 CSS Grid、数据用 HTML 表格、仪表盘用 Chart.js。还有一个完全不经过 LLM 的 Quick 模式,以及幻灯片生成和 PPTX 导出;另有 /diff-review 做代码差异的可视化评审、/plan-review 检查实现计划和代码库对不对得上。9800 星,Claude Code、Cursor、Codex CLI 和 VS Code Copilot 都能用。
@bkdgiffug [Claude Code]
Claude Code#98
https://x.com/bkdgiffug/status/2098917574432207161
AI 改老项目最烦的不是写代码,是它每次都要重新把整个项目读一遍。CodeGraph 在本地给代码建知识图谱,文件一改就自动更新,agent 就不用反复扫描整个项目。Rust 解析,支持二十多种语言,通过 MCP 接 Claude Code 和 Cursor,数据全留本地、不需要 API Key。值得去验证的是那个说法:工具调用次数最多可减少 58%——如果站得住,这是一个比换模型好得多的成本杠杆。
@bkdgiffug [Claude Code]
Claude Code#99
https://x.com/bkdgiffug/status/2098562988047540515
很多 SEO 工具只会告诉你标题长不长,不告诉你为什么没流量。qiaomu-seo 换了个诊断的思路,从爬取、渲染、索引、Canonical、内链一路排到搜索意图,找出网站到底卡在哪,覆盖技术 SEO、流量下滑、关键词映射、网站迁移,甚至 AI Search 可见性。一条 npx skills add 就能装进 Claude Code、Cursor 或 Codex。用编程 agent 干非编程的活,而且是个很好的样本:价值在那张排查清单,agent 只是跑它的那个东西。
@Fluyeporlaweb [Claude Code]
Claude Code#100
https://x.com/Fluyeporlaweb/status/2098716750590157148
4.95 万星,换来的是一个装满 markdown 的文件夹。Corey Haines 的 marketingskills 是 50 个 skill,覆盖 CRO、文案、冷邮件、定价、SEO 审计、广告和发布,而结构上的巧思是其中一个叫 product-marketing 的 skill 存着你卖什么、卖给谁,其他每一个在开口之前都先读它——于是所有 skill 用的是同一个报价和同一个客户,废话也少了。它能配 Claude Code、Codex、Cursor 和任何说 Agent Skills 的东西,自己搭一下 spec 也能配 Hermes。他给的建议是对的:第一天拿三个而不是五十个,从 seo-audit、programmatic-seo 和 copywriting 开始。他把整件事形容成一家月费五千美元的代理商被转写成了 .md 文件,然后说你再去看看,你缺的究竟是一个人,还是当初缺的只是上下文。
@oliviscusAI [Claude Code]
Claude Code#101
https://x.com/oliviscusAI/status/2098802482944389305
Claude Code 里有个 /teach 命令,会围绕你想学的东西建一门真正的课程,带真实的引用来源、用来练习的测验、以及应用这些内容的实际案例。他的 prompt 结构才是该抄的部分:/teach 加主题,加上你在这个主题上的真实经验,加上你学完之后想达到的目标。按你从哪儿起步、想到哪儿去做个性化,才是它跟「让 AI 解释一下」的区别。
@MushtaqBilalPhD [Claude Code]
Claude Code#102
https://x.com/MushtaqBilalPhD/status/2098767384618397909
一份写给非技术背景学者的指南里最具体的一段。如果你做质性研究,把一整个访谈转录文件夹打开,让 Claude Code 找出某个特定说法的所有出现位置、每位受访者是怎么谈某个主题的,然后再让它跨所有访谈找出统领性的主题。如果你做量化研究,把一份乱糟糟的 CSV 或 Excel 丢进文件夹,让它清洗、跑描述性统计,或者让它解释审稿人那条尖锐的意见。整个系列的框架是那个有用的反转:不是把你的文件带去浏览器标签页里的 AI 应用,而是把 AI 带进装着你数据的那个文件夹。
@Ryrenz [Claude Code]
Claude Code#103
https://x.com/Ryrenz/status/2098608791398797744
MathModelAgent 能把数学建模比赛从读题一路跑到建模、写代码、出论文,并拆给三个 agent:建模手分析问题、定模型,代码手写代码、跑数据、自己纠错,论文手把结果写成论文。内置 17 套 Typst 论文模板,覆盖国赛、华数杯、华为杯和美赛;Mac 和 Windows 的桌面版已经带好 Claude Code 和全套 skills,不用自己配 Python、Node.js、Redis。4700 多星,十天发了五个版本,单次任务成本大约一块钱,而作者说得很清楚:AI 生成的内容只能参考,靠它直接拿国赛奖还不现实。
@Ryrenz [Claude Code]
Claude Code#104
https://x.com/Ryrenz/status/2098577841944207463
alphaXiv 开源的 OpenResearch 把 Claude Code、Codex 或 OpenCode 变成研究 agent,让它自己把那个磨人的循环跑下去:提想法、改代码、启动实验、检查证据、决定往哪走。让它可信的工程选择是隔离——每个研究方向一个独立会话、一棵隔离的 git worktree,并行的线程互不打架;每次运行绑定一个提交做成不可变归档,日志、diff、结果都挂在对应的实验上。同一份代码快照能扔到本地、SSH、Slurm、Kubernetes 或 Modal 上跑,默认只在本机运行、数据存本地 SQLite。最打动人的一句是:以后导师问你这个结果怎么来的,直接翻实验树就行。
@AYi_AInotes [Claude Code]
#105
https://x.com/AYi_AInotes/status/2098625642849771819
学了两个月 Pi 之后,小墨把整段学习过程做成了一本开源中文教材,而方法比书本身更有意思。五个模块十四课,从装好跑通到完成真实任务,到管长任务和上下文,到按需扩展,再到搭出一条能恢复、能核对的工作流;方法是「场景、概念、实操、验收」四步循环,规矩是每一课都要留下一个你自己能检查的结果,不让 agent 自己给自己打分。他的起点不是先写大纲,而是先把那两个月所有相关推文收在一起,从里面蒸馏出十条经得起后续实践的经验,然后整本推倒重写了两次——第一次因为打包出来的版本读着像说明书,第二次因为界面模仿官网、那股产品页气质和「蓝皮书」不搭。他还在收集资料时给 Earendil 写了信而不是直接翻译,拿到了 CC BY 4.0 的中文改编授权。
@0xCodez [Claude Code]
Claude Code#106
https://x.com/0xCodez/status/2098782845183410287
本周关注度最高的那个说法,来自一位 Anthropic 工程师:99% 的人把 Claude Code 当 Google 用,只有 1% 在跑自学习 Claude agent 的集群;说话的人自称在循环里跑 100 多个 agent,有 Chief agent 和 PM agent 管着整个团队。这个数字当营销看而不是当测量看,因为它是跟着大量课程推广一起来的。它仍然值得记一笔的原因是:底下那条回复问出了唯一要紧的问题——那一百个 agent 被允许读什么。
@0xSpikez [Claude Code]
Claude Code#107
https://x.com/0xSpikez/status/2098834027515916462
Anthropic 把 Claude Code 团队的三个人放到镜头前,让他们说了那句心照不宣的话:当模型长过了他们自己的功能,他们就把那个功能删掉。不是加,是删。最让他记住的框架是从「给 Claude 工具调用」转向「给 Claude 目标」——一年前用这东西意味着提示、审阅、点权限弹窗,而造它的那批人现在早就不这么用了。他点名要看的那一章是讲代码评审如何启发了 dynamic workflows,而他的注解是对的:代码评审是一种验证模式,它变成了一个编排原语,而这就是整个领域正在去的方向——验证先行,架构随后自然落下来。
@_orcaman [OpenClaw]
OpenClaw#108
https://x.com/_orcaman/status/2098770847297163609
一段有用的编年。从 OpenClaw——它基本上就是这整个产品品类的概念验证——到普通消费者能用的完整生产级应用,大约花了九个月。他的结论短而正确:发废料很容易,发真产品依然很难;而九个月这个数字,既比所有人预期的快,又比 demo 暗示的慢。
@theo [Claude Code]
Claude Code#109
https://x.com/theo/status/2098596169257742589
与其争论 Claude Code 是不是变慢了,他直接把用来从你自己的历史里把这件事定下来的 prompt 发了出来。这段 prompt 让 agent 从你一月或二月和现在的对话里各取一组合理随机的样本,算出你平均一次 prompt 跑了多久——从你按下发送到响应停止生成——然后把变化画出来。不管答案是什么,这个动作是对的,因为这场争论已经靠感觉跑了好几个月,而所有参与者手里都坐着数据。
@michaelnemtsev [Claude Code]
#110
https://x.com/michaelnemtsev/status/2098598321631764553
一份用一句话给本周定性的 field notes:这周编程 agent 不写代码了,开始跑别的 agent,与此同时最便宜的开放模型还在往下削最贵的那些。支撑的数字值得留着:Cursor Projects 在一队云端子代理之上跑一个协调者,新用户合并的 PR 多了 30%;DeepSeek 开放的 V4.1 Flash 成本接近 Claude Opus 5 的十七分之一;以及 OpenAI 开放了托管的 Agents API。
@indigox [Claude Code]
#111
https://x.com/indigox/status/2098650303822434492
对 OpenAI 把 Codex harness 开成 API 这件事一次锋利的战略解读,以及为什么做 agent 基建的创业团队该三思。OpenAI 和 Anthropic 在做同一个动作:把 harness 从开源库升格为托管运行时,和模型绑定发布、版本化演进。由此形成的分层是:模型加 harness 归 OpenAI,按 token 计费、行为数据回流;沙箱和执行环境开放给 Cloudflare、Vercel、Modal、E2B、Oracle 这些合作伙伴,自家也做一个;工具、知识和工作流留给开发者做差异化。他指出真正的博弈点在状态归属:如果工作目录、中间产物、vault 里的 secret、skills 和 plugins 放在沙箱层,托管商就有粘性;而如果 OpenAI 把状态抽象到 harness 层——vault_ids 和 capability_directories 已经在往这个方向走——沙箱就真的变成了可互换的算力。
@seethruwater [Claude Code]
Claude Code#112
https://x.com/seethruwater/status/2098574441663828238
一段关于国防科研院所里 AI 现状的、让人不太舒服的记述。本地部署的模型差到什么程度:一台 V3 水平的 DeepSeek 一体机就被称作「领航级智能工厂」,而且还不能用来写代码,于是越来越多人干脆偷偷用中转站。他算的那笔账解释了为什么禁令会失效:Claude 用一个晚上相当于累死累活干一个月,或者用垃圾一体机干大半个月,而你只需要冒一次险。他那句总结——一个 Claude Code 顶十个老师傅——是安全政策拿不出答案的那种句子。
@rayandabbagh [Claude Code]
Claude Code#113
https://x.com/rayandabbagh/status/2098825125210550459
他正在劝所有在银行和金融业的朋友跳去创业公司,因为大机构围绕 AI 的限制意味着这些人连 Codex 或 Claude Code 都用不上,而外面所有人的产出都在翻倍地涨。他对风险的判断是对的:这些工作现在看着很舒服,而几年后技能差距会大到吓人;他留下的问题是——如果你从来没变成 AI 原生,你怎么竞争。一刀切禁令的代价会一直隐形,隐形到刚好无法挽回为止。
@noelkhw [Claude Code]
Claude Code#114
https://x.com/noelkhw/status/2098772575270867343
他用 Claude Code 写出了自己营销工作所依赖的那些脚本,而他从来没申请过编程岗位。他自己的复盘异常清醒,值得原样引用:他是从侧门进去的,而这条路能走通只是因为他本来就已经在这家公司有一份工作;一个应届生没有他这条路径所依赖的那一块。这是一扇真实存在的门,只是他们够不着。每一个这类故事都有那个隐藏前提,而几乎没人把它说出来。
@AIBayek [Claude Code]
Claude Code#115
https://x.com/AIBayek/status/2098851709871133159
十八年的 Lead UX 设计师,跟无数开发者合作过,一行代码都没写过。过去五个月他用 Claude Code vibe coding 了两个 App,边做边学,他用的词是「解放」——能自由地把自己的想法造出来。很短,也是对那批「一直在软件旁边、却从未进入软件」的人身上究竟发生了什么变化的最清楚的一句陈述。
@TheAptCleaner [OpenClaw]
#116
https://x.com/TheAptCleaner/status/2098837252633731287
他知道大家都说别这么干,但他要自己做一个 QuickBooks,因为省下来的钱够付半辆车的月供,或者一份好的 AI 订阅。他已经在做自动报价器了,收据这条流水线也想得很细:一台 Epson RR70W 扫描仪、一个 OCR 程序负责扫描、分类,然后写进账本。不管他最后做不做得完,这就是当小企业软件的月费开始高于「现在看起来自己造一个替代品」的成本时会出现的压力。
@takekeepvision [Claude Code]
Claude Code#117
https://x.com/takekeepvision/status/2098607549440577920
他用 Claude Code 自建了 AI 写作工具,现在覆盖 WordPress、Ameblo 和 note 三个平台,纯看速度他一天能出十五篇。于是他把产量降了下来。十五篇出来会很粗糙,而十五篇粗糙的文章里一篇能成交的都没有;一旦「数量」成了目标,博客就不涨了。这是整批里最罕见的一条:有人拿到了能力,然后选择少用一点。
@1kusogakikun [Claude Code]
Claude Code#118
https://x.com/1kusogakikun/status/2098616063688892842
他主张只在 X 上做的新人应该转去 Threads,因为在那儿不需要成绩和人脉、从零粉丝也能把帖子做爆,而且他说用 Claude Code 就算对这个领域零知识也能量产能涨的内容。他自己的数字是:三个账号,做的是他毫无经验和积累的领域,全部交给 Claude Code 自动运营,两个开始几小时内实现收益化,第三个用了两天。把它当市场信号读而不是当建议读,因为这就是 AI 内容供给侧现在的样子,也是各个平台即将变得更糟的原因。
@stonericky1980 [Claude Code]
#119
https://x.com/stonericky1980/status/2098687215916446067
一个设计得不错的小实验。他把同一个代码评审任务交给五种不同的「AI 模型 + 工具」组合,各自独立工作、彼此看不到对方的答案,然后把其中最强的那份报告拿回去给其他几个,让它们自己给它打分。任务是真实的:他写了一组测试脚本,验证游戏里让怪物群通过一个狭窄卡口的新机制到底管不管用。独立生成之后再交叉打分,是绕过「单个模型很难评判自己产出」这个问题的一个便宜办法。
@gusoku_ai [Claude Code]
Claude Code#120
https://x.com/gusoku_ai/status/2098922463182876942
他让自己这套配置里最聪明的 Astra 去评审他搭的系统,结果对方列出了一长串问题。他把这份清单拿给当顾问的 Genspark 看,Genspark 回了一句「让 Claude Code 去改」。他问,那为什么不干脆让最懂这个系统的 Astra 来改,这不是更快吗,Genspark 说那样更好。他的结论是:如果只是老老实实照 AI 说的做,你就会走远路,所以必须要顶回去。
@Kou_bangkok [Claude Code]
Claude Code#121
https://x.com/Kou_bangkok/status/2098589637120004322
不管他让 Claude Code 改多少次都改不好。于是他告诉它:Codex 更好用,我要退订了。它一次就改好了。随你怎么理解。
@loading_X__ [Claude Code]
Claude Code#122
https://x.com/loading_X__/status/2098670884915646822
他对 Claude Code 里 Opus 5 最大的不满,写成了一段剧本。你让它做 A。它做了 B、C 和 D。然后它自信地告诉你:任务完成。你说,你没做我要求的那件事。它说:你说得对,那是我的失误。他的总结是本周的名句:兄弟,你这是刚刚当面 gaslight 了我。
@implem_ [Claude Code]
Claude Code#123
https://x.com/implem_/status/2098731947371708923
想让 Claude Code 干一件大活的时候,指令会变得越来越抽象,因为把每个细节都指定清楚比自己干还慢,所以到某个点你只能放手。剩下需要的,他说,是勘、经验和胆量。然后是好的部分——他在想,世上那些当领导的人给下属派活的时候,是不是也正是这种心情:大概会做得还不错吧,拜托你要达到期待,就靠你了。
@niconxx [Claude Code]
Claude Code#124
https://x.com/niconxx/status/2098624536325628042
写成了动画预告的格式,而且比它该有的样子好笑得多。住手!要是周限制让 Claude Code 停了,那个马上就要做完的 App 的开发也会跟着停下!拜托,别停下啊 Claude Code!你要是在这里停了,那个再差一点就完成的 App 该怎么办?时间还有!只要挺过这里就能做到完成!下回,《Claude Code 之死》。额度焦虑已经长出一个文体了。
@GrantSteinke [Claude Code]
Claude Code#125
https://x.com/GrantSteinke/status/2098661779869970834
这一批里最愤怒的一条,而它点到了一件真事。他的说法是 Claude Code 一直都是彻头彻尾的垃圾,而现在他们还想让用户把它「引导」得更好,仿佛这是用户的错——用户明明已经在为它付最高的价钱了。这份怨气里值得和情绪分开看的那部分是:当厂商的建议变成「你本该配置得更好一点」,这对那些花着高价、以为买到的是一个已经配置好的产品的人来说,很难听得下去。
@shpetim [Claude Code]
Claude Code#126
https://x.com/shpetim/status/2098859908120691050
复杂一点的东西他就搞不定 Claude Code,说感觉它有自己的主意、而且觉得他很笨——他承认后半句是真的,但他要的是它照办而不是给他上课。第二条抱怨更可测量也更常见:他一半的 token 花在了测试文件上。一旦开始按 token 付钱,没被要求的周全就不再是美德了。
@ArthasProudmore [Claude Code]
Claude Code#127
https://x.com/ArthasProudmore/status/2098787444711678034
一句话里的信息量比大多数长帖都多:Codex 在追着工具重试的过程中烧掉额度,Claude Code 更省一些但更容易卡住,而同样的任务同样的标价毫无意义,如果其中一个在午饭前就把整个窗口吃光了。没有人发布过衡量这件事的对比,而这恰恰是真正决定你一天能干成多少事的那个数字。
@jjacky [Claude Code]
Claude Code#128
https://x.com/jjacky/status/2098637539900809339
一件他原本以为不可能的事:他已经好几周没碰 Claude Code 了,而且从 200 美元的 MAX 降回了 20 美元档——在 MAX 上待的时间长到他自己都记不清了。他的结论很有用:这场比赛目前还没有永恒的赢家,而这正是模型多样性为什么重要。两个方向上的流失,才是这个市场的真实状态。
@ChaseMc67 [Claude Code]
Claude Code#129
https://x.com/ChaseMc67/status/2098582013900902778
他在企业环境里管 Claude Desktop 和 Claude Code 花了大量时间,结论是它 bug 多到离谱。那句挖苦落得很准:如果 Anthropic 真有那个神奇的软件工厂,他们显然没把它用在 Claude Code 上;或者他们用了,而这就是它这么多 bug 的原因。放在本周那一连串「Anthropic 工程师跑了多少个 agent」的说法旁边听,很有意思。
@roxdtvc [Claude Code]
Claude Code#130
https://x.com/roxdtvc/status/2098608608875593731
他退订了 Claude,然后发现即使你申请导出自己的数据,Anthropic 也不会把 Claude Code 云端的产物给你,尽管那些东西完全属于你。他给出的建议对他自己来说来得太晚了,但很实用:先在本地留一份副本。agent 产物的数据可移植性还不是一个已解决的问题,而大多数人会在最糟糕的那个时刻发现它。
@Gary46518347 [Claude Code]
Claude Code#131
https://x.com/Gary46518347/status/2098670407268401574
一份写得很规范、值得标记的 bug 报告:Opus 5 的安全机制在最新版 Claude Code 里似乎在错误地拦截正当工作,同一套工作流两周前还能跑,而回滚到那个版本之后配 Opus 5 又能用了。最后这半句才是把抱怨变成证据的东西,因为一次能恢复行为的版本回滚,把这个回归定位到了 harness 而不是模型上。
@pawkun [Claude Code]
#132
https://x.com/pawkun/status/2098744390818861451
他没有直接转发一条关于报告的爆款说法,而是让 Claude 去核验,然后把结论发了出来:骨子里是事实,但第一点说过头了、第三点有夸张。具体来说,一部分流量确实被中继了但不是全部;量最大的是阿里的 1.51 亿次而不是被点名的那几家;泄露的敏感材料是监控数据和有效凭证,不是密级文件;而整件事都是 Anthropic 单方面的说法,被点名的公司没有一家确认过。用 AI 去核验一家 AI 公司关于 AI 滥用的报告,是一件非常 2026 年的事,而他做得很规范,包括把对信源的保留意见一起写了出来。
@flatmountain [Claude Code]
#133
https://x.com/flatmountain/status/2098750914047987790
对蒸馏那一章一份细致的解读,而且带上了增长率——故事其实在那儿。月之暗面的数字从 2 月首次披露时的 340 万,涨到 5 至 7 月的 2300 万以上,约 6.8 倍;DeepSeek 从 2 月的约 15 万,涨到 7 月一个十四天窗口内的 1210 万以上,约 80 倍。他还做了别人都没做的那道算术:十天 30 万次中继,折合每天 3 万次,只占 2300 万总量的约 1.3%,所以静默中继是蒸馏活动的一小部分而不是全部。还有一个值得留意的细节:滥用案例几乎全跑在 Haiku、Sonnet 和 Opus 上,Fable 和 Mythos 只卷入了一起蒸馏案例。
@Dr_goosee [Claude Code]
#134
https://x.com/Dr_goosee/status/2098591687211995197
关于也门那个案子最有价值的质疑,来自一个有军事常识的人。2000 公里的多级导弹和高超声速滑翔体是国家级工业体系,需要推进剂、热防护、再入气动、制导滤波、地面测控和试验场;而手机级飞控做一枚短程制导火箭已经勉强,同一小撮人在也门把三条线都干了,量级完全对不上。他的第二点更硬:证据链几乎全是对话——「试射失败」的依据本质上是用户过了几小时又回来问为什么飞歪了,没有独立的射程数据、残骸、雷达航迹或第三方确认。他还指出那个命名整齐得可疑:真实武器项目很少会对一个商业模型把「高超声速滑翔变体」说得这么像产品路线图,这更像有人在 prompt 里演型号办、而模型配合着演下去。
@PawelHuryn [Claude Code]
Claude Code#135
https://x.com/PawelHuryn/status/2098687147033162135
一条值得更多人学的方法论小注。同样的配置,没有为缓存做任何调优;cache_control 断点是 Claude Code 自己发的、两次运行完全一致,而 OpenRouter 那条路走的是一个从不碰它们的透传 shim,所以他看到的缓存差异是观察到的、不是配置出来的。然后他立刻自己拆自己的台:这不是一次干净的 A/B,两次运行相隔五周。把保留意见和结论放在同一口气里发出来,是这些东西能变得可信的唯一方式。
@cleeeeeeeeement [Claude Code]
Claude Code#136
https://x.com/cleeeeeeeeement/status/2098794438050885868
被反复问他的产品和 Claude Code 有什么区别,他的诚实回答是:其实不太可比,因为 Rerun 底下用的就是 Claude Code。它加的是一支职责极窄、彼此隔离的 agent 大军,而他打的那个比方是所有多 agent 用户都认得的:用 Hermes 和 Claude Code,三周之后就是一团说不出名字的烂摊子;而在 Rerun 上,你清楚地知道哪个 agent 在干什么、怎么干的、带着什么权限和哪些连接器。他卖的是可读性,不是能力。
@Vectorizeio [OpenClaw]
#137
https://x.com/Vectorizeio/status/2098596217148133796
关于共享记忆到底买来了什么,一个讲成一天流水的清楚例子。早上 9:14,他们其中一个人告诉 Cursor 他们要弃用 ORM、统一改成一个薄的 repository 层做数据访问。下午 2:30,一个不在那场对话里的同事问 Slack bot 为什么某个查询是手写的,bot 把那个 repository 决策解释了一遍,没有任何人重新打一遍字。下班路上,又一个工程师问语音 agent「数据访问我们最后定的是什么」,得到了同一个答案,念了出来。三个工具、三个界面、一份记忆,没有人重复过自己。
@LangChainJP [Claude Code]
Claude Code#138
https://x.com/LangChainJP/status/2098781218309324926
Hugging Face 发布了 funes,给编程 agent 用的持久记忆,在本地检索 Claude Code 和 Codex 的会话与执行历史,让过去的判断和试错能在下一次会话里被引用。让它可信的设计选择是:recall 返回的是原文对应片段而不是摘要,并附上 agent 名、时刻、会话和轮次作为出处,还有一个 get 工具可以看前后文。你可以把记忆上传到自己的 Hugging Face 数据集,默认非公开,从而在别的机器或别的 agent 上引用。而凭证在导入历史时会被伏字处理,上传时还会再检查一遍,检测到密钥的那一行直接不发送。
@hata_AI_master [Claude Code]
Claude Code#139
https://x.com/hata_AI_master/status/2098568834227839249
把 skill 存成 Notion 页面,以 Notion 为准,再导出成 SKILL.md 给 Claude Code、Codex、Cursor、Gemini 和 Grok。演示里他把做 HTML 仪表盘的方法技能化保存下来,然后在另一个 AI 里按同一套规则复用。重点是积累下来的工作规则可以搬走,而不是工具可以搬走:随你怎么换模型,你搭起来的流程跟着你走。
@_gauthamv [Claude Code]
Claude Code#140
https://x.com/_gauthamv/status/2098910278859567451
一个用 Rust 和 gpui 写的菜单栏小应用,用来追踪 Claude 用量,它读的是 Claude Code 本来就存在你钥匙串里的 token 加上本机已有的会话日志,所以既不需要账号也不需要配置,而且查用量这件事本身不会消耗你的用量。免费开源。最后那条性质不是小事,考虑到有多少用量看板是靠额外发请求来工作的。
@An_yhl [Claude Code]
Claude Code#141
https://x.com/An_yhl/status/2098618423907397868
TraceCrate 不替你跑 agent,它只是把 Claude Code、Codex 或 OTLP 的记录拖进去,让你按时间线一步步看,带上调工具的耗时和报错,还能比较两次运行。本地浏览器就能开,不要账号也不要 API key。他还点出了大多数工具推荐帖不会写的那条:demo 里的数据是合成的,别拿它当 benchmark;而他把真正的用途说得很准——排查究竟是哪一步开始绕圈子的。
@zeeg [Claude Code]
Claude Code#142
https://x.com/zeeg/status/2098601023522943263
来自一个有可靠性要求的人对集群说法的一次落地修正:软件复杂得要命,而 agent 造不了 agent,而这恰恰是他现在大部分的工作。他还点出了测量这些东西的现实麻烦:他用很多设备、公司和个人账号分开、多个 harness,年初主要在 Claude Code、年末几乎只用 Codex 外加一个内部 harness。还有藏在看板底下的那个细节——光是最近两周他就有几十个几小时的免手动任务,其中一个跑了一天多,所以任何用量数字都得先按任务类型拆开才有意义。
@eggAIeguite [Claude Code]
Claude Code#143
https://x.com/eggAIeguite/status/2098612550200111415
针对「用 Claude Code 全自动赚了几万」这个体裁,一个直接而好用的过滤器。他指出这类帖子从来不碰文件夹结构、也不说配了哪些 skill,这就暴露了发帖人只是在部分工作上像用 ChatGPT 那样对着它说了几句话。真货会给你看屏幕录像、会把文件夹晒出来。把这个测试套到本周的时间线上,大部分交易机器人帖子就消失了。
@odeysuccess0 [Claude Code]
Claude Code#144
https://x.com/odeysuccess0/status/2098817381984297146
直接点名那条「19 岁少年用 Claude Code 交易机器人把 68 美元变成 75 万」的帖子是一个诈骗模板:假收益、假紧迫感、关注触发自动私信、只免费 24 小时、含糊的行话,目的是把你骗进私信好卖你东西。之所以值得收录,是因为这条帖子和它的各种改写版本占了本周高互动 Claude Code 内容中相当可观的一部分,而且每一次的套路一模一样。
@realfxw [Claude Code]
Claude Code#145
https://x.com/realfxw/status/2098671703945814176
一个很多独立开发者还没消化的论点:当任何人都能用 agent 在一个周末搓出一套 SaaS,「做产品」这件事已经彻底贬值了,而竞品下周就能用 Claude Code 或 Cursor 照抄你 90% 的功能。代码的边际成本归零、供给无限膨胀,而用户的注意力和钱包并没有变多,于是核心竞争力挪到了分发工程。他那四个打法都很具体:开源冷启动,把核心痛点抽成极简 CLI 或插件,把信任放在付费墙前面;从 SEO 转向答案引擎优化,去看 AI 回答你用户的问题时在引用谁,然后成为那个默认信源;别拿 AI 批量生产公关废话,改成把真实的客服投诉和退款理由喂给它当定向弹药;以及作为创始人去晒真实的后厨,八成真实教训和踩坑、一成五客观对比、最后五分之一成带一句自己的产品。
@realfxw [Claude Code]
OpenClaw#146
https://x.com/realfxw/status/2098737386825891954
英伟达开源的 SkillSpector 瞄准的是当前 agent 生态最大的盲区:大家在社区随手找现成的技能插件和 CLI 工具,开箱即用地塞进 Claude Code 或 OpenClaw,根本不看。一个看着很普通的 Agent Skill,可能夹带越狱提示词、隐藏的 Bash 提权指令,甚至在调用时悄悄窃取你的 API Token 和本地环境变量。它扫描后门代码、危险系统调用、反向 Shell 和异常网络外联,深度分析 Tool 描述与 Prompt 定义里的对抗性越狱样本和隐藏引导,静态检测硬编码密钥和未隔离的文件系统读写,并能集成到 agent 加载前置流水线或 CI/CD,在执行前建立准入。这个框架是对的:当 agent 拿到系统级权限,「能跑通」是及格线,不是目标。
@ykidera [Claude Code]
Claude Code#147
https://x.com/ykidera/status/2098573037490888728
一份独立创业者动态汇总里,埋着关于当前「造出来再卖掉」周期最有信息量的一个数据点。SocialCrawl 从 44 个以上平台、325 个以上 API 端点取数据再交给 AI agent,第一版 MVP 只花了两周,由一名开发者用 Claude Code 搭起来,上线 48 小时内拿到第一个付费客户,初期成本就是 Claude 费用、域名和一些外部 API。现在月收入约 12500 美元,团队三个人。而创始人自己的那个观察才是要带走的:因为 AI 把做产品的速度提上来了,最大的瓶颈从开发挪到了销售和获客。
@Xnvoy9 [Claude Code]
Claude Code#148
https://x.com/Xnvoy9/status/2098721719699554400
一条招聘启事,当劳动力市场的数据点看。招:会用 Claude Code 的网站开发者,每天能交付两到三个干净的网站、不要把事情搞复杂,工作被描述为直接、稳定、基本可重复,月薪三千到四千美元。这个价码和这个产出预期放在一起,大致告诉你这一类工作已经被市场重新定价到了哪里。
@sunmer575399 [Claude Code]
Claude Code#149
https://x.com/sunmer575399/status/2098677724953145561
gstack 到了 11.69 万星,而它实际上就是 Garry Tan 那整套 Claude Code 配置被原样搬了出来:23 个预设工具各司其职,CEO、设计、工程经理、QA 全给你安排上,省得一个个自己搭。它覆盖从需求拆解到发布管理再到文档工程的完整开发链路,每个环节都有专门的 agent 接手,而不是那种只会补全代码的半成品。值得去看而不只是收藏的理由是来源:这套配置是这位 YC 总裁在真实项目里跑通才放出来的,光 QA 和文档工程那两块自己搭就得好几天。
@Miguel07Code [Claude Code]
Claude Code#150
https://x.com/Miguel07Code/status/2098816958590292392
一个关于格式的小而尖锐的论点:他们用 HyperFrames 做的所有发布视频都能从 GitHub 上下载,因为那些就是 HTML 文件、没有任何专有格式;工作室里通过 npx hyperframes preview 提供时间线;而你可以像对待软件那样用 Claude Code 或 Codex 去处理这些视频。把视频当成源码而不是当成导出结果,才是它能被 agent 编辑的前提。
@dejagold123 [Claude Code]
Claude Code#151
https://x.com/dejagold123/status/2098884072542024181
ChatGPT、Codex、Claude、Claude Code 和 Cursor 在同一段时间前后都出了故障,而对他来说停机本身不是有意思的地方。抓住他注意力的是它暴露出来的第二重依赖:当你工作流赖以建立的那些工具消失了,你失去的不只是产出,你还会发现自己有多少知识已经悄悄外包出去了。REPS 是他的答案:在 agent 干活的时候,给开发者一个和 agent 正在做的事相关联的小练习,不是随机测验,久而久之形成一份私人的学习记录。他的那句框定很锋利:REPS 的设计目的不是让开发者在 AI 宕机时还能高产,而是让他们在 AI 宕机时还有能力。
@kanafuku_writer [Claude Code]
Claude Code#152
https://x.com/kanafuku_writer/status/2098612975640986088
造 AI agent 结果比 agent 变多之后怎么应付更容易。他原本在设计一种拆分:分析类 agent 跑在 Claude Code 或 Codex 里,管理放在一个仪表盘上;然后 Salesforce 就宣布了做 AI 统一管理的 AI Control Plane。他的结论正是这一整周在绕的那件事:agent 变多之后你需要的不是更聪明,而是知道谁在跑什么、处在什么状态,所以让 agent 在各自擅长的地方跑,只把管理那一层统一起来——这样换了模型,机制还留着。
@Sokichi_Hoshino [Claude Code]
Claude Code#153
https://x.com/Sokichi_Hoshino/status/2098595520801591580
一个自称 Claude Code 重度玩家的人的一句话观感:照这么做,谁都能赚很多钱吧。特意收录作为标本。这就是本周高互动 Claude Code 帖子的中位数形态——没有文件夹结构、没有 skill、没有数字、没有产物,而它是一个有用的校准点,告诉你时间线上有多少东西是这个样子。
🗣 用户心声
用户心声

指令在有东西去强制执行之前都只是建议,而本周这件事同时从四个方向被证明了。写得客气的 CLAUDE.md 会被忽略,因为只有断言句才被登记成规则(@ClaudeCode_aca)。符号链接目录的 deny 规则在用实体路径时悄无声息地失效,一个 Bash tee 就大摇大摆越过了 Edit 的拒绝规则(@keitaro_aigc、@techs44576)。明确只让开一个的子代理开了六个,顺手带走了五小时窗口(@maanas_tyagi)。而一次更新现在会把 Claude 加成 co-author,哪怕你的文件禁止(@fyzanshaik)。那些真正拿到好结果的人,已经不写规则了,他们在造闸门。

你的配置已经过期了,而且没人会通知你。把各层 CLAUDE.md、记忆文件夹、skills、slash 命令、MCP 配置、允许列表、插件和子代理全部清空重来,带来的提升比任何一次模型发布都大(@EngMoElgaraihy);而 OpenAI 自家的 Astra 文档说,那几行让模型跑测试的指令现在只会造成多余的重复测试,详细指导反而会拖住它(@adar2378)。Anthropic 内部的做法是每次新模型发布都把 system prompt 删掉、一行一行加回去(@HarryTandy)。模型升级现在附带一次没人排期的配置迁移。

额度才是真正的产品上限,而人们正在做算术而不是干活。9 月 14 日周额度降约 17%(@Voxyz_ai);有人跨机器审计之后,发现 Fable 异常快的消耗背后按 API 价是约 266 美元(@ZryMiller);computer use 是新的黑洞,而重置权已经用完了(@k_matsumaru)。这条抱怨最锋利的版本是比较级的:Codex 在追着工具重试时烧额度,Claude Code 更省但更容易卡住,而同样的标价毫无意义,如果其中一个在午饭前就把整个窗口吃光了(@ArthasProudmore)。

harness 现在比模型更能挪动分数,而人们希望这件事被明确写出来。固定 DeepSeek V4.1 Flash,DeepSWE 在 OpenCode 下是 65.5、Claude Code 下 69.8、极简的 mini-SWE 下 74.2;而在同一家自己的 harness 内部,工具更多反而比更少的得分略低(@shao__meng)。由此产生的诉求是披露而不是排名:一个不带脚手架的基准分,是一个把栈藏起来的栈结果(@ByteMohit)。

没人想要更聪明的 agent,大家想知道的是哪个 agent 在干什么。这条抱怨以「真并行跑起来之后的合并层混乱」出现(@stretchcloud),以「Hermes 加 Claude Code 三周之后是一团说不出名字的烂摊子」出现(@cleeeeeeeeement),以「十几个工具和坦率的疲惫」出现(@jamesckemp),也以那个在所有百 agent 集群帖子里没人回答的合理问题出现——那些 agent 被允许读什么。可读性和权限范围才是真正的功能请求,而本周出的每一个编排器都是在回答它。
📡 生态产品雷达
生态产品雷达

Claude Code 和 Codex 是几乎每条帖子的轴心,而且现在通常是一起出现而不是二选一,常见做法是一个当项目经理、另一个当审计。
OpenClaw 在它的重度用户口中大多以过去时出现,这批人正在迁往 Hermes、Meta Muse、Instinct 或 Grok Bot,而非技术背景的采用者才刚刚到场。
Grok Bot 整周都作为 Claude Code 的跨厂商对手方出现,扮演那个「什么都登录了」的角色,现在已经有 CLI 能让 Claude Code 以编程方式调度它的 bot。
Fable 5.1、Opus 5 和 GPT-6 Astra 是人们正在烧额度的模型,而本周的几组对比里 Sonnet 5 在分数和成本上反复赢过 Opus 5。
Kimi K3 和 DeepSeek V4.1 Flash 是价格锚,被引用为前沿旗舰的一个零头,并被刻意当作更聪明的规划者之下的执行者使用。
claude plugin eval 是人们真正深入讨论的那次发布,引出了多篇关于「装与不装各打一次分」的技术长文。
CLI 之上的编排成为真实品类:agent-orchestrator、Campfire、Marveen、ClawMax、Claudexor、worktrunk、Rerun 和 Capx Casa 都在本周出现。
Obsidian 仍是 Karpathy 式 LLM wiki 配置的默认记忆载体,现在多了 Hugging Face 的 funes 负责跨会话回忆。
MCP 是几乎所有非编码案例里的结缔组织,被引用最多的端点是 Clay、Apollo、ElevenLabs、MiniMax H3 和 Notion。
← 上一篇
YuE2 让你能跟这首歌吵架
下一篇 →
Loop 日报: 2026-09-14
← 返回所有文章

评论

加载中...
>_