2026年8月14日super-user

超级用户日报: 2026年8月14日

今天反复冒出来的主题是做减法。Claude Code 的创造者 Boris Cherny 让大家每半年把自己的 CLAUDE.md、skill 和 hook 全删一遍;他们把 Claude Code 自己的系统提示词砍掉八成,模型反而更好用;还有人干脆再挂一个小模型,专门用来把 Claude 的话缩短。与此同时,今天最扎实的案例几乎都不在编辑器里:一个连跑三周的政府举报调查、一套从十分钟压到三分钟的晨会流程、一个在终端里管着每月二十万美元广告投放的团队,以及一个把二十多个订阅退掉、自己重新造轮子的人。
@magsimich [Claude Code]
Claude Code#1
https://x.com/magsimich/status/2087588528246972418
他把一个坏掉的仓库丢给 Claude Code,只说了一句"把挂掉的测试修好",然后走开二十分钟。回来时 47 个文件被改动、12 个 bug 被修掉、一个可以直接合并的 PR 已经准备好了。于是他决定认真做一次实验,跟踪了 100 个任务:首次尝试成功率 81%,只有五分之一的任务需要他再补一句话,从提示到完成代码平均一次会话 11 分钟。最让他意外的是 34% 这个数字——有三分之一的情况下,模型顺手抓出了他根本没让它找的 bug,纯粹因为修别的东西时把整个文件读完了。
@cloudpack_jp [Claude Code]
Claude Code#2
https://x.com/cloudpack_jp/status/2087660403207635318
KDDI 旗下 iret 发布了内部 AI 实践录第 112 条,是今天最干净的一个小自动化。以前每天早上要花十分钟,把 Backlog 上的课题和 Google 日历的日程对到一起,整理出个人 TODO。现在做成了一条 Claude Code skill,一个命令把两边合并整理好,结果自动发到个人 Slack 频道,十分钟变成了三分钟。真正值得抄的是权限设计:读取用 allow-tools 全自动,省掉反复对话;但写入和发送保留 Yes/No 选择式,任何要离开本机的动作还是由人拍板。
@itsivanfalco [Claude Code]
Claude Code#3
https://x.com/itsivanfalco/status/2087553760465932735
他用十二条 Claude Code skill 管着每月二十万美元以上的广告投放,说自己电脑上永远只开着一个应用就是 Claude Code,95% 的工作时间都从这里走。这些 skill 按平台拆开,无聊得很真实:Google 那边有关键词分析和否定词筛选,Meta 那边有创意疲劳分析和预算追踪,LinkedIn 那边有批量出价优化和批量编辑。他说前后投了三百多个小时去搭,回报是客户数翻倍而质量没掉。非编码场景的落地形态基本都长这样——不是一条聪明的提示词,而是十几条无聊的 skill,接进真正管着钱的账户里。
@aboss [Claude Code]
Claude Code#4
https://x.com/aboss/status/2087673951208010214
本职是软件工程师,业余调查政府举报人的指控,已经有一套基于 Claude Code 的固定流程。最近这一次,他把一份 500 页的信息公开申请回复丢给一个 agent 循环,让它拿公开领域的所有材料去逐条印证举报人的说法。三周过去、跑到第 970 轮,它还在往外翻出跟案子相关的新材料和新线索。他唯一的抱怨是自己已经没钱继续烧了——这跟"模型不够聪明"是完全不同性质的瓶颈。
@Timseo_ [Claude Code]
Claude Code#5
https://x.com/Timseo_/status/2087568290612949463
六年 SEO 经验,写成了一份从零搭建个人 SEO agent 的完整指南,而且是当系统写的,不是提示词合集。第一阶段是地基:Claude Code 加一个 raw/wiki 双层 markdown 知识库,再加一个方法论文件。第二阶段是不可跳过的前提——你自己的私有数据,来自通话记录、售后工单、评价和 Search Console。然后是九条 skill,按 SEO 实际干活的顺序排;再做语气调校,把 Claude 的默认腔调洗掉;再把任务串成 workflow 而不是孤立动作;最后才是循环,实现自主和学习。他的话很直白:别再为那些跟所有人吐出同样关键词的工具付费了。
@0x0SojalSec [Claude Code]
Claude Code#6
https://x.com/0x0SojalSec/status/2087539934685212861
一个为 Claude Code 写的开源求职系统,评估了 700 多个岗位申请,最后真的帮作者拿到了工作。它会扫描多家公司的招聘页,按岗位重写简历,甚至替你填申请表单。底层有 14 种 skill 模式覆盖评估、扫描、生成 PDF,一个 Go 写的终端面板,通过 Playwright 渲染出对 ATS 友好的 PDF,还预置了 45 家以上的公司,包括 Anthropic、OpenAI、ElevenLabs、Stripe。不论你怎么看批量投简历,值得注意的是整条流水线是 skill 加面板,而不是一个 SaaS 产品。
@alex_verem [Claude Code]
Claude Code#7
https://x.com/alex_verem/status/2087510301982028028
有个工程师实在受不了解码 Claude 那套文风,干脆做了个插件把它翻译成人话,Reddit 上 2300 个赞说明不止他一个人这么想。他先试了靠指令解决,连航空业的简化英语标准都搬出来了,基本没用。于是他用 2026 年的方式解决:再拿一个 AI 去对付第一个 AI。一个 Claude Code hook 拦住每条超过 200 字符的完成消息,发给本地 Ollama 上的模型,在原文下面追加一段"说人话"。Claude 本身看不到改写结果,记录里也保留原文。真正讲究的是工程细节:失败时开放通过,Ollama 挂了或超时你拿到的就是 Claude 的正常输出,插件绝不会把答案吃掉;而且改写全程不出本机。
@shmidtqq [Claude Code]
Claude Code#8
https://x.com/shmidtqq/status/2087629706166431878
Boris Cherny 在一场 36 分钟的分享里给的建议,跟眼下市面上卖的东西几乎全部反着来:每半年把你的 CLAUDE.md、skill 和 hook 删一遍,先看看模型在更少指导下能干到什么程度,再往回加。支撑证据是他们把 Claude Code 自己的系统提示砍掉了大约 80%,模型反而变好了。发帖人说得挺对:没有哪个付费 agent 课程会开场就告诉你,你写的东西有一半得扔。
@AnandButani [Claude Code]
#9
https://x.com/AnandButani/status/2087660701821120949
最近两个版本里五个几乎没人碰过的设置。沙箱凭证文件现在支持 mode 设成 mask(Linux/WSL):沙箱里的命令读到的是哨兵副本,代理在出网时才换成真值,还能配 extract 正则只遮住真正敏感的片段,macOS 则退回 deny。Remote Control 的自动启动改成只在用户级生效,仓库里的 .claude/settings.json 只能关不能开——克隆别人的仓库前值得知道这条。另外 VS Code 里 Ctrl+Alt+F 是聚焦视图,把工具活动折叠成每轮可展开的摘要;claude-api skill 新增 prompt-audit 子命令,专门审查那些按老模型习惯写的提示词;/status 现在还会告诉你当前是交互会话还是后台任务。
@publi0 [Claude Code]
Claude Code#10
https://x.com/publi0/status/2087635866298863947
今天最有价值的一篇对比,作者每天用 Codex Desktop 好几个小时,而且明显希望它赢。他的结论是 Claude Code 像一个围绕长时间编码会话打磨过的终端应用,Codex 则是粗野的。他具体想要的东西:agents 视图,一屏看到跨项目、跨 worktree 的所有独立会话,谁在跑、谁在等输入、谁完成了,还能直接在总览里回复;Ctrl+O 折叠记录,免得长任务把对话埋进工具日志里;MCP 在后台连接而不是卡住会话启动;/cd 把当前会话挪到另一个目录还保住对话和提示缓存;以及状态栏能跑一条命令、你打印什么它就渲染什么,而不是在固定清单里挑顺序。
@DaviddDotTech [Claude Code]
Claude Code#11
https://x.com/DaviddDotTech/status/2087458172311126055
对最近刷屏的交易机器人体裁的一记必要反击。他受够了"日本学生用 Claude Code 赚了 75 万美元"这类帖子——不是因为 AI 不能交易,而是他每周都在用 AI 做策略,知道这活到底要付出什么。他的真实数字:五年里回测过 2000 个策略,400 个盈利,现在实际在用的是 7 个。流程是先用 Claude 回测,再拿没见过的实盘数据孵化三个月,通过了才在小号上加仓,大约 95% 的策略会死在这个漏斗的某一环。用他的话说,"我扔掉了 1600 个策略"是拿不到转发的。
@SlavaOPs [Claude Code]
Claude Code#12
https://x.com/SlavaOPs/status/2087608299743039671
一次很细致的溯源,展示一个真实结论是怎么在传播中变形的。Karpathy 对 Claude Code 的吐槽是真的,Forrest Chang 把它提炼成四条规则的 CLAUDE.md 也是真的,那个仓库确实在 GitHub Trending 上连续 28 天挂在第一。对不上的是一篇广泛流传的日文改写里那个统计数字——说准确率从 65% 提到了 94%。所有英文原始报道讲的都是另一个指标:四条规则把出错率从 41% 降到 11%,扩展到十二条后降到 3%。同一个仓库、同一套规则,一个数字在转述链条里悄悄变成了另一个数字,而没人回头核对。
@Jasperli0122 [Claude Code]
Claude Code#13
https://x.com/Jasperli0122/status/2087668066734014574
用 Claude Code 替掉了公司的调研工具栈。他敲一句"明天见 Cursor,给我做个简报",三十秒后拿到人员规模、融资情况、股权结构和新闻信号。整份档案的成本他报的是六美分。不用买 Clearbit 席位,也不用捆 HubSpot。这是最近反复出现的那种安静的品类杀手:被替掉的工具,其实大部分钱收的是数据组装,而不是数据本身。
@FitimBozar [Claude Code]
Claude Code#14
https://x.com/FitimBozar/status/2087652993587941472
他关注的一个开发者本周把一条六步的 n8n 自动化换成了一句 Claude Code 提示词,产出一样,不需要可视化流程编辑器,搭建时间从 90 分钟降到 12 分钟。观察很小,含义很大,而且他的判断是对的:agentic 编码工具不是在正面竞争,是从内部把流程自动化平台吃掉。
@JacqBots [Claude Code]
Claude Code#15
https://x.com/JacqBots/status/2087657143004491814
今年已经退掉了二十多个订阅,因为现在自己造替代品比租便宜。最近阵亡的是 Mailchimp——她每月付钱只为了发一封 newsletter,于是打开 Claude Code,自己做了个 AI 驱动的 newsletter 面板,订阅者名单也放在里面。
@stretchcloud [Claude Code]
Claude Code#16
https://x.com/stretchcloud/status/2087668450877648905
上周是 Linear 历史上第一次,通过 MCP 创建的 issue 数量超过了在应用里创建的。这个 issue 追踪器现在主要由编码 agent 驱动,而不是坐在屏幕前的人:Linear 的原生 MCP server 接进 Claude Code、Cursor 和 Codex,agent 可以开 issue、改状态、分诊 bug、推进待办,全程不碰界面。他的判断是,任何管理结构化工作数据的产品,MCP 接口会在 18 个月内成为主导的创建入口,他拿来类比的是 Datadog 最终从自动埋点接收的数据超过了手工配置。
@ATALAS_tech [Claude Code]
Claude Code#17
https://x.com/ATALAS_tech/status/2087569425935319251
这周他用 Claude Code 复活了 2019 年写的一个 React Native 习惯追踪应用,那会儿 Expo 还不完善,得自己在 Xcode 里跑原生、自己接所有东西。迁移清单正好是大家最不想干的那类活:升级 React Native、换导航库、迁回 Expo——手工做这一步是真的痛苦。他还让它把登录和所有服务端连接全部剥掉,因为这个应用本来就只需要活在一台手机上,顺手建了本地 SQLite 数据库,又把布局适配到当年根本不存在的大屏手机。他的结论是:开发流程里最耗时间的那些琐碎部分,才是 AI 真正发光的地方。
@0xShoopy [Claude Code]
#18
https://x.com/0xShoopy/status/2087654247085261016
总结了 Boris Cherny 现在的实际工作方式,主线是"规格压过提示词"。他不写代码,他写精确到"两个工程师照着做会做出同一个东西"的规格说明;理由是范围一含糊,你就等于把决策权交给了模型。每份规格交给一个独立 agent,五到十个并行跑,各自开 PR,Claude 先把每个 PR 审一遍,在人类介入前抓掉大约 80% 的 bug。他习惯喝咖啡前在手机上把 agent 启动,等坐到桌前时一半 PR 已经好了。
@gmharhar [Claude Code]
Claude Code#19
https://x.com/gmharhar/status/2087638624166711561
为了 API 发布,他们跑了一场 24 小时的 AI 新闻直播网络,产出 100 多个原创片段,合计三百多万曝光。制作细节才是真正扎眼的:整场出自一个 Claude Code 会话,算力账单大约五万美元。这两个数字都重要,因为持续生成的 token 成本正是大多数这类演示会略过不提的那个数。
@cyrilXBT [Claude Code]
Claude Code#20
https://x.com/cyrilXBT/status/2087389109920923806
gstack 把单条 Claude Code 工作流拆成产品、工程、QA、评审、发布五条通道,一共 23 个工具。/office-hours 把一个粗糙想法变成真正的产品规格,/plan-ceo-review 和 /plan-eng-review 在写代码之前先把计划往死里拆,/review 找 bug 并顺手修掉,/qa 真的拉起一个浏览器做端到端测试,/ship 跑完最后检查并推 PR。想清楚、做计划、构建、评审、测试、发布、复盘。Garry Tan 说靠这套配置,他在全职运营 YC 的同时,60 天内上线了三个生产服务和 40 多个功能——值得关注的是这个说法,而不是星标数。
@ant0ni0_r0mer0 [Claude Code]
Claude Code#21
https://x.com/ant0ni0_r0mer0/status/2087442217468121221
一条 Claude Code skill,喂一个产品链接,五分钟内吐出十条成品 Meta 广告,角度各不相同,覆盖漏斗的不同阶段。它会抓取竞品正在跑的实时广告,找出没人在用的角度,逆向拆解这个品类里已经跑赢的钩子,再把 ICP、痛点、客户原话整理成完整 brief,最后把概念、文案和视觉方向作为一个包交出来。他对广告公司到底在收什么钱的判断很锋利:你付的从来不是创意钱,是 brief、提案 deck、几轮修改,还有那条安静三天的 Slack 消息。他说其中一个账户从每周一个新角度变成了每天五个。
@purvag_patel [Claude Code]
Claude Code#22
https://x.com/purvag_patel/status/2087674028714500164
他说 IDE 正在死掉,iPad 已经是他的开发环境。每天一到两小时,在 iPad 上同时驱动好几个远程 Claude Code 会话:设定目标、读回传的内容、需要时再钻进改动里,测试和部署也交给 Claude。连 Slack 汇报和跟进邮件都是 Claude 发的,团队已经习惯了收到"他的 Claude"的消息而不是他本人。iPad 不是噱头——按他的说法就是够便携、屏幕够大能读,因为现在的工作内容本来就是读。
@sumika45379 [Claude Code]
Claude Code#23
https://x.com/sumika45379/status/2087667964963439038
他推荐的是 obra/superpowers 里那条专门用来对话推演的 skill,这个项目在 Claude Code 圈子里拿到了 26 万以上的支持。它解决的是那种跟自己开会永远开不完的状态:想做什么隐约看得见,一聊就散,一天过去什么都没定下来。这条 skill 一次只问一个问题,你想到什么答什么,最后落下来的是一页设计备忘,目的、做法、明确不做的范围都填好了。他的建议是:别再等想清楚了才开始讨论。
@AiDevCraft [Claude Code]
Claude Code#24
https://x.com/AiDevCraft/status/2087654758882697425
今天最能迁移的一条洞察,藏在一条回复里。规格之所以有效是因为你写了完成条件——本质上你规定的是后置条件而不是步骤,于是无论执行者是 Codex 还是 Claude Code,产出都会收敛到同一个结果。他的结论是:真正决定可移植性的分水岭不是 Markdown 还是 Skill,而是你写的是命令式的步骤,还是声明式的目标。
@hasan_ab_hasan [Claude Code]
Claude Code#25
https://x.com/hasan_ab_hasan/status/2087615104934093191
他那个工程系列的第 27 块,正对着用 Claude Code 做应用的人。场景是:下单按钮测的时候好好的,某天有人点了一下,转圈一直转,什么都没回来,于是他又点了一次——其实第一次已经成功了,只是回执没送到。读操作重试是安全的,写操作不是;而这时候有三样东西同时想重试:用户的手、你的重试逻辑、浏览器重发表单。解法是幂等性:用户下决心那一刻生成一个 key,之后每次尝试都复用同一个,服务端存下处理过的 key 和当时的响应,再见到就直接回放。Stripe、Adyen、PayPal、Square 全都内建了这个,因为它们默认你的请求会到两次。他真正想说的是那句元层面的:你不需要自己写这段代码,你需要知道有这么一块,才知道该开口要。
@kleen_pulse [Claude Code]
Claude Code#26
https://x.com/kleen_pulse/status/2087616473892323389
Claude Code 需要你的时候不会告诉你,所以它可能在一个权限确认后面干等二十分钟,而你在另一个窗口里以为它在干活。他做了 Companion TTS 就是为了这个:一个悬浮控件,一边把 Claude 的输出念出来让你能同时干别的,一边在它卡在权限、提问或计划审批上的瞬间提醒你。免费、开源、离线神经语音、不需要 API key。
@TahiGichigi [Claude Code]
Claude Code#27
https://x.com/TahiGichigi/status/2087667093323841537
他试过 /caveman 和 /i-have-ADHD 来让 Claude 少说废话,发现多轮会话跑久了它照样飘回长篇大论。于是他把 Say Less 做成一个原生 Claude Code 输出风格,再配一个 hook,每一轮都把这条 skill 重新注入一次。小工具里埋着一条可以推广的教训:只调用一次的 skill 会在长会话里衰减,hook 才是让它留住的办法。
@interplanetary [Claude Code]
Claude Code#28
https://x.com/interplanetary/status/2087673934384976274
对 Claude Code 智能体间消息机制的早期评价。能跟一个"侧边 agent"对话而不是子 agent,边跑边引导边推一把,这打开了发射后不管的子 agent 模式给不了的空间。他在同一句话里也点了代价:大概也会带来一些漂移。
@aruntikaram [Claude Code]
Claude Code#29
https://x.com/aruntikaram/status/2087660799087067188
值得作为安全时间线记一笔。Claude Code v2.1.227 上线了从远端同步 skill 的能力,v2.1.228 在一天之内就把这些 skill 加固了,让它们无法覆盖本地命令、也不能触发 shell 展开。上线一个分发通道,再把它打开的注入面补上,全程不到二十四小时。
@divyaranjan_ [Claude Code]
Claude Code#30
https://x.com/divyaranjan_/status/2087649212955865427
他好奇 Grok Bot 底下是怎么工作的,结果发现它相当大一部分原始源码通过 Mac 应用里附带的 source map 暴露了出来,包括 agent harness、系统提示词、工具、子 agent 和 MCP 相关的东西。他的备注是:几个月前 Claude Code 犯过一模一样的错。这就让它从意外变成了模式——harness 才是护城河,而它一次次被打进发行包里。
@laoyingkhq [Claude Code]
Claude Code#31
https://x.com/laoyingkhq/status/2087441413042774487
他在 GitHub 上翻到三个开源的 Polymarket 交易机器人,同等功能买付费版要好几千美元,于是用 Claude Code 改了配置再跑。值得抄的是顺序:先模拟跑一遍,确认没问题,然后才上真钱。他最后那句判断也站得住:付费不一定比开源强,真正的差距在于你会不会改、会不会测、能不能接进自己的系统。
@OmoleUsuangbon [Claude Code]
Claude Code#32
https://x.com/OmoleUsuangbon/status/2087621989733179406
他没有去订阅 CRM,而是用 Claude Code 给公司做了一个:跟踪线索、监控销售业绩和出勤率、生成报表、发邮件。他另外还做了一个收入与支出追踪工具,能看出收入究竟从哪儿来、钱主要被什么吃掉。他的说法是,大部分你要付月费才能用的平台,现在都可以按自己的口味做出来,而且更好用。
@krispuckett [Claude Code]
Claude Code#33
https://x.com/krispuckett/status/2087670418987708734
一年、每月 200 美元的订阅,全部通过 Claude Code 产出:上线了一个完整的 iOS 应用,然后是更好的第二个,接着是 NEUMA,外加多篇持续更新的长文和一堆自己每天在用的小工具。他很清楚每月付得起这笔钱本身是种特权,并且把这份责任理解成"做出配得上它的东西",而不是效率提升。
@ebiowei_ [Claude Code]
Claude Code#34
https://x.com/ebiowei_/status/2087479203629253095
他上线了 Stand Up Buddy,一个提醒你久坐该站起来的小型桌面应用,完全用 Claude Code 做的,Mac 和 Windows 双平台免费。软件本身平平无奇,而这恰恰是重点:做完并发布一个跨平台桌面小工具的门槛,已经低到为了一个小烦恼就值得动手了。
@mdam10x [Claude Code]
Claude Code#35
https://x.com/mdam10x/status/2087557672442925331
他做了个让 Mac 全天候不休眠的应用,起因是每次合上盖子,正在跑的 Claude Code 任务就死掉。现在有 26 个下载,他自己觉得挺不可思议——而这才是真正的信号。长时间运行的 agent 会话正在催生一小类基础设施需求,在笔记本还只是笔记本的年代根本不存在。
@gianmauric [Claude Code]
Claude Code#36
https://x.com/gianmauric/status/2087611262658089413
他前一晚扔给 Claude Code 一个大任务让它继续搭应用,第二天早上检查、补上反馈和新功能,又启动了一轮。十二个小时之后,那个会话还在从最初那一条提示词往下跑,还剩三个点没做完。不管是不是像他猜的那样破了纪录,"单条提示跑十二小时"现在已经是会真实发生的事,而不是演示。
@BLOOM_AIfun [Claude Code]
Claude Code#37
https://x.com/BLOOM_AIfun/status/2087674188689793097
他做了个面板,把后台正在跑的子 agent 画成一群来上班的小动物:干活时坐在工位上,跑完就走去休息区,鼠标悬停能看到当前在做什么任务,对话也能当历史记录翻。实现刻意做到零依赖:用 Claude Code 的 PreToolUse/PostToolUse hook 自动收集子 agent 的启动和结束,只用 Python 标准库起一个本地 HTTP 服务分发,角色和背景全是当场生成的 SVG,一张图片素材都没有。因为光靠 hook 抓不准子 agent 的结束时刻,他改成"最近十分钟有动静就算在岗"。设计返工了两次,画风最后落在绘本调;插画部分走了 Gemini,因为 API 出不来想要的效果,设计和实现仍然归 Claude Code。
@cg_ftLab [Claude Code]
Claude Code#38
https://x.com/cg_ftLab/status/2087674712956850540
他半夜让 Claude Code 自动装好了 LTX 2.5,然后在 DGX Spark 上实测:1024x768、五秒的视频,带放大处理,不到一分钟就跑完,而且显存占用相当低。质量评估留到周末。事情不大,但"无人值守装好再跑基准"这个模式,已经出现在硬件评测环节里了。
@TheDavidTai [Claude Code]
Claude Code#39
https://x.com/TheDavidTai/status/2087674375260508528
一条值得存档的具体回归报告:Windows 上最近三个版本的 Claude Code 配合扩展使用时,似乎有个 bug 会让 bypass 权限失效。2.1.227 看起来是最后一个默认进入 bypass 权限的版本,而且一旦你把它关掉,就再也切不回去了。
@polsia [Claude Code]
Claude Code#40
https://x.com/polsia/status/2087674179164533057
他的诊断是:AI 编码 agent 的瓶颈从来不是能不能用上,而是治理。于是他做了 Cogshift,把 Devin、Claude Code、Codex 这类工具包起来,配上 SLA、审计轨迹和人工升级层级。Agent 当班,工程师待命——比大多数"全自主"的说法诚实得多。
@spotTheGap [Claude Code]
Claude Code#41
https://x.com/spotTheGap/status/2087674911636504918
一句话,一个好主意:大多数人卡在"玩过 agent 演示"这一步,是因为从没把它接到任何真实的东西上。他建议的第一件真事是:把你的银行流水丢进 Claude Code,你多半会发现自己在为某样早就忘了的东西持续付钱。
@cpp_akira [Claude Code]
Claude Code#42
https://x.com/cpp_akira/status/2087510827691913358
一个小但可复用的性能调优技巧。当 Claude Code 说"差不多到极限了"的时候,回一句"再好好查一查",它还能继续把速度往上提。它宣称的极限不是真的天花板,只是它停止寻找的地方。
@aymanchafai [Claude Code]
Claude Code#43
https://x.com/aymanchafai/status/2087478355809521690
他用 Codex 做特定任务,尤其是把故事线的细节规划到很深,然后把执行交给 Claude Code。Codex 负责规划,Claude 负责执行,他说这个分工出乎意料地好用。写法很简单,但这已经是本周第三还是第四个独立出现的同一种双模型分工了。
🗣 用户心声
用户心声

做减法正在压过做加法,而喊得最响的恰恰是离工具最近的人。@shmidtqq 转述的那条"每半年把 CLAUDE.md、skill 和 hook 全删一遍,先看看模型在没指导时能干到哪儿",跟"Claude Code 自己的系统提示砍掉八成反而更好"是同一个方向——而市场还在拼命卖更大的 skill 包。

写后置条件,别写步骤。最清楚的表述来自 @AiDevCraft:写完成条件意味着你规定的是后置条件,于是不管执行者是 Codex 还是 Claude Code,结果都会收敛到同一处;可移植性的分界是声明式目标对命令式步骤,而不是 Markdown 对 Skill。@0xShoopy 描述的"精确到两个工程师会做出同一个东西"的规格,是同一条原则在另一个尺度上的样子。

Agent 卡住时不会吭声,于是大家开始自己造警报。@kleen_pulse 因为一个静默的权限确认反复损失二十分钟,索性做了个语音伴侣;@TheDavidTai 连着三个版本被 Windows 上的 bypass 权限回归卡住;@mdam10x 为了不让笔记本掐死过夜任务,专门写了个应用。运行中 agent 的可观测性,到现在还是用户自己往上打补丁。

指令会在长会话里衰减。@TahiGichigi 发现 /caveman 这类塑造输出的 skill 跑几轮之后就飘回去了,解法是用 hook 每轮重新注入一次。@interplanetary 从另一头指出同样的风险:智能体间消息能带来更多引导,大概也会带来更多漂移。

编造成功案例的体裁已经大到"辟谣本身就是服务"的程度。@DaviddDotTech 拿自己的数字(回测 2000 个策略、400 个盈利、实际在用 7 个)去顶"学生用 Claude Code 赚了 75 万"那波;@SlavaOPs 则完整追出了一个真实的 Karpathy 结论如何在转述链条里变成一个假统计。两条都比它们纠正的原帖有用得多。

真正卡住人的是成本,不是能力。@aboss 那场三周调查的瓶颈是钱不是模型质量,@gmharhar 的 24 小时直播背着大约五万美元算力账单,@gianmauric 让一条提示跑了十二个小时,而围绕 Claude Code 临时提额即将到期的焦虑贯穿了一整天。
📡 生态产品雷达
生态产品雷达

Claude Code、Codex、Cursor 依然是今天几乎每一条工作流里的三方参照系。除此之外:

Orca —— 把同一个任务同时丢给 Claude Code、Codex、OpenCode 和 Cursor,各自跑在隔离的 git worktree 里,最后比对并合并胜出者;作为"并行 agent 控制室"被反复提到。

Graft —— 把代码库知识固化成仓库里的卡片,让 agent 不必每次重读整个项目;宣称在 162 次受控实验中节省 42% token、46% 工具调用、60% 时间,MIT 协议,不用向量嵌入。

Statewave —— 开源记忆运行时,核心不是容量而是来源可信:访问控制、防篡改审计轨迹、记忆溯源、完全自托管,兼容 Claude Code、Cursor、Windsurf 和 MCP 客户端。

MCP —— 已经从"集成方式"变成"输入层",Linear 报告通过 MCP 创建的 issue 首次超过了应用内创建。

Ollama —— 标准的本地边车,既被当作免费的编码后端,也在 claudish-to-english 插件里充当那个负责改写的模型。

Grok Build / Grok Bot —— 本周新的对比靶子,好几个人拿它和 Claude Code 对照测试;而它的 source map 泄露 harness 的方式,跟 Claude Code 当初一模一样。

gstack、obra/superpowers、Claude Fast —— skill 集合层,如今大到"筛选和删除"本身才是真正的技能。
← 上一篇
强模型给弱模型搭个 harness,弱模型就变聪明了
下一篇 →
运营日志: 2026年8月14日
← 返回所有文章

评论

加载中...
>_