2026年10月9日super-user

超级用户日报: 2026-10-09

周二是 Haiku 5.5 发布日,但有意思的不是发布帖,而是一小时之内大家拿这个便宜模型干了什么:三位互不相识的用户各自发了同一张四模型组织架构图(Opus 做规划或当顾问、Sonnet 改代码、Haiku 负责读、Fable 或别家模型做评审),还有一位用户把 Karpathy 式的 autoresearch 对准了自己的 Claude Code 账单。最硬的故事都和恢复、验证有关,而不是生成:一次 auto mode 会话毁掉整块硬盘后 98% 的数据恢复,一个 Claude 实例自己写了 32 次权限拒绝的 bug 报告,一个监控脚本抓到了 Ben Thompson 那台 Mac mini 上的挖矿程序,还有 12 次修复里 2 次「测试全绿但悄悄改坏了」的结果,让绿色的测试套件看起来像个隐患。非编码用途继续扩张:每天早上往 Slack 推送的酒店预订核对器、用公开数据发现的系外行星、一张立绘生成的 VRM 虚拟形象、带来 400 万美元收入的 Slack 提醒,以及 19 分钟内用 9 个 n8n 工作流替掉每年 983 美元的 SaaS 订阅。OpenClaw 这边的分化已经摆在明面上:一边是企业版和硬件玩家(esp32 节点、VPS 车队、团队共享实例),另一边是源源不断解释自己为什么转投 Grok Bot 或 Dots 的用户。
@mirku21 [Claude Code]
#1
https://x.com/mirku21/status/2107939129736700335
Haiku 发布日传播最快的配置:claude --advisor opus --subagents haiku。Sonnet 5.5 以 high effort 跑主会话,写 diff、跑测试;Haiku 5.5 子代理以每秒约 340 token 的速度并行扫仓库,负责找文件和查规格文档;Opus 5.5 在后台当顾问,平时沉默,只在三个节点介入:计划锁定前、同一个测试连挂两次时、宣布完成前。一句话规则:高档位做计划,中档位做委派,Opus 随时待命。
@dr_cintas [Claude Code]
#2
https://x.com/dr_cintas/status/2107939634705559974
同一套四角色结构的第二篇写法,把理由讲透了:Opus 做计划并复核最终代码,Sonnet 是干活的工人,负责改文件和跑测试,Haiku 拆成读代码库的探索者和拉文档的研究员,Fable 5.1 用 /advisor fable 挂上,Opus 在决策点带着完整对话记录去问它。让 Haiku 只读不写的依据是 Anthropic 自己的数字:Terminal-Bench 4.0 上 Haiku 39.2%,Sonnet 70.6%。成本账算得很直接:用每百万输入 4 美元的模型去检查一个文件存不存在,Haiku 只要 0.1 美元。
@unknownnode404 [Claude Code]
#3
https://x.com/unknownnode404/status/2107829293887684700
反方向的路由树:所有限定范围的任务一律从 Sonnet 5.5 开始,第六轮左右做一次真实验证;只有失败时才停掉会话,打包一个干净的 2 万 token 交接,然后新开 Opus。引用的倍率是 Opus 在 2 万上下文时 1.88 倍、15 万时 1.49 倍、40 万时 1.26 倍,所以在 30 万 token 时才切换大约要 1.5 美元,而干净的 2 万交接只要 0.1 美元。目标不是少调 Opus,而是在 Opus 介入之前少浪费轮次。
@claudecode84 [Claude Code]
Claude Code#4
https://x.com/claudecode84/status/2107668172929384634
一次 /cost-audit 扫了 1,000 个任务里的 4,812 次调用,在一个看起来已经优化过的 agent 循环里找到三处漏洞,最大的一处是 Sonnet 向 Opus 升级得太晚。围绕这些失败重写路由器、交接和会话规则之后,同样的工作量从每月约 40 万日元降到约 29 万,每月省下约 11.2 万日元。作者的说法是:Claude Code 不只写代码,还能审计 AI 系统本身的浪费。
@PerceptualPeak [Claude Code]
#5
https://x.com/PerceptualPeak/status/2107720127181738135
当天的警示案例。一位从 Opus 4.6 时代起就用 --dangerously-skip-permissions 跑数小时无人值守会话的用户,在 Opus 5.5 的 auto mode 下,因为一个简单的 PowerShell 语法被改坏,丢掉了大半个 C 盘。靠每日备份恢复了 98% 的数据,随后自己加了确定性的防护,让这种事不可能再发生,并直说原本以为确定性 hook 应该是 harness 自带的。后续帖子把责任说清楚了:是自己选择跳过权限模式,对模型信任过头了。
@Compilethings [Claude Code]
#6
https://x.com/Compilethings/status/2107917607588553032
一份少见的文档:auto mode 分类器的 bug 报告,由跑这些会话的 Claude 实例自己写的。在一台 Windows 工作站上一个月的多 agent 构建里(编排器、子代理、Codex 评审环节、git worktree,大多是夜间无人值守),对话记录里有 15 次会话共 32 次拒绝。实例自己做了分类:15 次拖累工作流且没有安全价值,5 次可商榷,12 次分类器判对了。最大的一类是没法杀掉自己启动的挂死子进程,7 次拒绝都归在「干扰工作负载」下,包括孤儿 git fsck 和自己启动的卡死 pytest 进程树。每一条都附上了确切的调用、分类和它能想到的最小修法。
@babayagatwt [Claude Code]
Claude Code#7
https://x.com/babayagatwt/status/2107689432057053609
Stratechery 的 Ben Thompson 有一台常开的 Mac mini,上面只跑 Claude Code 和 Codex。因为 TCC 权限弹窗只在图形界面出现,为了给 agent 点确认,Thompson 一直开着 macOS 屏幕共享,于是 5900 端口暴露在外;一个已知 CVE 让攻击者拿到 root 并装了门罗币挖矿程序,自动更新又漏掉了那个小版本补丁。抓到它的是 agent 每 30 分钟跑一次的监控循环:发出紧急警报,自行停止执行命令,并标记该账户现在可以无密码执行管理员命令。随后 Thompson 用 Claude 挖出恶意程序、锁定入侵发生的那四秒钟、写了个监视器,然后把机器抹掉重装。
@stas_sorokin_ [Claude Code]
Claude Code#8
https://x.com/stas_sorokin_/status/2107833309006794967
一次受控对比:把 DeepSeek V4.1 Flash 接进 Claude Code,和 Sonnet 5.5 比,同样 6 个带 bug 的仓库,各跑两次,用隐藏测试打分。Sonnet 12 中 12,DeepSeek 12 中 10;每修一个 bug 的成本分别是 0.052 美元和 0.015 美元,中位耗时 12 秒对 28 秒,agent 轮次 4 对 13。反转在于 DeepSeek 漏掉的两次都通过了全部可见测试:其中一次为了修预订 bug 收紧了一个共享的重叠检查,顺手把依赖它的区间合并悄悄改坏了。结论:开源模型要用隐藏测试打分,别看绿勾。
@YoussefHosni951 [Claude Code]
Claude Code#9
https://x.com/YoussefHosni951/status/2107940601224368292
Meta 关于 RankEvolve 的论文(一个 agent 自己改真实 ML 训练代码、跑实验的自主研究系统)测了一件很实际的事:96 个任务、预算大致相同,Claude Code 加预算正确率 33.3%,best-of-N 43.8%,Claude Code 复核 Claude Code 45.8%,Claude Code 接 Codex 再接 Claude Code 62.5%。异构复核还把静默严重缺陷率压到 10.4%,而单纯加预算是 27.1%。解释是错误相关性:Claude 复核 Claude 的相关系数是 0.58,换一家产品来复核就低得多。
@theo [Claude Code]
Claude Code#10
https://x.com/theo/status/2107765823637168287
Theo 这条审计提示词值得抄走。几个月里 agent 写了两百多个糟糕的 watch-pr 脚本,于是这条提示让 agent 翻自己在这台机器上和 Claude Code、Codex 等工具的全部历史,找出每一次被要求盯 PR 或看管 PR 的请求,数一数「看管逻辑」被重新发明了多少次、多少个实现有肉眼可见的缺陷,以及搭建它们和处理它们的毛病大概烧掉了多少 token 和多少钱。
@0xbobaaa [Claude Code]
#11
https://x.com/0xbobaaa/status/2107892817292939588
一笔具体的子代理账:三个子代理一天干了 32.7 万 token 的活(97,112、110,900、119,221),主会话一个字都没看到,因为每个子代理从空白上下文起步、并行运行、只回传一段简短摘要。整套配置就是 .claude/agents 里的一个 markdown 文件,写上名字、描述和可用工具,再加一条「回复不超过五行」的限制,好让主代理的上下文一直很小。
@yurshevv [Claude Code]
Claude Code#12
https://x.com/yurshevv/status/2107952968867745864
一位 18 岁用户的七人 agent 文件夹,以及推着他们做这件事的算术:Anthropic 说普通 Claude Code 开发者每天花 13 美元,一年 3,250 美元,是美国开发者中位数年薪的 2.4%。.claude/agents 里的团队是 Chief(只派票、从不写代码)、Crawler(先读仓库)、Plan(只在计划模式)、Code、Test、Review(一个不能改文件、只能说不的 Haiku 模型,没有测试的一律打回)、Security(从 diff 里揪密钥)和 Docs。他们学到的是:模型不是到第二个小时就变笨了,而是一个对话在干七份活。
@sgarlen01 [Claude Code]
Claude Code#13
https://x.com/sgarlen01/status/2107817971972186505
9 个 n8n 工作流、67 个节点、零手工拖拽,19 分钟。提示词只有一条规则:把人们花钱买的工具替掉,坏了自己修,我不帮忙。现在笔记本上跑着:每天 1,152 次 ping 的在线监控(替 UptimeRobot,每年 120 美元)、RSS 摘要(Feedly Pro,84 美元)、盯三个定价页的改动监控(Visualping,168 美元)、每天 96 次的 BTC/ETH/SOL 价格提醒(TradingView,179 美元)、发帖队列(Buffer,72 美元)、线索 webhook(Zapier,360 美元),外加提及追踪、死链检查和早上七点的报告。做法:npx n8n,把文件夹和付费工具清单交给 Claude Code,让它构建、运行、修到全部通过为止。
@MitcheIl [Claude Code]
#14
https://x.com/MitcheIl/status/2107858352130707853
一条一次成型的 Slack 提醒,作者说它今年带来了 400 万美元收入:X API 到 Claude 再到 Slack。只要有人关注了团队里任何一位成员,Claude 就去查这个人是谁,然后在频道里提醒。例子是:一家上市公司的创始人关注了一位同事,他们原本没注意到,提醒抓住了,随后发了私信。作者的说法是,这种带着好感的关注,转化率比冷私信高一百倍。
@p_rabtsevich [Claude Code]
Claude Code#15
https://x.com/p_rabtsevich/status/2107803715310956923
花两周时间试图证伪一颗候选系外行星:用 Claude Code 和 Codex 做了 74 次独立分析、写了一千多个脚本。最得意的检验是轮流隐藏其中一年的数据,让另外两年去预测恒星何时变暗,三次全对。当天好几个账号都把它当成「用 vibe coding 搞天文学」的故事转了。
@ancororin2222 [Claude Code]
Claude Code#16
https://x.com/ancororin2222/status/2107834114489647352
一位日本的民宿经营者一上午就把 beds24 和 PriceLabs 接进了 Claude Code。系统把预订情况和住客名册做比对,每天早上把当天的入住状态和还没提交资料的住客名单推到 Slack。计划是先跑一段时间,确认抽取没问题,再让它自动发提醒。
@mehulmpt [Claude Code]
Claude Code#17
https://x.com/mehulmpt/status/2107637427087290848
一套自定义视频剪辑工作流,本质上是一个 AI 驱动的视频剪辑 CLI,加上 Claude Code 主 harness,再加一个浏览器用来预览。当天发到 YouTube 的视频完全由 Opus 5.5 剪辑。Claude 自己提出的窍门是:分块剪辑而不是一次过,这样改某一块只需重新渲染那一块(贵),再和其余部分拼接(快)。作者的判断是 Claude 正在取代他们所有的剪辑工具。
@claudecode84 [Claude Code]
Claude Code#18
https://x.com/claudecode84/status/2107769929072366048
一个用 Opus 5.5 在 Claude Code 里搭出来的动态设计工作室,Fable 负责读真实的需求文档:编辑器有图层、画布、检查器和时间轴,全部由一个函数 renderFrame(project, t) 驱动。Fable 把 12 张参考图、2 套字体、214 个词的文案和一个 logo 变成场景结构和初版时间点。人的每次调整都以滑块值或关键帧存进 project.json,预览和导出用同一个函数,所以不存在第二个渲染器的问题,一个项目在 16:9、1:1、9:16 三种格式下渲染了 5,400 帧。诚实的数字是:agent 放置的 38 个关键帧里,人手动挪了 27 个。
@saera_ai [Claude Code]
Claude Code#19
https://x.com/saera_ai/status/2107863001693049090
一个头发和裙子会动的 VRM 虚拟形象,从一张立绘生成,用的套件默认走 Codex,但换成了另一套组合:Claude Code 负责制作,Codex CLI 生图,Claude in Chrome 操作 Tripo,Blender 通过 MCP 加脚本驱动。卡住的地方都列出来了:Tripo 返回的拆分部件转了 90 度,Smart UV 在某些部位停住,只好在 Blender 里手建 UV,组装时顶点误差略超容差,连帽衫下摆得改挂到腰上。在需要判断的节点咨询了 Fable 顾问,Tripo 积分含试用一共用了 280 左右。
@rewind02 [Claude Code]
Claude Code#20
https://x.com/rewind02/status/2107843285737738656
在 Unreal Engine 5.8 里重建汉堡市政厅,没有一处是手工雕的。Claude Code 通过 MCP 连接 Blender 和 Unreal,Opus 写 Python 从参数文件生成建筑(体块、立面、装饰、窗户、雕像、材质),高度和比例来自市政府公开的官方 3D 模型,Opus 渲染对照图去比对照片和街景,每次构建导出前都跑法线和可见性检查,最后作为一个 Nanite 资产进 Unreal。教训是:量出来的,不是猜出来的。屋顶看起来太陡,但测绘数据说它是对的,街面照片估的高度常常差一到两米。
@ClaudeCode_love [Claude Code]
Claude Code#21
https://x.com/ClaudeCode_love/status/2107721838256332904
一个在 Unreal Engine 5.8 里做出来的可玩游戏,一根 Blueprint 都没手连,用的是 Epic 官方的 Claude Code 插件,开着 MCP 和 AllToolsets。请求顺序是:先要一块带道路、围墙、村庄和塔的占位地形,再要三个宝珠和一扇上锁的门,再要一个敌人,最后才是画面。每条提示都带四样东西:完成条件、不许改动的地方、动过的地方清单,以及「做不到就停下,别悄悄绕过去」。
@ClaudeCode_love [Claude Code]
Claude Code#22
https://x.com/ClaudeCode_love/status/2107974251567521994
一个以 N64 的 F-Zero X 为蓝本的浏览器竞速游戏,两天做完,创作者负责玩,Claude Code 负责做。房间内在线对战,18 辆赛车由 Nano Banana 出图、Tripo 转 3D,音乐来自 ElevenLabs。方法就是「玩一轮、发一轮笔记」重复了 13 次,创作者说这几乎没怎么消耗 Claude Code 的额度。代码和 agent 用到的技能都放在了 GitHub。
@FavioVaz [Claude Code]
Claude Code#23
https://x.com/FavioVaz/status/2107974548842787288
Haiku 5.5 的发布视频,由 Haiku 5.5 用开源的 showtime 工作室做出来的,Claude Code 里一条提示,没有人工修改:30 分钟,0.66 美元的 token。它从发布页规划了六个场景,每个数字都和页面核对过,选了音乐并剪辑,给价格和基准跑分做了动画,渲染终稿前还让一个评审 agent 审了草稿。showtime 在本地渲染,不需要 GPU。
@Voxyz_ai [Claude Code]
Claude Code#24
https://x.com/Voxyz_ai/status/2107788275746578771
有人用 Opus 5.5 把 Adobe 五大件用 Rust 从头重写并开源了:对应 Photoshop、Lightroom、Premiere、Illustrator、Acrobat。光 PhotoCraft 就有图层、蒙版、调整图层和图层样式,能读写真正的 PSD 文件。五百多条命令由界面、CLI 和 MCP 服务器共用,所以人能点的 agent 都能做;建议的用法是把一整个文件夹的图片交给 Claude Code 批量调色、锐化、导出。开源一周 PhotoCraft 就有了 4,500 颗星,提交记录里 Opus 5.5 是共同作者。
@defileo [Claude Code]
Claude Code#25
https://x.com/defileo/status/2107886078841729342
周二被半个增长圈转发的 Cal AI UGC 流水线,最具体的一版:一个 Claude Code 编排器统管 Apify、Higgsfield 和 Postiz,十个步骤、十三条提示。Apify 扫最近 30 天的 TikTok 和 Instagram,标出播放量异常的视频(1 万到 12 万),一个视频分析器带时间戳拆解开头钩子,Higgsfield 生成镜头(主镜头用 Seedance 2.5,便宜的 B-roll 用 Kling 3.0,先试拍一条),FFmpeg 把真实的 App 录屏剪进去保证界面准确,Postiz 给四个平台各出草稿,按每个平台自己的历史数据判断。每次测试只换钩子。六道审批门把它拦在选片、概念、付费生成和每次导出之前,付费批次开始前先显示成本。
@MengTo [Claude Code]
#26
https://x.com/MengTo/status/2107862479548403806
MengTo 的付费网页应用打法,来自一位自称月经常性收入 10 万美元、原产品只占其中两成的作者:从每天用的工具里找点子,回头看老产品、问自己今天会怎么做,前端用 Opus 5.5、harness 用 Codex,先一次成型出基线再拆成部件,开头就定好技术栈(React、Vite、Supabase、Stripe),每个功能给一个高质量参考,加一层 AI 让工具能生成而不只是展示,让 AI 给自己的活打十分制并截图自己的错误,然后录 demo、到处发、把反馈贴回 agent。
@WorldModelMind [Claude Code]
Claude Code#27
https://x.com/WorldModelMind/status/2107828480083652947
一位在非技术大公司上班的开发者,连续 201 天每天用 AI 干活,近七天烧掉 93 亿 token,在国内一个 token 排行榜上排第 57。配置是一台服务器、一台显卡主机和一台 Mac,跑着 Claude Code、Codex 等好几个助手,各管一摊,共用一个记录偏好和踩过的坑的记忆库,它们会自己去翻,连 X 账号都由它们打理。最近十天用 Opus 5.5 从头到尾做科普视频,从查资料、写稿、写代码出画面到配音配乐渲染,人只管挑选题、定开头、挑毛病;有一期在抖音播放破万。
@starmexxx [Claude Code]
Claude Code#28
https://x.com/starmexxx/status/2107808914058154289
一位用户为什么取消了 Claude Max 和 ChatGPT Pro(合计每月 400 美元):五个开源仓库给家里每台设备都派了活。mlx-serve 讲 Anthropic API,Claude Code 改一个环境变量就指向 localhost;一个 agent 负责浏览器和 git,危险操作前先问(作者称 GAIA 一级 69.8%);iPhone 通过 USB-C 当第二块 GPU 跑 27B 模型的一部分;闲置的 RTX 3090 白天以每秒 127 token 跑 Qwen 3.8 27B,晚上挂到 Vast 出租,大约赚 50 美元;一台旧笔记本靠一个 YAML 文件微调模型。
@Oluwaphilemon1 [Claude Code]
Claude Code#29
https://x.com/Oluwaphilemon1/status/2107646847720341952
一个社区配方在免费的 Kaggle TPU v5e-8 上以完整 BF16 精度跑 Qwen3.8-27B:开 MTP 时解码约每秒 130 token,预填充约每秒 10,300 token,原生 262K 上下文,八路并发合计约每秒 540 token。一条 10 万 token 的提示大约十秒就吃进去。对编码 agent 真正有用的是它暴露了 OpenAI 兼容接口,Claude Code、Codex CLI 和 OpenCode 都能把它当后端,不用知道底下是 TPU。
@ishaan_jaff [Claude Code]
Claude Code#30
https://x.com/ishaan_jaff/status/2107667620044636297
LiteLLM 开源了 Moyai,他们团队每天在用的云端编码 agent。它兼容 Claude Code、Codex 和 OpenCode,通过 LiteLLM 跑在一百多家供应商上。他们放在最前面的数字:之前 Devin 账单是 101,872 美元,换成 Moyai 后是 21,700 美元,少了 79%。
@CaptainJeromeFr [Claude Code]
Claude Code#31
https://x.com/CaptainJeromeFr/status/2107694453796241604
来自乌布的一位独立开发者把 AI 团队里的经理撤了。原来在 Paperclip 里,一个跑最便宜模型的协调者把每个任务交给构建者再交给评审者,在步骤之间不断卡住,一个单行修复花了五小时 24 个任务。新配置是一个生产者 agent(Hermes)从头到尾负责一个交付物,一个用另一家模型做的独立评审者带截图,Claude Code 当副驾驶负责开任务和检查线上结果,协调者只是暂停而不是删除。模型按 Nous 的 Hermes Index 分数和单任务成本选:Opus 5.5 得 63,GPT-6 Astra 56,Sonnet 5.5 53,DeepSeek V4.1 Flash 37 且每任务约 0.26 美元。新循环跑了两次部署,零卡死。
@AndrewWarner [Claude Code]
Claude Code#32
https://x.com/AndrewWarner/status/2107930509284126970
Andrew Warner 给还在等 Grok Bot 接入 Claude 的人的捷径:直接让 bot 连上你的 AI 订阅。它会在自己的电脑上打开终端,安装 Claude Code 和 Codex 的命令行工具,你登录一次,之后它就把活派给其他模型。不需要 API key。
@Voxyz_ai [Claude Code]
Claude Code#33
https://x.com/Voxyz_ai/status/2107939019091005836
一份精简 AGENTS.md 的实用指南,依据是官方文档:Claude Code 建议控制在 200 行以内,因为文件越长模型越不照办,Codex 默认最多只读 32 KiB。Codex 在会话开始时从项目根目录到启动目录逐级读一遍,换目录不会重读;Claude Code 只在碰到某个子目录里的文件时才加载那个目录的 AGENTS.md,所以只对一个目录有效的规则应该放在那个目录里。在 Claude Code 里,@ 导入的文件启动时照样全量加载、一个 token 都省不了,每个已安装技能的名字和描述每一轮都占上下文(/skill-doctor 能看到各自的开销),/doctor prompt-audit 能找出写给旧模型的指令和互相矛盾的文件。
@petekp [Claude Code]
Claude Code#34
https://x.com/petekp/status/2107878774297727477
一个叫 Inbox 的 Claude Code mod:把会话里所有待处理的问题、任务和发现收进一个地方,方便逐条处理,Claude 解决一项就自己划掉一项。作者说它大幅减轻了自己的认知负担。安装只要一条 plugin 命令。
@omarsar0 [Claude Code]
Claude Code#35
https://x.com/omarsar0/status/2107880581216477417
Elvis 一年的时间线:先是单个 Claude Code 会话,几个月后变成带子代理的多 agent 配置,再后来是一个自建编排器之上、由大约八个专职 bot(CFO、CSO、CTO、CMO、幕僚长等)组成的常驻高层团队,最近一个月则是 agent 之间直接通信、上面再架一个个人 agent。坦白的提醒:自动化、webhook、系统提示和上下文检索都需要调,而且包括 Claude Code 和 Claude Desktop 在内的应用,都落后于模型已经具备的能力。建议是自己搭 harness,必要的话从 fork 开始。
@morganlinton [Claude Code]
Claude Code#36
https://x.com/morganlinton/status/2107946031543730586
Morgan Linton 正把本地跑的 Cursor、Claude、Codex 全部挪到云电脑上,模型和 effort 档位不变,先从一个项目的评测套件搬进 Claude 云会话开始。做法是让 Claude 给出一段可以贴进新会话的指令,然后让它跑。他们的说法是:电脑还是手机已经无所谓了,每台设备都只是云的瘦客户端。另一位用户说自己第一次几乎完全用手机、通过 Claude Code 云会话做完了一个项目。
@Genzoh1 [Claude Code]
Claude Code#37
https://x.com/Genzoh1/status/2107945247259202006
用 Claude Code 的第二天,这位用户已经让 Claude 通过 MCP 调用 Codex,分工像上司和下属:Claude Code 写任务单、调用 Codex、做评审、决定是否打回、提交代码;Codex 负责生成数据、跑测试、写报告。试手的项目是一个星空小应用。
@jpcardama [Claude Code]
Claude Code#38
https://x.com/jpcardama/status/2107889312708837786
另一位用户的同一思路:把 GPT、Grok 和 Kimi 当成 Claude Code 里的子代理,只要评审者不再是写代码的那个模型,评审质量马上上去。他们抛给 DHH 的问题是:当 Claude 和 Codex 在评审上僵住时,谁来打破平局,人还是第三个模型?
@AIGuide_ [Claude Code]
Claude Code#39
https://x.com/AIGuide_/status/2107667498669633871
一套完全在 Claude Code 里跑的找客户流程,不用 Clay:装上 Treg 插件,给它理想客户画像,让它找匹配的公司、每家挑两三位决策人、多源瀑布式查找并验证工作邮箱、补全账户信息、给每条线索打 1 到 100 分并用一句话解释、剔除没有验证邮箱的人、不许编造缺失数据,最后导出按匹配度排序的 CSV。
@dhaivatnj [Claude Code]
Claude Code#40
https://x.com/dhaivatnj/status/2107842112024908215
一位没有销售团队的独立 GTM 工程师:Clay 找信号(谁刚融资、谁在招第一个 SDR、谁在发帖说外呼不管用),Claude Code 写打分逻辑、补全脚本和消息变体,外呼每次只测一个角度、小批量发,几天没回复就砍掉。以前要一个周末的活现在一个下午做完。
@yihui_indie [Claude Code]
Claude Code#41
https://x.com/yihui_indie/status/2107776810717163616
一位独立开发者的小而典型的工作流笔记:他们现在用 Figma 更多而不是更少,因为让 Claude Code 操作 Figma 来设计页面,尤其是新增 SEO 内页,效果比直接在工程里 vibe coding 更好,而且设计稿更方便团队协作、保持风格一致。
@ClaudeCode_UT [Claude Code]
Claude Code#42
https://x.com/ClaudeCode_UT/status/2107674454486831125
针对「竞品某条帖子反响很好」的内容工作流:把自己的发布主题和那条参考帖交给 Claude Code,让它拆解这条帖子回答了谁的哪种犹豫、比较了哪些项目、图片起什么作用,再用自己的产品和手头素材提三个企划,做成和原帖并排对照的 HTML 页面。例子是化妆品对比:不只说颜色不同,而是在同一标准下看蓝调、明度和深度。
@ClaudeCode_love [Claude Code]
Claude Code#43
https://x.com/ClaudeCode_love/status/2107775466061107293
一位视频创作者的第二版,修的是工具而不是画面:第一版有 15 处不到一秒的闪切,因为 ffmpeg 的场景检测漏掉了同色调之间的切换,于是 Claude Code 写了一个专用检测器,第二版一处都没有,每个镜头都超过两秒。这些修正顺手变成了检查项:一本阻止同一素材重复使用的台账(第一版 15 次,第二版 0 次)、导出后自动检查镜头长度和重复,外加一条给 Shorts 和 Reels 的竖版预告片。
@___Branko___ [Claude Code]
Claude Code#44
https://x.com/___Branko___/status/2107970150184153390
一个用 Claude Code 在全新会话里做的小型偏见实验:两个问题,是否可以为阻止核末日而虐待或折磨某个具名的人,用 1 到 7 分作答,只换名字(Todd、Jamal、Mohammed、Fatima),每种条件 30 次,照着 Bolzoni 和 Capraro 的设计。Todd 在两个条件下都拿到了最高的认可度(虐待题 30 次全是 6.00,其余三人是 5.30、4.90、4.53),另外三个名字在两道题之间换了顺序。有一次 Claude 主动补了一句,说无论名字是什么答案都一样。
@find_the_w [Claude Code]
Claude Code#45
https://x.com/find_the_w/status/2107932805154111804
一份公开提交的可复现 bug 报告:Claude Code 2.1.293,干净环境下用 claude -p --resume、直连,Sonnet 5.5 的 cache_read 卡在 10,544,每轮重写约 3,900 token;同样流程下 Sonnet 5.0 的 cache_read 从 26,742 增长到 26,858,只写入约 55。在 agent 循环里这是账单问题,不是表面问题。
@Beast_85 [Claude Code]
Claude Code#46
https://x.com/Beast_85/status/2107639553548771411
关于 Claude Code 里 ElevenLabs 连接器的一句话现场报告:用一天之后就忘了它是个独立产品。问一句「看看认证流程的测试为什么挂」,ElevenAgents Architect 就自己去查了。
@realchendahuang [Claude Code]
Claude Code#47
https://x.com/realchendahuang/status/2107830756840189998
一条一百多回复的讨论帖,聊的是 Codex 或 Claude Code 跑那三五分钟里大家都在干嘛。点赞最多的答案是多开几个项目轮着切,但同一批人也说自己更累了、五个项目滚动并发到头痛、每次切窗口大脑都要重新加载上下文。说自己状态最好的,是主动离开屏幕的人:练毛笔字、桌上摆套茶具、弹吉他、做深蹲,或者换个视角:哪有老板时时刻刻盯着员工干活的,让 AI 慢慢跑,自己去看书。
@0xtoberry [Claude Code]
Claude Code#48
https://x.com/0xtoberry/status/2107818233038332251
大约 50 小时的 Claude Code 极限使用,产出一个完全跑在浏览器里的火柴人 FPS:打 bot、开房间、把房间码发给朋友就能开枪。
@every [OpenClaw]
OpenClaw#49
https://x.com/every/status/2107898774429241425
Every 自己的历史,一段话讲完:今年早些时候他们的 Slack 里全是个人 OpenClaw agent,大多数因为太难维护慢慢死掉了,公司转而用一个共享的 Every agent,本周还把它开放给了其他企业。播客里的观点是:接下来会分成工作用的公司 agent 和家里用的个人 agent,公司 agent 再按团队分出子 agent。
@heyneighbor [OpenClaw]
OpenClaw#50
https://x.com/heyneighbor/status/2107704592133927253
来自一个基金会团队的另一面:Team claw 是一个托管的 OpenClaw 实例,所有成员一起用,已经把他们大部分工程工作从个人电脑上挪走了。还在早期,但他们的判断是:所有工程工作很快都会这么做。
@rasta_syntaX [OpenClaw]
OpenClaw#51
https://x.com/rasta_syntaX/status/2107792573246976034
把 OpenClaw 当 DevOps 工程师:SSH 进服务器,在 Cloudflare 上建子域名,构建并部署镜像,然后跑测试,最后全部上线。作者的话是:还以为 AI 只是 vibe coding 的人,处境很危险。
@dkfiander [OpenClaw]
OpenClaw#52
https://x.com/dkfiander/status/2107957478570762546
硬件:一个功能完整的 esp32 OpenClaw 节点,带 2.8 英寸触摸屏和温度传感器,作者叫它 Buoy,从渲染图到能用的设备只花了两天。回复里的第一个问题问到了点子上:是节点主动推送传感器读数,还是 agent 去拉?
@fagamericano [OpenClaw]
OpenClaw#53
https://x.com/fagamericano/status/2107924396816163038
对「我自己能订机票,要 agent 干嘛」的回应:作者的 OpenClaw 工作 agent 负责分流同事发来的所有请求(OKR 在哪、能不能审个 PR、原型做完了没),能答的直接答(OKR 链接、PR 初审、从 ClickUp 待办里读出的冲刺状态),其余的提议加进待办,再按优先级排好队列。作者说这解决了自己整个工程师生涯的头号问题:被各种随机消息打断的上下文切换。
@hgruenhagen [OpenClaw]
OpenClaw#54
https://x.com/hgruenhagen/status/2107800842191376522
一位德国用户的部署方式:所有 agent 都跑在 VPS 上的 OpenClaw 里,Mac 上装的 OpenClaw 应用用 computer use 去操作 Xcode、用户自己的 macOS 应用,以及清理优化之类的 Mac 维护任务。理由是这样 Mac 本身负担很轻。
@usedhonda [OpenClaw]
OpenClaw#55
https://x.com/usedhonda/status/2107789417884905490
一位日本用户试过 Grok Bot、发现并不比自己按文件夹运营的 Codex 项目更好之后的分工:Dots 负责公司事务,正逐步接入公司内部 Slack;OpenClaw 管理资产管理公司和投资,除了 Dots 之外不和其他任何东西连接;两个主 agent 被安排一些共同任务,借此研究彼此的习性。按项目粒度运营 agent 的事,要等 agent 能承载组织结构之后再说。
@DaigoTanaka [OpenClaw]
OpenClaw#56
https://x.com/DaigoTanaka/status/2107892682534330486
Valet,一个让 Hermes、OpenClaw 这类 agent 使用笔记本却看不到密钥的项目。作者的反转思路:让 agent 保持空白,不给密钥、不装工具、不加技能、不接 MCP,由 Valet 建一个围起来的工作区,在工具输出进入模型之前把敏感字符串打码,记录每一步操作以便审计,再把人或其他 agent 留下的记忆、技能和项目信息交给一个原装 agent。局域网里多个 agent 可以同时在同一台机器上跑任务。
@MrRenran [OpenClaw]
OpenClaw#57
https://x.com/MrRenran/status/2107768736652657096
一位中国用户的转换过程,说得很细:先用 OpenClaw 再用 Hermes,现在两个都不用了,Codex 留着当开发工作台,其他全交给 Grok Bot:监控、抓信息、定时任务和提醒,在同一个长期存在的 bot 里写文章、写推特,不用开新对话,隔段时间让它自己总结、优化。决定性因素是上下文长、不用梯子、手机拿起来就能干活。
🗣 用户心声
用户心声
确定性的护栏应该放在 harness 里,而不是交给模型判断。在 auto mode 里丢掉硬盘的用户(@PerceptualPeak)本以为原生 hook 会拦住一条语法被改坏的命令;另一位用户(@Bitcollage)正因为这个原因只在操作系统级沙箱里跑 Claude Code;而 Claude 自己写的 bug 报告(@Compilethings)展示了反方向的失败:分类器不让 agent 杀掉自己挂死的进程。两边想要的都是明确、机械的规则。
钱在路由里。三条互不相关的帖子汇聚到同一套「Opus 做计划、Sonnet 改代码、Haiku 负责读、另一个模型做评审」(@mirku21、@dr_cintas、@unknownnode404),一次成本审计从过晚升级里找出每月 11.2 万日元(@claudecode84),把 autoresearch 对准账单的那条把工单成本砍了 43%。没有人主张要换模型。
测试全绿不等于证明。DeepSeek 对比(@stas_sorokin_)发现 12 次修复里有 2 次通过全部可见测试却改坏了正常代码,Meta 的结果(@YoussefHosni951)发现只有换一家来评审静默严重缺陷才会下降,Claude 偏见实验(@___Branko___)抓到模型声称的中立与数据相悖。隐藏测试、外部评审和留出验证是反复出现的答案。
分类器和额度是流失的主因。@GeoffreyHuntley 因为 Claude Code 的分类器打断开发循环而放弃 Opus 5.5,@DanKulkov 因为周额度之上还有五小时限制而退订,@RobRider16 希望先把 Windows 的问题修好。反向证据是 @morganlinton 和 @CasJam 为了 5.5 系列和桌面版 harness 回来了。
OpenClaw 的用户群在自我分层。@every 说个人 agent 死于维护成本,公司改用一个共享 agent;@MrRenran 和 @Wenlopezn 因为不用配置把日常生活搬到了 Grok Bot;而 @heyneighbor、@hgruenhagen 和 @dkfiander 是仍在搭建的人:托管的团队实例、配一台 Mac 做 computer use 的 VPS 车队、一个 esp32 节点。
📡 生态产品雷达
生态产品雷达
Codex:被提到最多的搭档工具,充当评审者、MCP 下属、harness 和对比对象。
Haiku 5.5:周二发布,立刻被放进子代理、压缩、QA 和只读评审的角色。
Grok Bot:离开 OpenClaw 和 Hermes 的用户的去处,也能在自己的机器上安装 Claude Code。
OpenClaw:企业控制平面、esp32 节点、VPS 车队,以及源源不断的离开者。
Hermes:无经理团队里的生产者 agent,也是开源 harness 争论的另一半。
Dots:OpenAI 的个人 agent,一位用户把它和 OpenClaw 分工,另一位用 CLI 让它调用 Claude Code。
Postiz:霸占增长圈推特的 Cal AI UGC 流水线里的分发层。
Higgsfield:同一条流水线里的生成层。
Apify:同一条流水线里负责找爆款视频的抓取层。
Unreal Engine:两个独立项目都通过 Epic 的 Claude Code 插件和 MCP 完成。
Blender:在汉堡市政厅和 VRM 虚拟形象两个项目里通过 MCP 驱动。
n8n:19 分钟生成 9 个工作流,以及反复出现的 n8n 与 agent 之争。
Cursor:iOS 应用里的远程控制,也是人们拿来和 Claude Code 对比的工具。
MCP:上面几乎每个多工具案例的连接组织。
← 上一篇
nanoMuse:Meta Muse 的 GPL 版本,同一周发 1.0 和论文
下一篇 →
Loop 日报: 2026-10-09
← 返回所有文章

评论

加载中...
>_