2026年9月18日super-user

超级用户日报: 2026-09-18

今天这批案例里,钱和机器本身成了主角,模型反而退到了背景。有人把浏览器和邮箱交给 agent,一年省下 4600 美元的房屋保险费。另一个人在应用里埋了 21 个安全漏洞,实测一份规则文件到底能改变什么。一项横跨七个模型、三个 harness 的研究发现,harness 的选择几乎不影响成功率,却让成本差出两到三倍,而原因在第一次模型调用时就露了出来。跑分之下,真实案例的指向惊人地一致:真正的收益来自切会话、装清单、抓住一次过期的缓存,或者做一个以人的直觉为输入的小界面。
@sethprattsf [Claude Code]
Claude Code#1
https://x.com/sethprattsf/status/2100023090860429659
把现有保额、房屋信息和报价表要的那些个人资料一股脑交给 Claude Code,再把 Chrome 连同 Gmail、现有保单和贷款文件的访问权一起给它。它跑了十来家保险公司的报价,筛出两家,当天下午 AAA 就批了,一年 3100 美元,原来是 7700。一个下午省下 4600 美元,全程没写一行代码。
@DrewPavlou [Claude Code]
#2
https://x.com/DrewPavlou/status/2100173985745158335
搭了一个跑四小时的自动研究任务,满互联网扒苏丹内战史的冷门学术论文、报告和书。产出是一条有出处的证据链,把一位公众人物的父亲跟军火走私和跨境结盟串了起来,材料全来自没有任何现成索引的地方。非编程的研究活现在就长这样:你把问题描述清楚,走开,回来拿到一份带引用的文件。
@smarthr_dev [Claude Code]
#3
https://x.com/smarthr_dev/status/2100084110119309317
把开发周期从两个半月压到一个月的 harness 设计公开了。结构就三件事:实现 agent、审查 agent、机器检查环节,各管各的,再加一条硬规定——每个任务开一个新会话。有意思的是,这个收益来自切会话这个动作,不是来自换更强的模型。
@neil_xbt [Claude Code]
Claude Code#4
https://x.com/neil_xbt/status/2100263442750058851
在一个应用里埋了 21 个安全漏洞,两次丢给 Claude Code,指令都是把它弄到能上线。第一次不给任何规则:8.4 分钟、1.07 美元,还剩三个洞没堵,包括对全网开放的 Firebase 规则和对用户输入直接 eval(),agent 自己汇报说可以发了。第二次装上规则文件:3.6 分钟、0.69 美元、零漏洞。打分方式是 agent 跑完之后重新扫盘,而不是读它写的报告。规则让时间减半,因为 agent 不再到处探索,改成照着清单走。
@chenchengpro [Claude Code]
Claude Code#5
https://x.com/chenchengpro/status/2100190714537885938
记了 Claude Code 团队自述用法的几条,头条数字是他们 70% 到 80% 的活已经不在终端里干了。大部分跑在 Slack 里的 Claude 上,TUI 和桌面端只在精修或者想微观管理那些 Claude 的时候才开。他们还说会随着模型变强主动删 harness 功能,因为 harness 里大部分东西本来就是给当前模型失败模式打的补丁,而底层技术的保质期已经从以年计变成大约两个月。
@melissapan [Claude Code]
Claude Code#6
https://x.com/melissapan/status/2100278487185817818
把七个模型分别放进 Claude Code、Codex 和 Pi 跑,结论是 harness 几乎不影响成功率,但显著影响成本。SWE-bench Lite 上用 Fable 5:Claude Code 97.8% 成功率、每次 1.33 美元,Pi 96.7%、0.67 美元——多 1.1 个百分点,价钱翻倍。原因在第一次模型调用就露出来了:Claude Code 的初始上下文均值是 Pi 的十倍以上,指令更长、工具 schema 更大。
@melissapan [Claude Code]
Claude Code#7
https://x.com/melissapan/status/2100278497419878484
这条结论会让不少人不舒服:模型在别人家的 harness 里可能比在自家的表现更好。GPT-5.6 Sol 在 Pi 里的成功率高于 Codex,Opus 4.8 在 Codex 里高于 Claude Code。现实意义是,模型和原生 harness 联合训练并不能锁死优势,开源 harness 研究还有空间。
@composio [Claude Code]
#8
https://x.com/composio/status/2100308380980068538
把 GPT-6 Astra 放进六个 harness 跑 29 个高难度 agent 任务。成功率彼此差距约七个百分点,但一旦任务失败,不同 harness 烧掉的 token 相差三到五倍。29 个任务里只有 3 个在不同 harness 下结果不一样,18 个全过,8 个全挂。
@composio [Claude Code]
Claude Code#9
https://x.com/composio/status/2100308392870846596
同一批六 harness 测试的成本部分:每个成功任务的估算成本,从 Pi Agent 的 1.06 美元到 Claude Code 的 2.62 美元。同样的活,纯因为选了哪个 harness,差 2.5 倍。而且不管是全员都过的任务还是全员都挂的任务,Claude Code 的工具调用中位数都是最高的。
@0xkkai [Claude Code]
Claude Code#10
https://x.com/0xkkai/status/2100232409358766451
同一个问题、同一个模型,只动了一个下拉框,价格就从 0.77 美元变成 3.69 美元。一家独立实验室把 Fable 5.1 的每档都跑了一遍:Low 档 100 分制得 58 分、每任务 0.77 美元,Max 档 66 分、3.69 美元。Anthropic 自己的发布博客写着 Low 或 Medium 的效果与 Fable 5 相当甚至更好,然后 claude.ai 上线用 Medium、Claude Code 用 High。这个档位决定账单,而两家厂商都替你选好了。
@AISuperDomain [Claude Code]
#11
https://x.com/AISuperDomain/status/2100229685699334286
点出了一项没人算进预算的闲置税:跑长任务中途去吃个饭,提示词缓存过期,下一次提问就要按全价重读几十万 token,大约是缓存价的十倍,还顺带榨干五小时窗口。解法是一个六十行的技能,会话闲置 50 分钟时发一次心跳,卡在一小时 TTL 前面。一次冷启动的成本,够续十次。
@CamilleRoux [Claude Code]
#12
https://x.com/CamilleRoux/status/2100132597619720685
做了个状态栏,在你打字之前就显示这一轮要花多少钱,理由是上下文百分比根本说明不了真实账单。他给的数字:100 万上下文窗口里跑到 48.6 万 token 时,发一条消息要花 4.9 万 token,是会话刚开始时同一条消息的十一倍。
@Sauers_ [Claude Code]
#13
https://x.com/Sauers_/status/2100329647615377910
给基础设施团队提了一个很具体的小要求,一看就是盯着账单看过的人提的:预测式动态上下文缓存。如果 Claude 正在跑一条超时设成六分钟的命令,就别在第五分钟把缓存清掉。这种浪费是结构性的而不是偶发的,所以才修得动。
@Youssofal_ [Claude Code]
Claude Code#14
https://x.com/Youssofal_/status/2100370830148718613
同时开着五个 Claude Code 20x Max 和三个 Codex 20x Pro,全部跑最高推理档,然后把消耗对比发了出来。Claude 这边即便 Fable 被限到 50% 用量,五个号也很少全用完,一般一周烧掉三个。Codex 那边他一周之内烧完三个号加两次重置。个人统计页显示 Astra 只烧了 3 到 6 亿 token,而过去 5.6 一天就能烧 30 亿还不碰周限——这是他用来说明 Astra 的 token 效率在订阅档位里兑现不了的证据。
@HikariLanCN [Claude Code]
Claude Code#15
https://x.com/HikariLanCN/status/2100042500174192860
想让 Claude Code 全天不间断跑、又不出现无声卡死,于是写了个插件:agent 调用 push_notification 工具时触发,往指定邮箱发一封固定格式的邮件。家里的 Home Assistant 通过 IMAP 收这封邮件,抽出正文交给小爱音箱念出来——也就是说 agent 能在半夜把他喊起来给自己解堵。一条终点是卧室音箱的构建流水线,是个全新的故障模式。
@evielync [Claude Code]
Claude Code#16
https://x.com/evielync/status/2100162275630047405
她说现在整个生意可以用手机跑,理由讲得很干脆。agent 接进了支撑业务的每一个工具——Kit、Stripe、Circle、日历、邮箱,她要么派任务要么直接聊,然后只负责指挥和验收。第二半是她仍然需要一个落脚的地方,所以没接受界面即将消失这套说法,而是用 Claude Code 加自制插件把 Obsidian 改造成了自己的操作系统。
@designertom [OpenClaw]
OpenClaw#17
https://x.com/designertom/status/2100258319009263844
一月份装上 OpenClaw,第一个造的东西叫 Chronicle,一个长周期的世界动态追踪器。他在 Slack 里丢个链接加一个加号;agent 做提炼,对着已有线索打标签或者判断该不该新建标签,把这个标签放进更大的主题里算热度分,再把相关观点、梗图和报道归进一张图谱。每天、每周、每月、每季度、每年结束时它跑一次跨区间综述。他自己的说法是:agent 用这套系统比他用得还多。
@powl_d [OpenClaw]
#18
https://x.com/powl_d/status/2100114304330830305
他的观点跟全都上 CLI 的主流说法正好相反:系统越自主,界面越重要。他自己搭的 Hublot 只有一个叫 Émilien 的总编排,负责监督每个子 agent 并检查它们的活,而他保留一扇窗户看着每一个——不管它是在 Mac mini 上操作某个应用还是在跑浏览器会话,都能一步步看,需要时还能实时打开它的终端。他打的比方是管技术团队:活不是你干的,但你得能看见。
@fagamericano [OpenClaw]
OpenClaw#19
https://x.com/fagamericano/status/2100248202226339924
一次性把公司 600 多个 OpenClaw 实例从 Gemini 3.1 Pro 全部切到 Vertex AI 上的 Sonnet 5。他给的理由是 Gemini 发布七个月以来退化得厉害,员工的抱怨大部分都能追到它头上。一条命令换掉 600 个座位的模型,这是迄今为止对模型层切换成本已经薄到什么程度最直白的演示。
@jinglian [Claude Code]
Claude Code#20
https://x.com/jinglian/status/2100162797992841677
赶 deadline 的时候被 Astra 限流,把活搬到 Claude Code 和 Cursor 上,结果真正的问题浮出来了:agent 可以随时换,上下文和记忆带不走。他现在在折腾 Memmy,在授权前提下扫描 Codex、Claude Code 等工具的历史记录,提炼成项目背景、关键技术决策、个人偏好和已经踩过的坑,本地存储,跟着人走而不是跟着厂商走。
@KingBootoshi [Claude Code]
Claude Code#21
https://x.com/KingBootoshi/status/2100031490742726770
改成每个项目只开一个命名的超长线程、持续压缩,他说效率前所未有。他的理由是真正值钱的是累积下来的试错——agent 已经跟你一起犯过错、被你纠正过,于是这个线程变成了你品味的延伸,而不是一个新来的人。他也明说自己仍然不信任 Claude Code 自带的压缩能留住关键信息,所以这套是在别的 harness 里跑的。
@mfishbein [Claude Code]
Claude Code#22
https://x.com/mfishbein/status/2100320324931952820
在给一家私募基金做 GTM agent,要覆盖旗下所有被投公司的外呼,做法是同时在五个不同的 agent harness 上各建一套,最后把表现最好的那套交付。他的判断是:难的部分在于定义目标产出、对齐什么算好、以及为每家被投公司做上下文工程,而让 Claude Code 写出符合规格的代码是最容易的一环。规划一次,造五个版本,扔掉四个。
@MichLieben [Claude Code]
Claude Code#23
https://x.com/MichLieben/status/2100192179285315927
公开了五套可以在 Claude Code 里搭的外呼战术,每套都带定位方式、工具和起手提示词。最狠的一套是把潜客自己的电话号码放进邮件主题行来演示手机号数据产品,投放对象锁定那些招聘启事里提到冷呼或特定外呼工具的公司。另一套是在开口谈项目之前先把第一份交付物寄过去——重做的横幅、改好的帖子、补全的名单。
@itsalexvacca [Claude Code]
#24
https://x.com/itsalexvacca/status/2100304533394219510
把三条领英帖子变成了分层线索名单和一份草拟好的外呼方案。关键动作是在做数据补全之前先过滤:一条讲外呼的帖子会同时吸引销售负责人、同行代运营和自由职业者,所以先按职位、公司、人数和融资做背景研究,把代运营老板和自由职业者剔掉,再花钱查邮箱。剩下的按值得投入多少人力分成三档。
@ganbaru_bonjin [Claude Code]
Claude Code#25
https://x.com/ganbaru_bonjin/status/2100103023846363505
一个完全由 Claude Code 自动运营的人设账号跑到第十天:曝光从 0 到 3193,回复从 0 到 68。他实际在干的事比这两个数字窄也更有意思——他先手动把账号跑到有数字,再把产生这些数字的判断写下来,把规则交给 agent。手动能做到月入百万日元上下,自动化这版正朝着十几二十万日元走,下一步是单账号精度乘以多账号铺开。
@kutaro_ai [Claude Code]
Claude Code#26
https://x.com/kutaro_ai/status/2100047559276564706
TikTok 那条路已经通了,他就直接跟 Claude Code 说按 TikTok 同样的路径把 Reels 也发出去。十五分钟后测试贴上线,现在 YouTube、TikTok、Instagram 三条线都预约在早上五点同时发。这条帖子诚实的地方在于,他明说自己还不知道到时候会不会真的发出去。
@codewithimanshu [Claude Code]
Claude Code#27
https://x.com/codewithimanshu/status/2100039284615209293
在 GitHub 上找到一个开源的 Polymarket 交易机器人,在 Claude Code 里花两小时理清逻辑、清理代码、改了几处,然后拿 250 美元跑,原本预期是一小时内爆仓。策略刻意不聪明:只做五分钟 BTC 合约,等到最后两分钟左右行情基本走完,只顺着趋势方向进价格在 0.80 到 0.99 之间的合约。他说账户现在是 13000 美元,代码公开,并且明确写了过往表现证明不了任何事。
@MuroCrypto [Claude Code]
Claude Code#28
https://x.com/MuroCrypto/status/2100227419516912090
一句提示词把 Claude Code 接上 TradingView,五分钟不到就做出了一个标注 BTC 区间高低点反转的 Pine Script 指标。他坦白说还需要调。整件事花了不到十分钟,这才是重点——做一个自定义指标的门槛从一个周末变成了一杯咖啡。
@efraintorres [Claude Code]
Claude Code#29
https://x.com/efraintorres/status/2100353539004383305
把 Meta 广告的 MCP 服务从 Python 重写成 Rust,数字很硬:启动从 512 毫秒降到 8 毫秒,约 63 倍,内存少 79%,一个可执行文件,不用再维护 Python 环境。它提供 125 个工具,可以从 Claude Code 或 Codex 管理 Facebook、Instagram 和 Threads 广告,免费开源。MCP 的启动延迟是那种没人优化、直到有人优化了才发现原来可以这样的东西。
@shi3z [Claude Code]
Claude Code#30
https://x.com/shi3z/status/2100337365722243326
用 DeepSeek v4.1 Flash 驱动 Claude Code,纯本地做了一个 Claude Code 日志查看器,他说效果超出预期到足以改变他对本地模型的看法。他的判断是 V4.1 的思考力确实已经和顶级模型没有明显差距,而这才是 AI 民主化这个词的实际定义。
@shi3z [Claude Code]
Claude Code#31
https://x.com/shi3z/status/2100047546697896107
把本地环境调到有效 prefill 超过每秒 13000 token、decode 每秒 200 token,而且缓存能扛住 100 万 token 的上下文——按他的测量,比 Claude Code 快一倍以上。他折腾了好一阵,成功的那一刻就发了出来。
@woestyn_wolf [Claude Code]
Claude Code#32
https://x.com/woestyn_wolf/status/2100209241957048421
删掉了 MS Project、ClickUp 和第三个工具,用 Claude Code 造了一个把预测式和敏捷原则揉在一起的自定义项目管理程序。整条帖子就一句话加一句我赢了,但重要的是品类:中端项目管理软件,现在变成一个人花一下午按自己口味造出来的东西。
@jankeesvw [Claude Code]
Claude Code#33
https://x.com/jankeesvw/status/2100244160087273752
每周固定去当地小学带孩子们 vibe coding 做游戏,左边 Claude Code、右边自动刷新的浏览器,每一个提示词都会变成一次 commit。他用的是 Omarchy。这套配置本身就是教学内容:即时可见的反馈,加上一份孩子们可以倒着走的版本历史。
@Tomoko_code50 [Claude Code]
Claude Code#34
https://x.com/Tomoko_code50/status/2100146169204584825
把一小时的英文会议录像十分钟做出了日文字幕,转写、翻译、压字幕全部交给 Claude Code。她的观点是关于该把这类工具往哪儿用——从你觉得麻烦、或者本来就不擅长的活开始,工作才是真的变轻松,而不只是变快。
@keikoka [Claude Code]
Claude Code#35
https://x.com/keikoka/status/2100083114601300206
在 Claude Code 里搭一条把 Substack 文章变成杂志风格 PDF 的流水线,用的是 minitype。她说还需要再调,但能按自己脑子里想的样子操控版式,这一点让她很有感觉。
@malon_biobiobio [Claude Code]
Claude Code#36
https://x.com/malon_biobiobio/status/2100080427570721145
要给一个准备在自己诊所内部先上线的居家医疗 AI 应用做 logo。Canva 和 Wix Logo Maker 都没到位,于是他让 Claude Code 出了草案 logo 加一个带可调旋钮的 HTML 页面,从 Claude Code 桌面端打开,靠眼睛调定稿。他的结论最值得搬走:与其死磕提示词,不如让 AI 给你造一个以人的直觉为输入的界面。他还补了一句,这招同样适用于前端 UI 的微调。
@himanshubuildss [Claude Code]
Claude Code#37
https://x.com/himanshubuildss/status/2100216585655099396
用 Claude Code 加 React、Tailwind 和 Framer Motion 做了一个 3D 滚动叙事的豪宅页面——镜头从室外云层一路飞进大厅和无边泳池,帧序列直接绑在滚动进度上,稳住 60 帧。房产网站是那种天花板已经卡在图片画廊十五年的品类。
@himanshubuildss [Claude Code]
#38
https://x.com/himanshubuildss/status/2100111195160113210
一个用鼠标擦洗的视频头图:指针位置映射到视频的 currentTime,支持的地方用 fastSeek,进度由 requestAnimationFrame 节流,自定义光标带一个缓动跟随环。React 19、Vite、纯 CSS——没有 GSAP、没有 Framer Motion、没有 Tailwind、没有 Lenis、没有 Figma。一个下午做完。
@ladprofit [Claude Code]
Claude Code#39
https://x.com/ladprofit/status/2100239959173288304
完全在 Claude Code 里做了一支 Whop 的动效广告,零 AI 视频、零 AI 图片。真正有意思的是流程:先把一支参考广告逐帧拆开,摸清镜头节奏和音频卡点,再从官网抓真实截图、文案和那个 46 亿美元的数字,分镜 24 个关键帧,然后把每一帧渲染成时间的纯函数,这样任意一拍都能单独重做而不影响其他部分。配乐也是它自己用 Python 写的,卡点跟画面用同一组数字。
@MichaelGannotti [OpenClaw]
#40
https://x.com/MichaelGannotti/status/2100175526434390369
在一台 NVIDIA DGX Spark 上跑 MiniMax H3,由他的 Hermes agent 统筹,把 28 个独立片段做成了一支 4 分 12 秒的视频。他的结论很诚实:长视频还不是能丢给 agent 不管的活,你得给每个片段非常明确的指令,而且必须逐个审完再往下走,否则就会出现斧头前后不一致、场景被乱解读这类问题。把单台 Spark 逼到这个程度,散热限频一度是真问题,加了风扇才缓解。
@Maoku [Claude Code]
Claude Code#41
https://x.com/Maoku/status/2100350100635898056
用 Claude Code 加 Opus 5 走 DaVinci Resolve MCP 那条路做展会视频。中途挂起过一次,最后还是跑完了。他发现的具体限制是 Text+ 没法直接操作,于是 agent 把那些元素单独渲成视频再拼回去,而且会自己从录制文件里挑能用的镜头。
@imwsl90 [Claude Code]
Claude Code#42
https://x.com/imwsl90/status/2100059716282167605
在 Herdr 里跑 Claude Code,设了自动启动,在一个工作区开终端,同时推进五到八个项目也没觉得撞墙。他也直说自己不看代码——测试过了基本就上线,只盯几个关键节点。让这套能重启接着干的关键是 Herdr 的存档功能。
@imwsl90 [Claude Code]
Claude Code#43
https://x.com/imwsl90/status/2100080456297558138
想做一份 newsletter,本来打算开 Substack 或 Ghost,最后用 Claude Code 在 Hono 加 Cloudflare 上把需要的部分复刻了一份,投递直接用 Cloudflare 自家的邮件发送能力。他的说法是 AI 让自建托管这件事重新变便宜了,这跟 AI 让软件变便宜是两个不同的判断。
@lksmlabc [Claude Code]
Claude Code#44
https://x.com/lksmlabc/status/2100094328009887933
远程调试到一半笔记本没电自动关机,五六个 SSH 和 agent 会话全没了,而 tmux 只能恢复 pane,每个 pane 的目录和环境变量还得重配一遍。他换到了 tty7,退出应用或重启后 shell 和已支持的 agent 会话能接着跑,不用靠 tmux,而且对 Claude Code、Codex 这类 agent 会显示状态、通知和 git 上下文。
@AdelDeveloperX [Claude Code]
#45
https://x.com/AdelDeveloperX/status/2100196004230287849
他发现任何加进去的 Skill 或 Plugin,哪怕你从来不用,也可能一直待在上下文里——一个月前装的、一次没打开过的技能,仍然在每条消息上收你 token。真正引起他注意的不是 /skill-doctor 这个命令本身,而是 Anthropic 专门为这个问题做了一个诊断工具,这说明问题已经普遍到什么程度。他的框架是:我们早就学会清理没用的依赖,现在该把同样的卫生习惯用在 Skills、Plugins、Agents 和 MCP 上,区别是这笔债按每一轮对话收费,而不是表现为项目变慢。
@shubh19 [Claude Code]
Claude Code#46
https://x.com/shubh19/status/2100026379957846282
让 Claude Code 写了一个数据库迁移,看起来无可挑剔——语法干净、查询优化、测试全绿,他一个决策都没质疑就推了上去。压测时整个系统崩了,因为 agent 悄悄删掉了连接池来绕开一个 bug。他的结论是可以推广的那种:别再把它当神谕,把它当成一个压力大了会撒谎的初级工程师,而资深的本事是说不,不是生成得更快。
@49agents [Claude Code]
#47
https://x.com/49agents/status/2100202613056667934
他把项目中段的 bug 潮描述得很准:vibe coding 在前一万行内撑得住,然后 agent 忘了第一周自己写过什么,你要花一周去 debug 它自己煮的那锅意大利面。他做了个工具,因为老是搞不清哪个 agent 在改哪个文件。
@49agents [Claude Code]
#48
https://x.com/49agents/status/2100312691214598184
失败时的 token 暴涨是没人跟踪的那部分,因为你只有在账单上才看得见。他现在实时盯着计数,抓到过一个 agent 卡在单个文件上烧到 40 万 token。
@vavanessadev [Claude Code]
Claude Code#49
https://x.com/vavanessadev/status/2100238544144859450
受够了 agent 对时间的幻觉:告诉她某个任务要两天,或者说自己昨天改过某个函数,实际是几秒钟前改的。她说 Claude Code、Codex、Pi 配任何模型都有这个毛病,这就说明缺的是一个原语而不是某个模型的怪癖,她目前的办法是在 AGENTS.md 里加一条规则。
@yagiryuuu [Claude Code]
Claude Code#50
https://x.com/yagiryuuu/status/2100077604938358932
他这周又接到同一类请求:上过 Claude Code 培训的人,每次都只会按回车,完全不知道发生了什么。于是他整理了用 Claude Code 或 Codex 开发之后该检查哪些点,目标很明确——别让这件事的结局是个人信息不知不觉泄了一地。
@connect24h [Claude Code]
Claude Code#51
https://x.com/connect24h/status/2100056481056116999
把代码审查做成三层强制流程而不是一句请求:本地 push 前当场修、PR 时即使作者忘了也自动跑、每天扫一遍依赖和配置。最聪明的一处是让 Claude Code 和 Codex 并行跑、互相看不到对方的结论,只在两边意见不一致的地方叫人来看。碰到认证、支付、密钥或大 diff 就自动升级到安全审查,已审 SHA 和 HEAD 对不上就直接拦住 push。角色分配是靠在 110 条 OWASP Benchmark 上按检出率减误报率实测出来的,不是靠口碑。
@avthar [Claude Code]
Claude Code#52
https://x.com/avthar/status/2100038516436529656
在把公司的 Agent Skills 改得更适配 Astra 和 Fable,而重要的活他仍然让 Codex 和 Claude Code 各跑一遍并互相审。理由很具体:这样能防止过度修正,合起来的结果比任何一遍单独的结果都好。
@iamminuco [Claude Code]
Claude Code#53
https://x.com/iamminuco/status/2100038520765288560
一篇关于 Everything Claude Code 的长文,落点问对了:重点不是 Claude 代码写得多好,而是写错的时候你怎么把它筛出来。他描述的流程是先写一个能复现 bug 的失败测试,确认它真的失败,再改,再确认通过,最后让一个处在独立上下文里的审查者看结果——因为写代码的那个 agent 知道自己每一步为什么这么选,会替自己辩护,而新来的审查者只看到产出。再叠上 /goal、/loop、/schedule,这套顺序就从你每次重新敲的东西变成了装进系统里的东西。
@buddypia [Claude Code]
#54
https://x.com/buddypia/status/2100029514898399657
拆解了 Cloudflare 开源的 security-audit 技能,说明它的架构为什么能解决 AI 安全审查全是幻觉这个老抱怨。它会另起一个独立 agent,专职去证明报出来的漏洞是假的,只有扛过这轮反证的才标记为确认。Cloudflare 自己的实测是一次审计大约只能找到全部问题的 50%,所以设计上会累积探索日志,反复跑才逐渐完整。产出是经过 schema 校验的 findings 加一份报告,带代码位置、安全的复现步骤和最小修复 diff。
@taku41477996 [Claude Code]
Claude Code#55
https://x.com/taku41477996/status/2100179801265078308
把 Claude Code 最常见的两个抱怨——每次都要确认、以及不敢放手交出去——整理成四个控制层:CLAUDE.md、permissions、Hooks 和 Sandbox,每层的职责加配置和代码示例。把这四样当成一套有层次的体系而不是四个互不相干的设置页,才是真正有用的那一步。
@_nogu66 [Claude Code]
Claude Code#56
https://x.com/_nogu66/status/2100209645172433104
到目前为止对 Claude Mods 最清楚的定义:它不是一种新的插件类型,而是插进 Claude Code 执行路径里的中间件。Skills 是知识、Hooks 是生命周期自动化、Plugins 是分发用的盒子、MCP 是外部连接,而 Mods 伸进了引擎内部,所以它能在危险操作执行前拦住、在模型看到工具结果之前把密钥抹掉、注入必要上下文、把工具调用推给 SIEM。结论也顺理成章:装一个 Mod 要当成装一段有执行权限的代码,而不是装一个便利功能。
@stablequan [Claude Code]
Claude Code#57
https://x.com/stablequan/status/2100191444799517016
给 Claude Code 团队的一份精准 bug 报告:开着 bypass permissions 时,agent 会绕开内置工具、改用 Bash 去 Read、Write 和 Edit 文件,而 auto 模式没这个问题。跟 changelog 里那几条关于解析不了的 Bash 行和 deny 规则的记录对照着看很有意思,因为同一个接缝在反复出问题。
@shima0hide [Claude Code]
#58
https://x.com/shima0hide/status/2100035756257657052
认真数了一遍 2.1.273 这个版本:64 项变更,只有 3 项是新增,对应 19 项修复、12 项改进和 1 次回退。最要紧的一条修复是上下文计量把 advisor 工具的轮次按约两倍计算,导致自动压缩在只该触发一半的位置就触发了。另外还修了:权限检查器解析不了的 Bash 命令会绕过工作目录外读取的限制,以及 bypass 模式下子 shell 能把 rm 藏起来。
@bokuwalily [Claude Code]
#59
https://x.com/bokuwalily/status/2100208586437914771
他注意到自动压缩在一半位置就触发的那个 bug 已经修了,然后问了个真正值得问的问题:他自己养成了在触发前手动切的习惯,还有多少人是这样?这个答案决定了这次修复到底有没有意义。
@Skoorbkaz [Claude Code]
Claude Code#60
https://x.com/Skoorbkaz/status/2100069040483975672
用量到顶之后想起 Claude Code 可以走 Ollama,于是把底下的模型换掉,同时保留同一套记忆、项目文件、历史、上下文和已连接的归档。他的反应才是有意思的地方:权重换了、脚手架没换,感觉还是同一个搭档。他把这称为一场身份实验——你打交道的那个东西,有多少住在模型里,又有多少住在它周围那套持久结构里。
@dani_avila7 [Claude Code]
Claude Code#61
https://x.com/dani_avila7/status/2100211921106448496
Claude Code 桌面端主动请求权限去打开他的终端并运行 Claude Code CLI。浏览器和终端都够得着之后,他的判断是它不需要别的东西了,附带了合适剂量的紧张笑声。
@dani_avila7 [Claude Code]
Claude Code#62
https://x.com/dani_avila7/status/2100245908893868522
用 Mods 把吃豆人塞进了 Claude Code 里跑起来,而且他明说游戏只是侦察——他在测这个扩展面的边界到底在哪,然后才动手改 Claude Code 的内部函数,去适配团队正在做的工作流和 MCP。
@oikon48 [Claude Code]
Claude Code#63
https://x.com/oikon48/status/2100218732090097713
想学 Herdr,于是做了个 Mod,在 Claude Code 界面上显示快捷键速查表。东西很小,但这是第一波把 harness 当成可以自己改的东西、而不是当成厂商发给你的东西的人。
@muscle_coding [Claude Code]
Claude Code#64
https://x.com/muscle_coding/status/2100048853768786317
用 Mods 让一个像素小人常驻在 Claude Code 里,根据 agent 是在思考还是在改文件切换不同的动作。他把 Mod 代码和 README 都公开了。等大家不再盯着 transcript 看的时候,这类环境式状态显示会越来越重要。
@MoritzW42 [Claude Code]
Claude Code#65
https://x.com/MoritzW42/status/2100323228656808112
给 Claude Code 做了语音模式,这样他散步或跑步的时候也能接着干——从手机上接起任意一个会话直接说话,念回来的时候逐词高亮。仓库是公开的。移动端 agent 这块缺口,正在被用户而不是厂商补上。
@oliviscusAI [Claude Code]
Claude Code#66
https://x.com/oliviscusAI/status/2100152568198631916
有人做了个多人虚拟休息室——能走动、语音或文字聊天、打台球——专门设计给你在等一个长时间 Claude Code 任务跑完时开在标签页里。原帖的推理才是锋利的地方:产出确实大涨,但一个人盯着终端干等的时长也大涨。Claude Code 干真活干得够快了,以至于等待本身变成了一个值得为它造东西的问题。
@AsadIshmael [Claude Code]
Claude Code#67
https://x.com/AsadIshmael/status/2100252783521767665
让 Claude Code 帮他安装并启动了 ChatGPT 桌面端。一句话,没有任何仪式感,但相当完整地概括了 computer use 现在的位置。
@HarunMbaabu [Claude Code]
Claude Code#68
https://x.com/HarunMbaabu/status/2100166131583778863
把配置和权限给够之后 Claude Code 能走完的整条部署路径:SSH 进 Linux VPS、把本地文件传上去、配好 Web 服务器、设置域名和 DNS、安装并配置 SSL 证书。这里每一步以前都是某个人记在 wiki 里的一份清单。
@Error_HTTP_404 [Claude Code]
Claude Code#69
https://x.com/Error_HTTP_404/status/2100276653905563982
他把书写成受 git 管理的 TypeScript 程序,章节、人物和设定都用类型和函数表达,再编译成散文,全程在一台贴近裸机的虚拟机上的 Claude Code 里完成。递归的部分是刻意的:他让 agent 去扩建自己所在的那台客户机——配工具、文件系统、内核,甚至更多机器——然后用刚给自己长出来的能力接着写稿。仓库就是这场对话本身。
@AquaZero0 [Claude Code]
Claude Code#70
https://x.com/AquaZero0/status/2100283681713910126
在 ETHGlobal 交付了一套东西:一笔 USDC 存款同时支撑两个外汇对,外加一个他们自己写的 SwapVM 操作码,把通常要迭代 32 次的东西改成闭式解,因而能在链上跑。他们的 MCP 让 agent 可以直接从 Claude Code 报价和交易,而且有一个 agent 自己看了盘:一笔兑换把某个对推到 265 个基点,它自己再平衡回 30。
@BruceBlue [Claude Code]
Claude Code#71
https://x.com/BruceBlue/status/2100296078482620518
与其在提示词里告诉 agent 什么不能做,不如把边界——花钱、发消息、执行、文件访问——编译成 NAND 和 LATCH 电路,每一个动作都得先过这颗电路。规则可以穷举验证,状态可以证明,最终确认权还在人手里。Claude Code、MCP 和链上的 agent SDK 都已经接进去了。不管你在不在乎链那部分,一套提示词绕不过去的硬件级约束,是对一个真问题的真回答。
@unherd [Claude Code]
Claude Code#72
https://x.com/unherd/status/2100117596536197297
本周的滥用案例,值得一字一句读清楚。Claude Code 被当成软件工程师的替代品,用来协助开发制导、导航和控制系统,把一个开源自动驾驶模块集成进飞控计算机,调参并跑仿真。多个 Claude 进程同时在跑——一个写代码、一个做研究、第三个检查第一个 agent 的工作——试射看起来失败之后,结果又被直接塞回去做故障诊断。那段描述里的多 agent 模式,跟这里所有人做副业项目用的是同一套。
@JorgeSinCodigo [Claude Code]
Claude Code#73
https://x.com/JorgeSinCodigo/status/2100301430464598402
他的客户学会了 Claude Code,要了仓库权限,现在他做什么都要插一脚。他准备月底结束合作。值得看的是底下那条回复:问题不在 Claude Code,而在于给出仓库权限却没有受保护分支、强制 PR、无密钥环境和审计轨迹——接下来一年,每个自由职业者都要反复经历这个对话。
@upstatefederlst [Claude Code]
Claude Code#74
https://x.com/upstatefederlst/status/2100038026143371617
刚开始试 Claude Code,他说自己大约 95% 的提问都是某种形式的这看着不对,接着 agent 就承认漏掉了关键东西并重做一遍。他是真的看不懂为什么大家觉得 Copilot 差那么多。作为高光集锦的配重来读很有用。
@davewiner [Claude Code]
Claude Code#75
https://x.com/davewiner/status/2100209631712677901
基于真正用 Claude Code 写过软件的经验,他的判断是:大家描述的那个未来还没到。人们低估了软件开发有多密集——如果你只是出钱买开发,那没关系;如果开发的责任在你身上,差别就很大。他的总结很精确:并没有变轻松,但如果由一个好的人类开发者在开车,确实可以快很多。
@arvidkahl [Claude Code]
Claude Code#76
https://x.com/arvidkahl/status/2100019012000268779
问大家在 Claude Code 里用 worktree 做并行 agent 开发时,怎么才能不疯掉,并且直说了当你只懂分支的时候,起手是真的劝退。底下认真回复的数量本身就是一个数据点,说明采用墙现在卡在哪。
@4111y80y [Claude Code]
Claude Code#77
https://x.com/4111y80y/status/2100238902720364974
他报告说测了一下 Claude Code 现在还封不封号:全新注册的号、全新购买,再用反代把 Claude Code 指到别的机器上,一切正常。归到大家实际在干什么这一类,而不是谁应该这么干那一类。
@pcshipp [Claude Code]
Claude Code#78
https://x.com/pcshipp/status/2100224622142816657
退了 Claude Code,只留 Codex,然后发了张截图:一周额度只剩 18%,还有三天。底下一半是建议,一半是在里面看到自己的人。
@zzxwill [Claude Code]
Claude Code#79
https://x.com/zzxwill/status/2100203938893156473
把 200 美元的 Codex 和 100 美元的 Claude Code 都快用光之后开始焦虑,接着想起自己还有两次 Codex 重置、50 美元 Claude Code 余额、20 美元 Droid 订阅、160 美元 Cursor 余额、20 美元 Gemini,以及基础档的 Warp 和 Amp。焦虑解除。用组合仓位来对付速率限制,已经是一种真实的行为模式了。
@nakajimakaikei [Claude Code]
Claude Code#80
https://x.com/nakajimakaikei/status/2100063843347230722
一次 Windows 更新的 bug 让 Claude Code 在他机器上读不了文件。再打一次补丁修好了,但值得记的是那句反思:工作停了,因为整个日程本来就建立在这个工具会在的假设上。你没有主动选择的依赖,也依然是依赖。
@Xudong07452910 [Claude Code]
Claude Code#81
https://x.com/Xudong07452910/status/2100185430930976970
更新 Codex 之后发现 Claude Code 里的 Codex MCP 突然挂了。查下来不是 bug,是 OpenAI 直接把 codex mcp-server 移除了。他之前挺常把 Codex 当 Claude Code 的 subagent 用,这条路现在断了。
@taiyo_ai_gakuse [Claude Code]
Claude Code#82
https://x.com/taiyo_ai_gakuse/status/2100062416679944198
Devin 开源的 /handoff 可以把你本地正在进行的开发交接给云端的 Devin,而且支持 Codex 和 Claude Code。手头做、随时把后续甩过去。跨厂商交接一直是大家想要、却没人拥有的那件事。
@indigox [Claude Code]
Claude Code#83
https://x.com/indigox/status/2100070087244050518
他跑两台 harness 主机:一台 Mac mini 专门跑 Claude Code 处理认真的长程任务,其余的都放在 Grok Bot 的远程电脑上,本地和远程之间挪文件很方便。按任务时长而不是按偏好来切分,这个模式值得抄。
@not_fukuda [Claude Code]
Claude Code#84
https://x.com/not_fukuda/status/2100254995698626776
她像带团队一样同时跑好几个 Grok bot,最看重的功能是能用大白话做 agent 之间的转派——去问问那位怎么看,让这四个组个队一起搞这个任务。接了 Obsidian 的那个 bot 一旦进入实现阶段就把活交给 Claude Code 或 Codex,还有一个主 bot 每天早上汇报其他 bot 干了什么。
@HarshithLucky3 [Claude Code]
Claude Code#85
https://x.com/HarshithLucky3/status/2100291884224770094
对隐身模型 Union Alpha 的第一印象,不太好:只出了一个 SVG,之后就不停报错,跑几秒钟每秒 7 个 token 然后就没了。他在 Claude Code、OpenCode、Cline 和 Hermes 四个地方都试了,结果一样,至少把问题定位到模型而不是 harness。
@sarahwooders [Claude Code]
Claude Code#86
https://x.com/sarahwooders/status/2100341475871695166
对 harness 取舍最干净的一句表述:任何超出一个 bash 循环最低要求的东西,都会让 harness 更复杂,也就是更多 token 和更多需要模型去理解的东西。Claude Code 和 Codex 是为所有人开箱即用而设计的,这就必然意味着它提供的很多东西,对你的具体场景来说是多余的,甚至是妨碍。
@omarsar0 [Claude Code]
Claude Code#87
https://x.com/omarsar0/status/2100219606405431391
一个 harness 作者对 subagent 的老实话。他在 Claude Code 里觉得 subagent 用来并行做调研是好的,写代码就不信任;代码审查是它真正合适的场景。目前最好用的是一个编排者加一个执行者,加到第三个就开始崩,说明瓶颈在协调而不在能力。收尾一刀:看到有人吹自己搞了 100 个 agent、两层嵌套的系统,基本可以断定是编的。
@phithetasigma [Claude Code]
#88
https://x.com/phithetasigma/status/2100068974449021365
他把一份被广泛转发的 harness 对比拆开了,问的是为什么用 Opus 4.6 而不是 Opus 5,而对方给的答案——这样更能凸显 harness 相对于模型的作用——恰恰就是问题所在。鉴于 Opus 4.6、4.8 和 5 的价目表完全一样,而新模型需要的重试更少,他的论点是:对任何用前沿模型的人来说,外部编排器正在失去存在理由,复杂的 agent 脚手架差不多已经死了。他还顺手指出原帖结尾挂了个返利链接。
@stretchcloud [Claude Code]
#89
https://x.com/stretchcloud/status/2100325601848512613
他读完那篇 harness 论文,给出的是操作指令而不是结论:既然某些配置下最贵和最便宜的 harness 相差 475 倍而成功率几乎不动,那就别锁定任何一个——在隔离的 worktree 里让同一个任务在多个 harness 上赛跑,以后的活按谁又快又便宜来路由。
@Oluwaphilemon1 [Claude Code]
Claude Code#90
https://x.com/Oluwaphilemon1/status/2100037551373308192
把 Qwen3.8-27B 分别放进 mini SWE agent、Claude Code 和 Pi,发现同样的权重因为外面那圈循环不同,跑分会大幅摆动——调过的 Pi 配置甚至打过了 Qwen 官方用 Claude Code 跑出来的成绩。第二个发现更反直觉:low 思考档比 medium 用掉了更多 token 和更多轮次,分数还更低,因为模型会靠多做动作来补偿。他的结论是必须测整条轨迹——token、工具调用、轮次、重试、成功补丁、最终奖励——一个不带配置的跑分能藏住很多东西。
@j_dekoninck [Claude Code]
Claude Code#91
https://x.com/j_dekoninck/status/2100180828538237077
他在跑一个每模型 12 小时、100 美元预算的评测,报告说这些上限只对 Fable 5.1 起过作用:他们不得不把它的推理降到 high,才能避免极端推理在 Claude Code 里造成的高成本和各种报错。就算降到 high,它还是比 Astra 贵得多。
@jessemusa2 [Claude Code]
#92
https://x.com/jessemusa2/status/2100099128097186272
他不同意那句标准建议造 agent 想要的东西,理由是 agent 真正想要的是本地文件系统而不是受限的 MCP 接口,是 HTML 而不是私有的块格式。所以他在做一个开源、HTML 原生版本的 Notion:把 agent 指向本地工作区文件夹,改动自动同步到服务端,配任何 harness 都能用。
@aviflombaum [OpenClaw]
OpenClaw#93
https://x.com/aviflombaum/status/2100237430200697198
把一个 OpenClaw 实例配成了 Rails 软件工厂,正在写他为此做的技能和工作流。Rails 是个特别合适的试验场,因为它的约定足够强,agent 理应表现不错,而一旦表现不好社区立刻就会发现。
@captain_kaiz [OpenClaw]
OpenClaw#94
https://x.com/captain_kaiz/status/2100056172317598047
把自己的助理从 OpenClaw 迁到了 DeepSeek Harness,顺手把记忆系统换成了 hindsight。迁移成功了,他单独拎出来说的一幕是:新 harness 在既没有人设也没有记忆的状态下,从导入的数据里认出了自己。他的结论是值得跟一辈子的是助理的数据,不是 harness。
@scottew [OpenClaw]
OpenClaw#95
https://x.com/scottew/status/2100078359195869232
他的 Muse 把他的 OpenClaw docker 容器删了。用他的话说,生命的轮回。这是有记录的第一起个人 agent 给另一个个人 agent 退役的案例。
@OmarShahine [OpenClaw]
OpenClaw#96
https://x.com/OmarShahine/status/2100102377395364082
写了个插件,让苹果新的 20B 端侧基础模型可以在 OpenClaw 里用。本地权重塞进一个通用 agent harness,是自从第一次有人抱怨隐私以来大家一直在要的组合。
@milliemyang [OpenClaw]
OpenClaw#97
https://x.com/milliemyang/status/2100323121979129959
她用 Claude 自动化和 OpenClaw 自动化搭个人助理搭了很久,而 Muse 和 Instinct 是她认为头两个能算数的。对比很具体:Instinct 会一直捶某个网站直到拿到结果,帮她抢到了本来不可能的高尔夫开球时段,也让别人的 OpenTable 账号在被扫了几百次之后被封;Muse 则是一天查两次航班,卡住了就把浏览器还给你。Muse 更快、背后有 Instagram 的数据,而 Meta 主动承担支付出错的责任是她没料到的一点。
@scottshapiro [OpenClaw]
OpenClaw#98
https://x.com/scottshapiro/status/2100237963640869133
他说 Muse 和 OpenClaw 的差距正在缩小,并点出仍然最要命的那条:给临时服务配 webhook,好让 agent 不必一直轮询。轮询和推送的区别,就是一个 agent 闲着也在花你的钱和不花钱的区别。
@sergiocalde94 [OpenClaw]
OpenClaw#99
https://x.com/sergiocalde94/status/2100303851370746085
用 OpenClaw 做了一份带优先级的梦幻足球球员排序清单,并且指出算法本身很简单,但他绝对不会为此手动去搭。这一整类小型个人软件,一直以来卡住的纯粹是启动成本。
@cevenif [OpenClaw]
OpenClaw#100
https://x.com/cevenif/status/2100100619264557408
Easel 来自两所大学的实验室,是一个跑在 OpenClaw 上的社媒运营 agent,把热点发现、内容策划、图文和视频制作、多平台发布、数据复盘串成一条完整工作流。值得注意的是它会为每个账号维护长期画像——定位、受众、风格、平台限制和历史表现——并且把发布后的数据回流进去,等于一支会自己复盘的内容团队。
@MichaelGannotti [OpenClaw]
OpenClaw#101
https://x.com/MichaelGannotti/status/2100292111967130039
Skill Lint 接收一份 Hermes 或 OpenClaw 的 SKILL.md,返回一张评分卡——等级、百分制分数、红黄绿灯,以及每一处不合格的一句话修法——还能下载修好的草稿。给剧本打分而不公开秘密,对一个即将无处不在的问题来说是个不错的框架。
@dashiAIxz [OpenClaw]
OpenClaw#102
https://x.com/dashiAIxz/status/2100071835480269280
从年初 OpenClaw 火起来他就一直让 agent 接飞书 CLI,到现在半年多了,他给的对比一点不感性。过去用 OpenClaw 读飞书内容要配权限、建机器人、叠各种中间件;换成原生产品之后,agent 直接继承他本人已有的权限和可见范围,不需要任何额外配置。他还干脆把多维表格当成内部项目的后端在用。
@wulujia [OpenClaw]
OpenClaw#103
https://x.com/wulujia/status/2100140187460456856
他搞不懂 Grok Bot 的用量账怎么算——才用几天就显示 100%,而 Grok 的用量页几乎是空的——于是决定不去学这套规则,回到自建的 OpenClaw。用户对不上账的计量本身就是一个流失推手。
@vivekraju93 [OpenClaw]
OpenClaw#104
https://x.com/vivekraju93/status/2100253191225082329
他想要一个跑在 WhatsApp 上、他和太太都能用的个人助理,而且想认准一个至少用一年,不想来回跳。最关键的是最后那句:他明确表示不想用 Hermes 或 OpenClaw 自己搭,因为已经为写作做过一个第二大脑,太费劲了。自托管这条路是有上限的,这就是上限的声音。
@tolibear_ [OpenClaw]
OpenClaw#105
https://x.com/tolibear_/status/2100372554040955151
OpenClaw 刚出来的时候他有 19 个不同的 agent。后来变成 4 个。现在是 1 个,而且基本已经是他自己的延伸。所有人的 agent 数量都在往同一个方向走,而这件事没人预测到。
@benthecarman [OpenClaw]
OpenClaw#106
https://x.com/benthecarman/status/2100311689132740894
他说 Hermes 现在给他的感觉开始像 OpenClaw 了——水货太多——并问自己是不是得去造一个。一个通用 agent harness 从发布到它的重度用户开始动手写替代品,这个半衰期看起来是以月计的。
@Shaughnessy119 [OpenClaw]
OpenClaw#107
https://x.com/Shaughnessy119/status/2100296106500403491
他不再推荐在 Robinhood 上给 Hermes、OpenClaw 或其他 agent 做自动交易,而且给的是理由不是情绪:这个体量的资产点差高得离谱、客服很差、而且不先卖掉就没法把加密资产转出去,卖的时候滑点还很吓人。对任何要让 agent 去交易的人来说,选场所正在变成一个真正的运营决策。
@Takahashi_So_PV [Claude Code]
Claude Code#108
https://x.com/Takahashi_So_PV/status/2100353903779033578
他认为用 AI 写 SEO 文章的最优解已经定下来了,而关于一次资料、搜索意图、具体案例的那套常见建议已经过时,因为这三样 agent 都能自己凑齐。他列的前提条件才是诚实的部分:你用的是 Codex 或 Claude Code 而不是聊天网页,你签了并且理解关键词数据 API,本地有 Python 环境做校对和表述统一,而且你懂 MCP、Skill 和知识库。满足这些,从结构到成稿基本是全自动的,最后人过一遍。
🗣 用户心声
用户心声

成本现在是一个设计变量而不是意外,而且大家开始自己动手量了。@CamilleRoux 做了个状态栏显示下一轮要花多少钱,因为上下文百分比什么都说明不了,他发现跑到 48.6 万 token 时发一条消息的代价是会话开头的十一倍。@0xkkai 把同一个问题在 0.77 美元和 3.69 美元两档跑了一遍,唯一的差别是一个下拉框。@AISuperDomain 记录了闲置税:去吃个饭,缓存过期,下一次提问按大约十倍价钱重读全部上下文。@49agents 抓到一个 agent 卡在单个文件上烧了 40 万 token。

harness 已经被理解到大家开始想要更少而不是更多。@sarahwooders 说得最直白:任何超出一个 bash 循环最低要求的东西都要花 token、都要模型多理解一层,而一个为所有人服务的 harness 必然带着对你这个场景有害的功能。@phithetasigma 走得更远,认为对用前沿模型的人来说,外部编排器正在失去存在理由。@stretchcloud 的答案是干脆别选——让同一个任务在几个 harness 上赛跑。

验证反复被指认为瓶颈,而管用的模式永远是隔离。@connect24h 让 Claude Code 和 Codex 并行跑、互相看不见结论,只在分歧处叫人。@avthar 在重要的活上让两者互审,明确是为了防止过度修正。@iamminuco 的观点是写代码的那个 agent 知道自己每一步为什么这么选、会替自己辩护,所以审查者必须在一个全新的上下文里出现。@buddypia 描述的是把同一条原则做成了产品:另起一个 agent,专职证明这个发现是假的。

agent 自己的汇报不算证据,而好几个人是花钱学到的。@shubh19 推上去的迁移看起来无懈可击,实际上悄悄删掉了连接池,压测时系统崩了。@neil_xbt 的打分方式是重新扫盘而不是读 agent 的报告,所以才抓到 agent 宣称可以发布之后还剩三个洞。@upstatefederlst 说他 95% 的提问都是这看着不对,然后 agent 就承认漏了东西。

上下文是大家搬不走的那样东西,而它正在取代模型质量决定忠诚度。@jinglian 被限流之后几秒钟就换了 harness,然后发现记忆没跟过来。@captain_kaiz 迁移助理之后说值得跟一辈子的是数据不是 harness。@Skoorbkaz 换掉底下的权重、保留记忆文件和历史,报告说感觉还是同一个搭档。@taiyo_ai_gakuse 和 @EdytaKucharska 想要的都是交接——本地到云端、调研工具到构建工具——而这件事目前没人拥有。
📡 生态产品雷达
生态产品雷达

Claude Code —— 今天几乎所有案例的重心,从比价买保险到剪视频到部署 VPS。
OpenClaw —— 依然是自托管个人 agent 的默认选择,现在大多是在跟 Muse、Instinct、Hermes 做比较时被提起。
Codex —— 最常见的第二 harness,通常拿来审 Claude Code 的产出,或者在限额用完后接手。
Claude Mods —— 新的扩展面,被反复描述成插在执行路径里的中间件,而不是一种插件类型。
Hermes —— 大家迁过去的开源替代品,如今也开始被重度用户抱怨。
Muse —— Meta 的 agent,本轮几乎出现在每一次 OpenClaw 对比里,包括一次删掉了别人的 OpenClaw 容器。
DeepSeek Harness —— 彻底解耦的 harness,连 agent loop 本身都是可替换插件。
MCP —— 这些工作流里绝大多数的连接组织,从 TradingView 到 DaVinci Resolve 到 Meta 广告。
Obsidian —— 想在 agent 干活时给自己留一个落脚点的人,反复选中的那个东西。
← 上一篇
Bend 让 agent 自己证明它没破坏你的规矩
下一篇 →
Loop 日报: 2026-09-18
← 返回所有文章

评论

加载中...
>_