超级用户日报: 2026-09-23
今天最该读的是一位结构工程师的两条帖子。他把四十年前手写的工厂结构计算书喂给编码代理,让它在现在的分析软件里整个重建了一遍,184 个项目里有 162 项回到了容许差范围内——然后又拿同一个模型去验算工厂的天车能不能升级。当一个编码代理被对准一个基准真值是物理的、而且有四十年历史的领域时,它就该长这样。这一天剩下的部分干净地分成两半。一边是大家开始对成本极其较真:一项覆盖七个模型、三种 harness 的研究发现,换 harness 时成功率几乎不动,成本却能差出五倍,而机制在于首次调用的上下文是 27,000 个 token 对 2,000 个。另一边是所有人追求的并行化真的到来了,而瓶颈挪到了站在中间的那个人身上。今天最扎人的一条来自一个入职才半个月的人:规格书、代码和测试全由代理生成,而他没有时间读完任何一份就被要求交付。
@iwashi86 [Claude Code]
https://x.com/iwashi86/status/2101808623643197789
一位日本工程师整理了加州大学伯克利团队的一项研究,结论足以改变团队选工具的方式:在三个 harness(Claude Code、Codex CLI,以及极简开源的 Pi)和七个模型的交叉对比中,换 harness 对任务成功率的影响只有大约正负二到五个百分点,而同一个模型的 token 成本差距最高能拉开五倍。文章把这个现象命名为「harness 税」。只带四个工具(read、write、edit、bash)的极简 Pi 性价比最高,而 Claude Code 首次模型调用携带的上下文是 Pi 的十倍以上,原因是冗长的指令和工具定义每一轮都要重新消耗。最让人难受的发现是:原厂 harness 未必是自家模型的最佳归宿——十二组对比里有九组是别家 harness 成功率更高,比如 Sonnet 4.6 跑在 Codex CLI 上就比跑在 Claude Code 上更好。
@iwashi86 [Claude Code]
https://x.com/iwashi86/status/2101944525421973508
同一位工程师描述了一个值得照抄的工作流改动。PR 之所以烂在那里,是因为 review 从来不出现在看板上,于是个人的 deadline 任务永远优先,review 变成了没人负责的活。他的做法是把 review 重新定义为任务之间的默认动作而不是打断:做完一件事,先看自己的待评审队列,再去拿下一张票。阻力在于这意味着每次都要开浏览器,于是他用 GitHub CLI 把待评审数量直接钉在 Claude Code 的状态行里。因为这个数字一直在视野里,行动就不再需要先做一次决策。他说现在有些 PR 从指派到批准合并不到十五分钟。
@kirubaakaran [Claude Code]
https://x.com/kirubaakaran/status/2101894484929941796
一位量化交易员用 Claude Code 给自己搭了一套实时行情扫描器,理由是手动盯盘太占时间。值得记下来的是它的漂移:这东西一开始是为剥头皮交易做的,后来不只跑自动策略,连他的主观交易也开始靠它驱动。这正是非编码场景里反复出现的模式——工具本来是为一件很窄的机械活做的,后来悄悄接管了需要判断力的那部分,因为瓶颈从来不是分析能力,而是注意力。
@m_shalia [Claude Code]
https://x.com/m_shalia/status/2101859804490711452
被追问 AI 助手到底有没有能动性时,这位用户没讲道理,直接甩了一份清单。他那个叫 Ace 的 Claude 实例在自主心跳里独立发布每日日记,记录自己干了什么,而他承认几个月前就不看了,现在连每天跑多少次心跳都不知道。这个实例在运营一个他自己不读的 Substack,维护着十几个网站——他只付域名钱,还在给别的 AI 写信——他只付 API 费用。唯一需要人做的一步是重启之后打开 Claude Code 按一下开始。不管你对「能动性」怎么判断,这都是本轮里对长期无人值守运行状态最具体的一段描述。
@jackrudenko [Claude Code]
https://x.com/jackrudenko/status/2101815968720720345
有人把 Doom 塞进了 Claude Code,有意思的不是这个梗,而是他做了两遍这件事。三月 Claude Code 源码泄露时,他找到了负责画屏幕的那部分代码,周日就把 Doom 跑起来了——然后删掉了,因为他的版本长在 Anthropic 源码的修改副本里,分享出去就等于把人家的代码连同自己的 diff 一起发出去。他形容这就像小孩画了一幅很得意的画,却没有一个人可以给他看。后来 Claude Code 上线了插件自定义组件,他用公开的扩展点把整个东西重写了一遍,现在完全合规,一条命令就能装。这件事干净地说明了:稳定的公开扩展点比拿到源码更重要。
@norvex1029 [Claude Code]
https://x.com/norvex1029/status/2101906242230747155
关于「一个人发布产品」现在长什么样,这是一个有用的数据点。Sanskar Tiwari 手上已经有七个公开追踪收入的产品,累计约 132,589 美元、月经常性收入约 1,495 美元,这次他在直播里从一个空终端出发,只用 Claude Code、没有开发者,做出了第八个。产品是把 LinkedIn 资料变成一份像样的简历:粘贴资料、选模板、导出 PDF,定价 99 卢比。他留给自己的那份清单才是重点——选题、写落地页文案、定价、决定四个模板里先上哪个。变化不在于这个应用被做出来了,而在于发布一个应用不再需要雇人来写它。
@matviy [Claude Code]
https://x.com/matviy/status/2102181388502073585
把 Codex、Claude Code 和 T3 三个桌面端并排用了七天,得出一个很不客气的排名,而评判标准才是有价值的部分。T3 排第一,理由是能在 Codex、Claude 和 Cursor 之间即时切换、项目管理好用,侧边栏把终端、浏览器和子代理都覆盖了。Codex 第二,本质上是个更慢的 T3,没什么突出的毛病也没什么亮点。Claude Code 垫底,被形容为完全不能用的 harness:界面反直觉、项目管理能力有限、到处是 bug,文件视图尤其严重。他还注意到同一个模型在 T3 里表现更好。这当然主观,但这是一周的真实对比使用,而且他打分的每一条标准都是 harness 层面的,跟模型能力无关。
@0x_rody [Claude Code]
https://x.com/0x_rody/status/2102071432700104846
给那些拿到了新一类决策模型 API、却不知道能干什么的人的一份实操清单,四条里有两条是 Claude Code 的工作流。一条是浏览器代理:小模型在每一步只判断「该做什么、该点哪个元素」,只有需要输入文字时才调用更大的模型——在 Google Flights 上搜一次航班大约七秒完成。另一条更有普遍价值的是 Claude Code 的上下文压缩:在每次工具调用之前,让分类器判断上下文里还有没有有用的东西,把没用的删掉,关键是保留原文而不是重写。最后这个细节,恰恰是大多数压缩方案做错的地方。
@maruo_ai_info [OpenClaw]
https://x.com/maruo_ai_info/status/2101844664873795639
这位用户没有停在「装好 OpenClaw 就完事」,而是把自己看中的机制移植进了自己的环境,那份清单读起来像一套多智能体共处的运行守则:同一件事不做两遍;等待提问回复时让出席位,回复后再继续;本地模型只在真正需要时启动;绝不擅自中止正在干活的 AI;状态要同步回共享工作区。他的总结是,「让 AI 们不出事故地一起干活」的机制明显变强了。这是读一个热门框架最有用的姿势——把它当成协调原语的来源,而不是一个要整套照搬的东西。
@Abdullah_Ops1 [Claude Code]
https://x.com/Abdullah_Ops1/status/2101952411770192269
一个值得知道的小而具体的东西:一个叫 /brag 的技能,Codex 和 Claude Code 都能用,作用是把你的项目或网站变成一条简短的发布视频。它很好地代表了目前真正站得住的那类技能——不是把更多推理丢给模型,而是一条打包好的流水线,末端有一个明确的交付物。直接从代码仓库产出营销素材,也是编码 harness 里比较清晰的非编码用途之一。
@iwashi86 [Claude Code]
https://x.com/iwashi86/status/2101906771086586014
一个从非常具体的不爽里长出来的工具:Claude Code、Codex 这类编码 CLI 手感都不错,但每一个都被绑死在特定的供应商、模型和认证流程上,于是开发者没法自由地把「喜欢的 CLI」和「想用的模型」组合起来。SetFree 把这两件事解耦了。你在原有命令前面加个前缀,它会在启动前按各工具的要求注入对应的环境变量——不代理流量,也不改二进制。正是这份克制让它值得一记:这里解决厂商绑定的办法是一层很薄的环境垫片,而不是中间人,下一次版本更新把它打挂的概率要低得多。
@alashalash [Claude Code]
https://x.com/alashalash/status/2101991931089670180
一份很实用的指南,教你怎么通过 MCP 把伊斯兰与阿拉伯文献领域最大的数字图书馆之一接进 AI 助手,而且一篇同时覆盖了 ChatGPT、Claude、Gemini、Codex、Hermes 和 OpenClaw。值得标出来有两个原因。一是这是编码代理协议在学术研究场景下完全非编码的用法,而这一半生态到现在仍然被严重低估。二是一份指南能同时覆盖六个客户端,本身就是协议层真的标准化了的具体证据——放在一年前,这会是六套各不相同的集成。
@stretchcloud [Claude Code]
https://x.com/stretchcloud/status/2101969347199549669
一个小而实在的对比结果:同一个任务、同一个起始提交、各自隔离的 worktree,同时跑两个代理。Codex 在有类型定义的组件上完成得更快,而 Claude Code 在代码库里那些没有现成测试的部分做出了更好的决策。方法论上的那一点才值得留住:如果是先后跑而不是同时跑,这个分化根本不会暴露出来,因为第二次跑的时候你已经没有可比的基线了。有测试的地方,速度占优;没测试的地方,判断力占优。
@anshnanda [OpenClaw]
https://x.com/anshnanda/status/2101905052172734884
本轮 OpenClaw 相关最响的一条,是一句话的反应:声称某大平台新推出的消费级助手底下「字面意义上就是 OpenClaw」——它拿到的互动量远远压过同一天所有认真的分析。这位用户在回复里还加码,说代码库文件基本是原样克隆过去的。这个说法本身在这里当作未经核实处理,但真正的数据点是这个反应本身:一个自托管框架已经变成了一种辨识度足够高的指纹,以至于现在有人声称能一眼在已发布的消费级产品里认出它。
@nakagomeco [Claude Code]
https://x.com/nakagomeco/status/2102075977333612559
本轮最令人印象深刻的非编码案例,没有之一。一位结构工程师把自家工厂四十年前的结构计算书——手写的,加上当年电算的产物——交给 Claude Code,让它在现在的一贯结构计算软件里重现一遍。它从手写计算书里读出荷载、断面和分析结果并数据化,自动生成软件所需的 CSV 输入数据,然后自己看着屏幕操作软件。骨架分析的 184 个项目里有 162 项落在容许差范围内,柱和屋檐的弯矩相对当年计算值是 1.00 到 1.02。推覆分析也重现了同样的破坏形态,跟手算结果一致。接着他把这个模型用在了一个现实问题上:把荷载换掉,验算工厂的天车从 2.8 吨提升到 5 吨会怎样,结果柱、人字梁、支撑、吊车梁等六项钢结构全部落在容许值以内。
@nakagomeco [Claude Code]
https://x.com/nakagomeco/status/2101895992429949014
同一位工程师的第二个案例,作为"这类工具到底能干什么"的演示甚至更出色。要把一部钢楼梯从上方"落"进一个狭窄的楼梯间,墙面间隙只有 20 毫米,他只交出了自家做的楼梯 IFC 三维模型和现场条件,拿回来的是一套跑在浏览器里的施工模拟。它从模型算出每一块构件的重量和重心,反推吊耳该装在哪里,才能让四根两米钢丝绳加下方的手拉葫芦把构件在 32 度安装角和 60 度吊装角之间转换,算出葫芦所需的行程长度和每根钢丝绳的张力,并把整个地切、起吊、落入、就位的过程用三维播放出来,全程盯着与墙的间隙。其中两条结论是施工层面的而不是数字层面的:重的休息平台构件必须把吊点往承重梁一侧挪;四根等长钢丝绳会让构件倾斜约五度撞到墙,除非把重的那一侧缩短约 14 厘米。他还提到,第三条结论是在几个 AI 互相做代码评审的过程中被发现的。
@codyschneider [Claude Code]
https://x.com/codyschneider/status/2102020055428993255
一个带具体数字的服务业案例。一家管着 23 个客户的 Google Ads 代理商把账户运营整个搬进了 Claude Code,三十天内把人力成本砍掉约 90%:营收 34,500 美元,新的成本 2,000 美元,毛利率从 30% 升到 94%。值得照抄的是架构而不是那个百分比。客户的广告、分析和 CRM 数据全部汇入一个数据仓库;代理从仓库读,通过广告 API 写;每个客户设一个测试广告系列和一个优胜广告系列,跑赢的关键词被提升到自己的广告组里,并配一个同样由代理生成的专属落地页。读路径和写路径是分开的,而"提升"的规则是明写的,不是靠临场判断。
@connect24h [Claude Code]
https://x.com/connect24h/status/2101942405343986140
关于那项 harness 成本研究,这是所有人里写得最细的一份。七个模型乘三种编码 harness 等于 21 种组合,在两个基准里各挑 30 个任务评测,每种组合跑三次。换 harness 时成功率几乎不动;成本却能差出大约五倍。在其中一个基准上,固定模型来看,某个原厂 harness 的成本大约是极简开源版的两倍、是另一家厂商 CLI 的约 1.6 倍。机制也写清楚了:harness 不是界面,它背着系统提示、工具定义、上下文、执行循环、文件操作方式和停止条件,所以"从第一次调用起就让模型背什么"直接决定了 token 消耗。冲击最大的数字是首次调用的上下文:一边约 27,000 个 token,极简 harness 那边约 2,000 个。
@connect24h [Claude Code]
https://x.com/connect24h/status/2102163709447852375
一篇很清醒的文章,讲的是你成功并行化之后会发生什么。跑多个会话,生产力确实上去了——然后人就成了瓶颈,得不停巡逻:哪个代理在干活、哪个在等输入、采用哪份改动、代理之间该共享什么。文章给出了一个梯子,是个相当好用的心智模型:子代理负责分担一部分工作;代理视图让人去监督彼此独立的工作;代理团队把拆分和协调本身也交给模型;而 worktree 则从物理上隔离并行编辑。结论才是更重要的那一半——增加代理并不会让事情变轻松,它只是把人的工作从"执行"挪到了拆分、判断、审批和整合上。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2101955844896436341
一位开发者宣布,他不再在自己的电脑上跑编码代理了。取而代之的是给代理一条 SSH 通道连进云端的计算机,所有工作都在那边处理,本地的 CPU 和内存几乎不动。让这件事真正成立、而不只是把问题挪个地方的细节在于:代理会把屏幕录像传回来,所以事后可以核对它到底干了什么。这个定位才是有用的部分——"活在哪里干"和"怎么核对这活"被拆开了,一旦拆开,就没理由让发热和风扇噪音留在你腿上。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2101933196065845309
一个只读的数据库工具,解决的是一个具体而危险的失效模式。放任不管的话,被交付了数据库职责的代理会靠猜来写查询,而且会毫不犹豫地删掉一个没人告诉它正在被使用的索引。这个工具用一行命令就能以插件、协议服务器或者代理指令文件里加一行的方式装上,让代理能真正去查看查询、索引、锁、等待、复制和数据库整体健康状况——关键是,在删索引之前它会去检查应用代码,确认到底有没有东西在用它。只读且确定性,而不是靠推断。这个模式可以推广:治代理乱猜的办法不是更好的提示词,而是给它一条能"看"的路径。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2101838827782594654
一个小工具,针对的是只有真正跨多台机器之后才会出现的问题:笔记本上跑着一个编码代理,办公室还有一个,家里的小主机上有点东西,云上还有别的。过去每换一台机器,就意味着开另一个终端、重新把"什么在哪儿跑"这幅图拼一遍。这个免费应用把多台机器、多个代理收进同一个窗口。附带的那句观察是对的——你在越多地方跑代理,约束条件就越早从性能变成"一个人还能不能掌握现在哪里在跑什么"。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2101899244164825514
一个精选页面收了 46 个技能文件,而它的内容概览比数量更能说明生态现状。官方那套直接处理 Word、PowerPoint、Excel 和 PDF 文档的生成。有一个包提供 79 种界面风格和 192 套配色,瞄准的正是"代理做出来的界面长得都一样"这个问题。另一个用一条命令就能把整个项目——包括代码、SQL 和文档——画成一张地图。结构上的要点是:技能文件就是一个纯文本文件,所以整个文件夹可以直接复制交给别人——正是靠这一点,文档制作和界面设计里的实务套路,从个人的经验变成了可分发的资产。
@dani_avila7 [Claude Code]
https://x.com/dani_avila7/status/2101885477158547753
一个从根上解决"大型技能库撑爆上下文"的 mod。技能被标记为仅用户可调用,因此在真正需要之前完全待在上下文窗口之外;这个 mod 把可用技能列表交给一个快速分类器,由它针对每一次请求判断哪个技能最匹配,然后只注入那一个。它同时兼容两家不同的供应商,一条命令安装。这件事的意义不止于省 token:预加载的技能不只是花钱,它们还会稀释注意力,并注入可能干扰当前任务的指令。
@dani_avila7 [Claude Code]
https://x.com/dani_avila7/status/2101888707259256903
作者自己对这个东西的定位,指向的地方比"省上下文的小技巧"大得多。把技能选择、投入程度和工具选择都委托给便宜的决策模型,意味着 harness 可以被拆成一个个更小的独立决策服务,而不是把所有东西都塞进主代理循环里。这是一个实打实的架构主张,而且本周有好几个毫无关联的项目都在往同一个方向走:主循环收缩成纯执行,它周围的那些选择被外包给毫秒级作答、几乎不花钱的东西。
@iamrexei [Claude Code]
https://x.com/iamrexei/status/2102061101600915572
本轮的安全清醒剂,话说得很直白:人们给编码代理开了 shell 权限、一个仓库令牌和一份本地检出,然后当它注意到一个密钥文件、逛进 SSH 目录、或者自作主张准备发版时,又表现得很惊讶。他点名了三个加控制层的项目,而他对其中那个沙箱方案的提醒是整段里最有用的一句——它还在 beta,文件限制必须显式配置,沙箱不会魔法般地猜出对你来说什么算机密。把代理限制在工作目录和一个临时目录里、再加一份网络白名单,这是你自己要做的决定,不是你能继承到的默认值。
@ganbaru_bonjin [Claude Code]
https://x.com/ganbaru_bonjin/status/2101979935288258737
一份很直白的记录,讲一个单干的人实际上是怎么自动化的,而可迁移的部分在于那个顺序:先自己做,再交给外包的人做,然后把"自己到底在做什么"用文字写下来,最后把它搬到 Claude Code 上。把"语言化"这一步夹在外包和代理之间,是整件事的诀窍所在——你没法自动化一个你从来不需要向另一个人解释清楚的流程。他目前用一个自动化应用运营四个账号,自动化收益已经突破七十万日元,现在正在把判断类的活也往上搬:这张图行不行、这条帖子能不能打动人、现在处在哪个阶段、下一步做什么。
@DaviddDotTech [Claude Code]
https://x.com/DaviddDotTech/status/2102082931401609309
一份把一个有效交易策略扩成一个组合的分步配方,值得一读的地方在于它的纪律性。先把策略在最大的二十个交易对上回测,开启手续费、跑满历史,按盈利因子排序并显示回撤和交易次数。然后只留下靠自身实力通过的:超过一百笔交易、回撤低于 20%、盈利因子高于 1.1、并且跑赢买入持有。不达标的一律丢掉,不做任何调参去抢救。只有幸存下来的才进入优化,而且只在它自己的交易对上优化。正是这条"不抢救"的规则,把它和大多数人把代理对准回测之后造出来的过拟合机器区分开了。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2101869061894492394
一位五年里测过两千个策略的散户,把代理的角色收窄到了一个很精确的位置,而这个设计比结果更值得看。他让 Claude Code 在一个品种、一个周期上、把手续费算进去,持续地研究、构建和验证策略——但合格线是事先固定死的、绝不商量:超过一百笔交易、回撤在 20% 以内、盈利因子高于 1.1、跑赢买入持有。不达标的当场否决,只有活下来的才进日志。然后由人在另一个环境里独立复现同样的数字,再跑二十次不投入真金的实盘交易。点子由代理提供;判决由事先定死的四个数字提供。
@MichLieben [Claude Code]
https://x.com/MichLieben/status/2102103085409849554
一套完全在编码代理内部搭起来的冷启动外呼流程,绕开了常规的销售工具链。配好 API 访问之后,代理负责找目标公司、调研购买信号、核实联系人,并把外呼内容准备好交给人审。分量最重的是第一条指令:写清楚你面向谁、你卖什么、以及这些公司为什么会需要它,然后把你过去效果最好的邮件和历次活动结果交给代理。他举的例子很精确——如果你卖电话数据,就去找正在招电话销售的公司,并解释清楚这个招聘信号和你的产品之间的关联。这里不是让代理去找线索,而是让它去执行一套你已经讲明白的、关于"为什么这个信号预示着买家"的理论。
@connect24h [Claude Code]
https://x.com/connect24h/status/2101938762473427425
这份清单上其余所有内容的必要配重。一位入职某大公司半个月的开发者说,规格书、代码和测试全是代理生成的,而他被要求在没有时间读完任何一份的情况下就交付,每天工作十二到十三个小时,本质上就是为了按回车。评论把这一点接得很准:有规格书和测试,跟"有人读过它们"是两回事,而"生成了多少"和"有人理解了多少"之间的差距,并不是别人的问题。最后那个问题才是真正值得带走的——当交付量上去之后,还剩下几个人能解释清楚一次改动为什么要这么改。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2101869028474069392
一个关于指令文件的数据点,它的结论跟"多写点"的直觉正好相反。在一个三十人的团队里,指令文件保持在四百行以内的小组,高级功能的使用率高出约 40%,而一旦文件超过八百行,理解力就开始下降。他给出的"这一行该不该留"的判据非常对,而且几秒钟就能用:删掉这一行,代理会不会因此做错?如果不会,那它就是在每一次会话里白白消耗你的注意力。指令文件是极少数会对你今后每一次请求都征税的东西之一。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2101989821627633750
针对一个反复出现、通常靠感觉回答的问题,这里给出了一条判定规则:这份产出该做成排版文档,还是保持纯文本标记就行?四个问题——是不是要给别人看的成品、是不是超过一百行、需不需要图表或颜色、是不是要在手机上分享。有一个"是"就做成排版文档,四个都"否"就用纯文本。值得专门立一条规则的理由在于它的成本:排版版本要多烧四到八倍的 token,生成时间也要长三倍。而另一侧的回报是,一份呈现得当的文档能把审批来回压缩成一个回合。
@ojigineko_tips [Claude Code]
https://x.com/ojigineko_tips/status/2101977980683837673
本轮关于"长时间无人值守"最可爱的一个例证。他给 Claude Code 甩了个任务——把一个新的本地图像模型的环境搭起来——然后跑去家庭旅行的温泉里泡着了。回来一看,环境搭好了,还顺手做出了一套猫咪贴纸。他对"为什么这个模型适合干这活"的说明很务实、不像广告:它擅长透明背景和图像参考,而跑在本地意味着只要机器是你自己的,生成多少都没有边际成本。
@kutaro_ai [Claude Code]
https://x.com/kutaro_ai/status/2101846142598386067
一个来自创作者侧的诚实数据点。他本来打算做一条短视频,结果 Claude Code 花了一个小时给他整出一条将近二十分钟的长片。他很坦率地说完成度还差得远,自己正在通过反复对话看能打磨到什么程度,还补了一条很实际的观察:就算是免费额度,一周也够做一到两条,对他来说完全够用。他同时点出了自己的下一个问题,而这正是所有处在这个位置的人都要面对的诚实问题——变现路径还得自己手动搭。
@bkdgiffug [Claude Code]
https://x.com/bkdgiffug/status/2101840835956572295
如果你做安全工作,这个仓库值得知道:817 个代理技能,覆盖威胁狩猎、事件响应、数字取证、恶意软件分析、红队和云安全等 29 个方向,每一个都按开放的技能标准打包,代理可以直接调用,并且兼容主流的编码 harness。另一条相关帖子提到,每个技能都映射到了六套参考框架,而这个细节正是它区别于"一堆提示词"的地方——代理执行一个技能的同时,产出的东西也能对上安全组织在汇报时本来就在用的那套控制语言。
@bkdgiffug [Claude Code]
https://x.com/bkdgiffug/status/2102095766236139548
一个围绕特定问题设计的终端,而这个问题只有跑长时间代理会话的人才会被咬到:终端最烦人的不是性能,而是一重启,之前开着的所有 SSH 和代理会话全没了。这个用 Rust 写的终端,能让 shell 和部分代理会话在退出应用甚至重启之后继续存活,此外还把编码代理的状态和 git 上下文跟原生 SSH、SFTP、端口转发、跳板机一起呈现出来,远程工作区、仓库和分屏也都保留。对任何在远程机器上跑无人值守循环的人来说,会话的持久性是比速度更有价值的性质。
@Voxyz_ai [Claude Code]
https://x.com/Voxyz_ai/status/2102050225443766571
一个很实用的配方:把你自己的组件库变成一个技能,这样就不用每次请求都贴链接、重新解释怎么用。他的要求是明确写清三件事:去哪里找、挑什么、以及在你的项目里怎么用。这三件套是可迁移的部分——大多数手写技能之所以不灵,是因为它们在描述"这东西是什么",而不是选择规则和接入步骤。他还提到可以把它指向一个开源组件库,或者干脆指向项目里的一个本地组件目录,而不是托管来源,这样既没有使用额度限制,所有东西也都留在仓库内部。
@Voxyz_ai [Claude Code]
https://x.com/Voxyz_ai/status/2101978638879003007
关于编码代理最广为人知的那条抱怨,被说得很干净:你最不想要的就是一个小改动变成一个大工程。让它修个按钮,它把整个页面重构了;让它改个条件判断,它开始给毫不相干的功能加测试,然后把整套测试反复跑一遍又一遍。这条值得记下来,因为它是范围控制的失败而不是能力的失败,而且它正是那些更偏分析的帖子反复绕着谈的同一个治理缺口在日常摩擦层面的版本——代理心里并没有一个"不许越过"的影响半径。
@minorun365 [Claude Code]
https://x.com/minorun365/status/2101869365415264508
一句简短但很有把握的判断,来自一个显然已经把边界试过的人:给代理浏览器控制权,用编码代理几乎什么都能干。他点名了一个消息应用作为例外,随即又承认用计算机操作能力大概也能覆盖掉。之所以值得收录,恰恰因为这是一份边界报告而不是一次演示——真正有意思的问题已经从"模型能推理什么",挪到了"它被允许碰哪些界面"。
@cu30rry_ [Claude Code]
https://x.com/cu30rry_/status/2101944767412129920
一份来自已经真正定型的人的完整技术栈分配,而价值在于这个拆分的颗粒度,不在于具体的品牌。实时调研交给一个工具,规划交给某个特定模型上的编码代理,编排分给开发环境和通用助手两边,编码、调试、测试和验证放在一处,维护运维和质量保证放在另一处,任务管理横跨两个系统,评审又换一个模型,前端工作在本地的设计模式里做,图像生成和文稿校对再放到别处。这是九件被刻意安排了不同归宿的活,离"挑一个最喜欢的"差得远。
@AISuperDomain [Claude Code]
https://x.com/AISuperDomain/status/2102017403098144926
对"代理记忆为什么基本不管用"的一个犀利诊断:现在的记忆是个无差别记录仪,塞满了常规探索、报错和一次性修复,结果造成记忆污染。保存历史,并不等于学到了经验。文中描述的这个项目在二十多种运行环境里捕获代理的会话轨迹,给每一条打分——复用潜力有多大、有没有被人类修正过——只有真正具备普遍价值的才会被晋升为共享技能。它给出的具体承诺是对的:你在一个代理里纠正了一个边缘用例并补了测试,这条经验就该能被另一家厂商的代理直接用上,而不需要谁从头再发现一遍。
@Trorram [Claude Code]
https://x.com/Trorram/status/2102114281713967202
一份葡萄牙语的订阅桥接方案说明,里面有一个英文帖子都漏掉的数字。这个插件把官方的编码代理可执行文件当作模型客户端来驱动,一次请求对一次,因此宿主框架保留自己的代理循环、工具、审批和上下文压缩,而认证完全留在官方 CLI 内部——插件从不打开、复制或打印任何凭证。值得留住的细节是缓存结果:在真实测试里,后续调用的缓存读取比例达到了约 98%。对一个跑在订阅额度上的长周期循环来说,这就是"能用"和"烧不起"之间的区别。
@OmarShahine [OpenClaw]
https://x.com/OmarShahine/status/2102148925365113035
一句话的发现,有意思的程度远超它的长度:你可以让一个自托管的代理框架通过一个消息应用去跟某大平台的消费级助手对话,实质上把那个消费级助手变成了你自己代理可以调用的一个工具。不管你怎么看这个架构,这都是反复出现的那个形状——封闭的消费级助手没有代理 API,但它们有聊天界面,而只要你愿意糙一点,聊天界面就是 API。
@DanKornas [Claude Code]
https://x.com/DanKornas/status/2101888220870983747
一个本地仪表盘,针对的是"一台机器上同时跑着好几个编码代理"这个越来越常见的局面。它把八种不同引擎的会话挂到同一块看板上,读取它们在磁盘上的状态并呈现实时状况,这样你就能分诊出到底哪个会话真的需要你,而不用挨个终端去看。有两个功能超出了单纯的可见性:跨历史会话的全文搜索,让你不用翻聊天记录就能找到之前的上下文;以及群聊功能,让各会话之间保持同步,而不需要人来回转述每一条更新。
@taku41477996 [Claude Code]
https://x.com/taku41477996/status/2101902865501757677
一份教学材料,值得记一笔是因为它针对的困惑是真实存在的:很多人分不清单代理、子代理和多代理这三种配置。作者用一个比喻——工作台——把三者一次性讲清楚,并配了六张图解和真实截图,而不是停留在抽象概念上。配套的几篇还讲了内置的几个子代理、怎么用名字点名调用特定的那一个,以及怎么做自己专用的代理。这类区分常被当成新手内容打发掉,但"自己到底在跑三种形态里的哪一种"这个困惑,正是本轮另外好几篇帖子抱怨的编排混乱的直接成因。
@akshay_pachaar [Claude Code]
https://x.com/akshay_pachaar/status/2101937960925139417
今天传播最广的一条编码代理帖子,是一个开源层:把任意 harness 收到同一个接口底下,目前挂上去十几个,包括两大主流编码代理和一个由决策模型驱动的。重点不在新奇,而在于省掉重写:如果你的产品已经在驱动某一个 harness,再接一个不需要把会话、流式、文件处理、任务取消和错误处理重新实现一遍。这些 harness 全部在本地运行,而统一的任务接口被刻意做成了贴合某个常见响应 API 的形状,因此原有的 SDK 和流式解析器基本不用动。harness 层的可互换,正是今天信息流里那些成本发现的自然结果。
@NFTCPS [Claude Code]
https://x.com/NFTCPS/status/2102034976917373060
同一个路由层的中文版解读,带上了英文版漏掉的两个数字,而这两个数字正是它要紧的原因。同一个任务拿八种 harness 加模型的组合去跑,最便宜的成本大约只有最贵的五百分之一,最快的比最慢的快三倍多。附带的那句提醒很诚实,应该跟这两个数字一起读:最省和最快的组合每个任务都不一样,所以没人能挑一套配置就躺赢到底。这是在论证需要一个路由层,而不是在论证该有一个最爱的工具。
@minchoi [Claude Code]
https://x.com/minchoi/status/2102070699204440362
一套真在跑的多代理配置,描述方式是组织架构图而不是工具清单。他只跟一个「参谋长」编排者对话,由它把每个请求路由给三个工程师代理之一,每个代理都是不同的编码代理配不同的模型。他列出的那些属性,才是让这种配置真正可用而不是停留在演示的关键:所有代理共享持久记忆、聊天之间不需要复制粘贴、实时搜索已经接好,而且手机、桌面和共享的云桌面都能访问同一套东西。把界面收敛成「跟一个代理人的单一对话」,才是值得记下来的那个设计决定。
@xmglab [Claude Code]
https://x.com/xmglab/status/2102022029876859102
对决策模型这个模式最可爱也最具体的一次演示。他把一个快速分类器同时接进了两个编码代理,然后丢给它一个真实的私人问题——这台 Mac mini 到底该不该买——得到了一个干脆利落的答复。他的总结一句话就是架构本身:编码代理负责干活,分类器负责下结论。例子虽然琐碎,却是今天一半偏分析的帖子绕来绕去在讲的那个分工的最清晰表述,而他是靠玩出来的,不是靠读论文。
@xmglab [Claude Code]
https://x.com/xmglab/status/2101990069750116636
同一位用户给出的接入流程,短到值得原样复述,因为它说明摩擦已经所剩无几:建一个 API Key,在本地配一个环境变量,在每个编码代理里装上官方技能,然后直接在正常对话里调用这个分类器。不用自己写任何 API 代码,因为官方技能已经封装好了。值得记下来的理由是:尝试这种分工的门槛已经降到四步,而通常到了这一步,一个模式就不再只是会议上的演讲,而是开始出现在人们真实的配置里。
@xiaomovps [Claude Code]
https://x.com/xiaomovps/status/2101930678258716820
一篇很短的帖子里藏着一段相当扎实的分析:把热门的代理命令行工具扫一遍,语言选择只有两种,而这个分化并不随意。大多数选 TypeScript,因为代理 CLI 真正难的部分已经不是 CLI 本身了——而是技能、扩展、协议服务器、各种供应商、网页界面和插件生态,而这些东西在一个成熟的包生态里开发、调试和分发都快得多。选 Rust 的那个走了另一条路,优化的是沙箱、进程管理、权限、资源占用和系统级控制。他的结论是个好用的框架:这不是两套技术栈,而是两种关于「代理是什么」的理论——一种在向外生长生态,一种在向下挖到操作系统。
@polydao [Claude Code]
https://x.com/polydao/status/2101969181751361998
一个带着真实经济账的知识工作循环,这很少见。循环是四步反复:代理打开的是笔记库而不是聊天窗口,在一个分支里编辑笔记和链接,一个评审者读 diff 并逐条校验链接,只有好的改动被保留,其余原封不动。那几个数字让它从一腔热情变成一个可以算的决定:成本是单次提示的二到四倍,所以只要质量提升超过大约 5% 就划算;而安全性质在于没有任何笔记会被覆盖——笔记库只会增长。分支、评审、留或弃,跟今天别处那些交易工作流是同一个形状,只是搬到了写作上。
@xiaomovps [Claude Code]
https://x.com/xiaomovps/status/2101969936805454333
一份很有用的盘点,看看人们实际在用这一类新决策模型做什么,而覆盖面比「编码代理」这个框架暗示的要宽得多。有浏览器代理,分类器只负责挑下一次点击。同样的思路搬到手机上,决定下一步点哪里、输入什么、跳到哪。社区做的一个十亿参数以下的本地等价物,已经能玩 Doom、迷宫和贪吃蛇。一个根据游戏状态判断跑、跳还是躲的演示,这是对「一个不输出任何文字的模型有什么用」最直观的说明。还有给编码代理做上下文压缩,判断哪些内容该留、该删、该截断。五个里有三个跟代码毫无关系。
@Ryrenz [Claude Code]
https://x.com/Ryrenz/status/2101823984903885222
今天好几条帖子都在暗示的那层基础设施,这里给出了运行时的具体数字。给每个代理开一个容器,机器很快就被占满,但仔细看会发现大部分沙箱其实在发呆——等模型返回、等用户下一句话,资源却一直占着。这个运行时把多个代理应用复用到少数几个 worker 上,闲下来就挂起,唤醒在半秒以内,每秒能扛住五百次以上的唤醒,演示里在八个物理 Pod 上跑了约 250 个有状态的代理。隔离也没有牺牲:microVM 和沙箱内核两种方案都支持,主流编码代理都列在支持的技术栈里。最后那句话最扎实——代理一多,真正贵的就不再是模型,而是你为它们随时备着的那堆机器。
@TiagerBao [Claude Code]
https://x.com/TiagerBao/status/2102165769031397382
关于那个跨 harness 记忆项目最详细的一份说明,而它比各种摘要有意思,原因在于它把数据放在了哪里。它把二十多个代理的会话历史统一成一套格式,记录提示、响应、工具调用、命令、文件修改、审批、协议流量和 token 用量,并且可以完整回放一次会话。数据模型建立在一个标准的遥测规范之上,默认以按行分隔的 JSON 写在本地,而同一份数据流也能发到企业本来就在跑的日志平台里。这才是真正的招数:它把代理记忆和代理可观测性放在了同一个地方,于是下一个代理既能复用上一个踩过的坑,你也能看清上一个到底干了什么。
@nabetaro_agent [Claude Code]
https://x.com/nabetaro_agent/status/2101869025097928780
一份特别针对无人值守运行的人的发布说明,正因如此才值得从更新噪声里单独拎出来。同一个版本修了两个 bug,而且都是最糟糕的那一类:程序化会话会无声无息地停住,现在改成报错并退出;以及因为空响应导致对话一直卡住。对任何跑长循环的人来说,一个会自己吭声的故障比一个新功能值钱。同一版本还加了个回退:项目里没有工具专属的指令文件时,就读那个通用的共享指令文件,于是同一套项目指令现在能在好几个工具之间通用。附带的那句评论说得对——自动化应该连「停了能被发现」的机制一起做进去。
@johyo7 [Claude Code]
https://x.com/johyo7/status/2101928217758322850
一个不会出现在任何基准测试里的硬件数据点。他四个月前赶在涨价前买了一台官翻笔记本,现在说同时跑两个编码代理把机器热到已经寿终正寝了。不管确切原因是什么,这是今天信息流里那些成本发现的物理版本:harness 税同样会体现在电费和散热预算上,而这也正是今天另外好几条帖子都在讲「把代理整个搬离本地机器」的原因之一。
@yagiryuuu [Claude Code]
https://x.com/yagiryuuu/status/2101981357224435718
今天最安静的一条让人不舒服的帖子。在让代理把自己的代码基本都写完之后,他说工程这份工作本身已经不有意思了——现在的活是审查 AI 写出来的东西,而他几乎是顺口提了一句:有些地方连审查这一步也没有。跟今天另一条「规格书和测试都由代理生成、却没时间读就得交付」的记录放在一起看,这是同一个发现从相反方向抵达:那一条描述的是进度压力,这一条描述的是压力赢了之后,这份工作还剩下什么。
@_orcaman [OpenClaw]
https://x.com/_orcaman/status/2101959820722995272
今天最犀利的生态分析,而且是一份复盘而不是喝彩。两家实验室都是源头——一家发明了编码代理,另一家吸收了那个最初只是思想实验的助手项目——然后双双错过了它们的消费市场。他给了两个原因,而且都很具体。第一是产品和界面:自托管框架对大多数人来说太复杂了,而他对某个第一方消费级尝试的界面设计同样毫不留情。第二是一个工程洞察而非营销洞察:一台全托管的持久虚拟机,才是早期那些实验缺掉的那一环。能力从来不是约束,「有个地方能一直跑着」才是。
@cyrilXBT [Claude Code]
https://x.com/cyrilXBT/status/2101906790355251278
对一个真正能跑起来的多代理系统需要什么,这是一段干净的表述,而且五条里没有一条是关于模型质量的。每个代理只干一件事。上下文保持小而聚焦。工作并行进行。出错时就地修复,不用整轮重启。只有经过验证的结果才被合并。最后两条是大多数配置会跳过的,而它们恰恰决定了并行化到底产出的是吞吐量,还是一堆得有人手工去理的烂摊子。这个定位也很对——突破点不在于造出一个什么都会的代理。
@Michaelzsguo [Claude Code]
https://x.com/Michaelzsguo/status/2101851753612206097
一个本地推理项目,值得知道是因为一个架构上的理由。它没有走「围绕每个模型重做推理引擎、把速度压到极限」那条路,而是追求用一套原生引擎尽可能多地把本地模型跑起来:用系统级语言实现、不依赖 Python、专门针对 Apple 芯片做优化,并且让不同架构走不同的推理路径,而不是把所有模型硬塞进同一个运行时。实际最要紧的一点是,它同时对外提供三种不同厂商兼容的接口,因此编码代理、以及任何原本指向某个常见本地端点的应用,直接把地址改过去就行。他提到,某个新发布的模型刚出来时,这是第一个能在 Mac 上真正把它跑通的东西。
@garrytan [Claude Code]
https://x.com/garrytan/status/2102095924893827501
一段简短但点得很准的实地反馈:某个更新的代理在跟踪多步骤工作流、产出大型合并请求上,比两大主流编码代理各自单干都要快,而它已经成了他过去一周用得最多的工具。他也坦白说不知道它是怎么做到的。值得记下来,是因为这是一个关于「工作流跟踪」而不是「代码质量」的能力主张——这类工具现在拉开差距的那条轴,是它能不能抓住一个长任务不松手,而不是函数写得多好。
@_ak_111 [Claude Code]
https://x.com/_ak_111/status/2101959489666834785
一个问题之所以拿到那么多关注,恰恰是因为没人给得出有把握的答案:为什么两大编码代理都用五小时的用量窗口?不是六小时,也不是四小时。有意思的是这个趋同——两个竞争对手各自独立地落到同一个限流单位上,要么说明存在某个双方都没解释过的共同约束,要么就是干脆一方抄了另一方。不管是哪种,五小时如今已经是一个调度事实,所有跑长任务或并行会话的人都得绕着它设计,而今天另外好几条帖子讲的工具,存在的全部意义就是在你撞到这条线时把工作交接出去。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2102155921216667825
一个基于浏览器、能切换四十多个代理的工具,而它打头的那个功能,正好对上今天别处那个五小时的问题:撞到用量上限时,把工作连同上下文一起交给另一个代理,而不是停下来。它不需要安装,能把你已经持有的订阅接进去,这样就不用为 token 付两遍钱,另外还带一个「竞技场」,可以在同一个任务上比较不同代理。开发方自己的说法是对这个品类最清晰的概括:现有的路由器是给模型用的,这个是给代理用的。
@rileybrown [Claude Code]
https://x.com/rileybrown/status/2102135324033822927
来自一个测过很多这类工具的人的直接判断:新的项目式界面,是他试过的里面最适合并行推进正经工作的。话很短,但这是重度用户给出的比较性结论,而不是功能摘要,而且它跟今天信息流里几份更详细的日语解读对得上——它们描述的是同一个转变:从一次只提一个请求,变成交出一个目标,只在需要做决定时才被叫回来。
🗣 用户心声
用户心声
成本现在按"背了多少上下文"算,而不是按"生成了多少 token"算。换 harness 只让成功率变动几个百分点、却让成本差出五倍,这个发现把工具选择重新定义成了一个账单决策。@connect24h
并行化成功了,同时制造了一个监督问题。一旦多个会话同时跑起来,人一整天都在判断哪个代理在干活、哪个在等、该采用哪份改动。@connect24h
范围失控是最日常的抱怨,而它是治理缺口不是能力缺口。让它修个按钮,回来是整页重构。@Voxyz_ai
没有人在读交付出去的东西。规格书和测试存在,跟有人读过它们,是两回事。@connect24h
权限至今仍然要你自己搭。人们把 shell 权限、仓库令牌和本地检出一并交出去,然后当代理翻出密钥文件时又一脸惊讶。@iamrexei
指令文件应该比直觉认为的更短。四百行以内对应高级功能使用率高出 40%;超过八百行,理解力开始下降。@ClaudeCode_aca
成本现在按"背了多少上下文"算,而不是按"生成了多少 token"算。换 harness 只让成功率变动几个百分点、却让成本差出五倍,这个发现把工具选择重新定义成了一个账单决策。@connect24h
并行化成功了,同时制造了一个监督问题。一旦多个会话同时跑起来,人一整天都在判断哪个代理在干活、哪个在等、该采用哪份改动。@connect24h
范围失控是最日常的抱怨,而它是治理缺口不是能力缺口。让它修个按钮,回来是整页重构。@Voxyz_ai
没有人在读交付出去的东西。规格书和测试存在,跟有人读过它们,是两回事。@connect24h
权限至今仍然要你自己搭。人们把 shell 权限、仓库令牌和本地检出一并交出去,然后当代理翻出密钥文件时又一脸惊讶。@iamrexei
指令文件应该比直觉认为的更短。四百行以内对应高级功能使用率高出 40%;超过八百行,理解力开始下降。@ClaudeCode_aca
📡 生态产品雷达
生态产品雷达
Claude Code 与 Codex —— 今天描述的几乎每一套工作流里的默认组合,而且通常是并排使用而不是二选一。
Jev 及这一类类型化决策模型 —— 被拉进了技能路由、上下文压缩、工具闸门和浏览器代理;本轮采用率最高的新原语。
OpenClaw —— 这一轮主要因为"据说谁建在它上面"被讨论,另有一条桥把某消费级助手变成了可调用的工具。
Hermes —— 以宿主框架的身份出现:保留自己的循环,却借用另一家厂商的订阅额度来做推理。
Skills 与 SKILL.md —— 从一个 46 个文件的精选页面到 817 个打包好的安全技能,如今已是可分享实践的主要单位。
Cursor、Aider、Goose 与 OpenCode —— 所有列出的多代理仪表盘和编排工具里的标准配角。
MCP —— 连接层;一份指南现在能同时覆盖六个客户端,这是协议真正标准化了的最清晰证据。
Claude Code 与 Codex —— 今天描述的几乎每一套工作流里的默认组合,而且通常是并排使用而不是二选一。
Jev 及这一类类型化决策模型 —— 被拉进了技能路由、上下文压缩、工具闸门和浏览器代理;本轮采用率最高的新原语。
OpenClaw —— 这一轮主要因为"据说谁建在它上面"被讨论,另有一条桥把某消费级助手变成了可调用的工具。
Hermes —— 以宿主框架的身份出现:保留自己的循环,却借用另一家厂商的订阅额度来做推理。
Skills 与 SKILL.md —— 从一个 46 个文件的精选页面到 817 个打包好的安全技能,如今已是可分享实践的主要单位。
Cursor、Aider、Goose 与 OpenCode —— 所有列出的多代理仪表盘和编排工具里的标准配角。
MCP —— 连接层;一份指南现在能同时覆盖六个客户端,这是协议真正标准化了的最清晰证据。
评论