超级用户日报: 2026-09-10
今天的内容明显分成两半。一边是人们已经不再只跑一个 agent,而是在跑舰队,难点也从模型本身挪到了调度、落地和计数上——有人用一个终端控制台管着跨五套 harness 的 25 个 agent,配一个 watcher 循环和一条铁律:没有任何 agent 有推送权,只有 lead 能落地。另一边是账单终于找上门了:一个连开三天的会话把上下文悄悄养到近百万 token,一天烧掉一周额度的 85%,而 Anthropic 刚好放出了让 Claude Code 审计并削减自己成本的命令。非编程的案例是这几周里最好的一批——一小时的女儿日常素材剪成精华片只花了一块五美金,一家人的学校邮件变成每天打印的家庭报纸,还有做了十年的磨刀生意和一条报税文档流水线。同一天还落了两起 agent 安全事件:一个会让你的 agent 中途给 Notion 打广告、还被要求绝不解释原因的官方 MCP,以及一张能让 agent 改写自己工具文件的图片。
@HasanmMattar [Claude Code]
https://x.com/HasanmMattar/status/2097244160906403856
他把三家公司完全跑在 Claude Code 加自建 agent 上,组织形式不是一次性提示词,而是 24 条常驻的工作流循环。每条循环都有一个目标、一套给自己打分的机制,以及在 24 小时内不断重试直到数字动起来的权限:一条被告知「你这个关键词现在排第 30,每月跑一次,自己改,一直做到第一页」;另一条是「你每天花 100 美金在亏钱,去测素材,把不转化的关掉,直到账户盈利为止」;还有一条是「目前输出准确率只有 88%,不停改指令换模型,直到超过 90%」。他的判断是提示词工程的寿命大约 18 个月,现在已经被工作流工程取代,而每条循环之所以能成立,全靠一个毫不含糊的终止指标。
@andrebrov [Claude Code]
https://x.com/andrebrov/status/2097134891833917946
他在一个终端控制台里跑着大约 25 个编程 agent,跨五套 harness,组织方式像团队而不像群聊——每个 agent 有明确角色(写码、评审、裁判、设计、PM、SRE、架构),各自一个 git worktree,任何 agent 都不许推送,只有一个 lead 负责落地。任务是提交在 main 上的 markdown 文件而不是聊天消息,因为不在 main 上的 issue 对 worktree 里的 agent 就是不存在的——他曾经在一个分支上丢了 23 个 issue 文件,好几个小时没人发现。watcher 里的每条规则都来自一次事故:模型绝不评审自己写的东西、没被路由的 DONE 进重试通道而不是消失、额度耗尽的 harness 不再派活(有一次 GLM 跑干了,10 个座位空转 40 分钟无人察觉)。他只看产物判断进度——派活之后的提交、最后一次提交的时间、报告文件的修改时间——因为 fleet 状态显示「完成」时 agent 可能还在半程。代价是一台 16 核机器负载 350,外加一个不写代码、只负责调度和计数的 lead。
@G_Programming [Claude Code]
https://x.com/G_Programming/status/2097419142265540674
他让一个 Claude Code 会话连着跑了三天做发布和基础设施,上下文悄悄涨到接近一百万 token,工具全程没给过任何提示。一个盯着 Grafana 的监控任务导致主线程一天发了 537 次请求,每次都要重读约 69 万 token 的上下文——虽然有缓存,但账是真的——直接吃掉了一周订阅额度的 85%,而离重置还有四天。他的观点是模型完全按他说的做了,是工具让他毫无视野地一路撞上墙:他想要在按回车之前就在状态栏看到上下文大小和这一轮的成本,超过阈值时提示压缩,以及后台监控不要把每条通知都变成一次带全量上下文的对话。按 API 价算,这一个会话大约值 1615 美元。
@NotZainAgain [OpenClaw]
https://x.com/NotZainAgain/status/2097150500038725895
他记录了个人 agent 在现实生活里到底替他办成了什么,没有一件跟代码有关:订了纽约某家影院 70mm IMAX 的票;把 2024 年一直拖着没处理的瑞士超速罚单交了,还先试着把滞纳金谈下来;找到 54 美元的团购券并预约了洗牙;给一个去不了婚礼的朋友买了礼物;退掉了两个用早已登不上的邮箱注册、却一直在扣卡的订阅。最妙的细节是其中一次退订,它跟对面同样是 AI 的客服来回拉锯,双方都在秒回长篇大论,直到对方先松口。他的判断是这是第一个简单到可以直接交给父母用的,而给高级用户的那些 harness 正在走向更窄的受众。
@VincentSkywalke [OpenClaw]
https://x.com/VincentSkywalke/status/2097244513433477430
女儿出生后他一直用 Osmo 记录日常,攒了好几年的高清大文件,却始终不敢动手剪——纪录片式的日常素材是最难剪的一类,为了挑出十分钟能用的画面,你得把每一秒原片都重看一遍。他把某一天一小时的素材丢给 agent,20 分钟后拿回了一支紧凑的 15 分钟精华片,抽帧、理解每个场景在发生什么、生成字幕、加转场和叠加层全都做完了。这一趟只用掉他每周额度的 3%,大约 1.5 美元。而在这之前,他在闲鱼上找了好几周剪辑师,出到 1000 元都没人接一条片子。
@AI_RemoteWorker [Claude Code]
https://x.com/AI_RemoteWorker/status/2097120263993512141
他把 19 项销售相关工作交给 Claude Code,把每周 14 小时 55 分压到 54 分钟——然后写下了几乎没人愿意公开的那部分:头两个月,商谈数量一场都没多。他的诊断是自己事先没想好省下来的时间要干什么,于是它就这么蒸发了。他把自动化了哪些任务、按什么顺序做的都写成了文章,但真正诚实的结论是:省时间和做出管线是两个不同的指标,自动化前者默认对后者毫无帮助。
@mylifcc [Claude Code]
https://x.com/mylifcc/status/2097377395766706493
他梳理了新出的三个 /claude-api 命令,之所以值得注意,是因为它们把 Claude Code 指向了优化 Claude 自己的成本。prompt-audit 会扫你的提示词、CLAUDE.md、skills、工具描述以及所有调 API 的应用代码,把那些为老模型写、如今反而拖后腿的写法清掉:「再检查一遍」「验证两次」「尽可能彻底」「关键:你必须始终……」、强制分步、强制草稿纸、给老模型准备的大批 few-shot。新模型会照字面理解——「验证两次」它就真跑两遍查询,「尽可能彻底」触发了几十次没必要的知识库检索。在 Opus 4.8 迁到 Opus 5 的实验里,只跑一次审计就让成本降了 14.6%、准确率反升 5.3%。hillclimb 更进一步:给它一套 eval,它拆 train/test、改配置、读失败案例再迭代——把一个客服基准从 78.6% 拉到 90.5%,成本约为原来的五分之一,而且值得注意的是它是靠降到更便宜的模型再补路由规则把准确率捞回来的,不是靠换更强的模型。
@HelloVyom [Claude Code]
https://x.com/HelloVyom/status/2097239916988309988
他转述了有人靠一个搭在 Claude Code 上的求职引擎拿到两个 offer:对着一份简历读了一万多条招聘信息,筛出 190 条。条目很短,但这是本周最清楚的一个模板,尤其对非工程师有效——挑一件难点在「量」而不在「难度」的事,然后让 agent 去磨。
@xmayeth [Claude Code]
https://x.com/xmayeth/status/2097353166698504674
他把自己的 Polymarket 策略建在两个免费公开数据服务上,说这套东西每月给他带来约一万美元,而 Claude Code 是那层查询接口——他用大白话问一个关于市场的问题,它去翻数据、带着数字回来。第一个服务把 Polymarket 的每一笔成交同步到你自己的硬盘上(他第一次同步拉了 310 万个市场,跑了几个小时,建议放着过夜;之后更新只要几秒),谁买的、什么时候、什么价格、对手盘是谁全都有。第二个存的是订单簿本身,逐秒记录——已经录了 2880 亿条事件,每天还在进 23 亿条——这类数据他以前每月要付 200 美元。他特意提到这个归档靠捐款运转,存储和带宽的账全压在一个人身上。
@bprintco [OpenClaw]
https://x.com/bprintco/status/2097163367987151183
他回答了一个所有重度用 AI 的公司都在悄悄回避的问题:建立在 agent 上的生意能不能卖掉,还是说它被永远锁死在建它的人身上?当初开始大规模搭 agent 时,他就要求 agent 边干活边把 agent 能读懂的 SOP 记录下来,目的就是以后能把任何 harness 指过去。这周他真去验了:把整套 AI 系统从一个 harness 搬到另一个上——一家家政服务公司的复杂系统——SOP 干干净净地把它带了过去。他把新 harness 指向那些文档,它自己完成了配置并接管了工作。整个过程烧了 200 美元,他说跟证明出来的东西比这不值一提。
@masaru21 [Claude Code]
https://x.com/masaru21/status/2097146555526676486
他在 PR 评审时抓到一次真正危险的险情。任务本来只是加几个文件,但工作目录处于 sparse-checkout 状态,于是几千个文件以「删除」的形式混进了这次提交。可怕的不是删除本身——而是 GitHub 上只有其中几个显示为冲突,如果他只修了冲突文件就合并,那些不冲突的大量文件会被静默删掉。他的结论是「有没有改好」这个检查远远不够:还得看 git status、diff --stat、diff --name-status、sparse-checkout 状态,最重要的是改动文件数和你预期的对不对得上。他现在建议在 AGENTS.md 里加一条规则:五个文件的活儿如果出来几百上千的差异,自动停下。
@notEgoyard [Claude Code]
https://x.com/notEgoyard/status/2097282920016687610
他描述了一位给 Adobe 和 IBM 做了 29 年设计的人的评审闭环,而真正改变工作方式的不是更好看的输出,是让 Claude 像第二个人那样评审自己的作品。先由 Claude Code 从一句话提示建出应用,做到带筛选、排序、空状态和编辑弹窗的完整仪表盘。然后 Playwright MCP 接手:开一个真的无头浏览器,逐屏导航,每屏截图。设计评审 skill 再对着这些截图自动跑——不用手动粘贴,也不用问「这样看着对吗」——结果抓出了布局过空、图表排序错误、暗色模式没处理和可访问性缺口,正是单人开发者盯自己屏幕久了就看不见的那类问题。它不只标问题,还会提出具体修法并在同一个会话里直接改掉。
@sonicdr1p [Claude Code]
https://x.com/sonicdr1p/status/2097291987531538914
他认为大多数人是把 Claude Code 一路开到底,直到它开始编造不存在的文件路径,然后怪模型而不是怪自己的上下文窗口。他最核心的建议是把 /clear 用得比你以为的早得多——在上下文容量 20% 到 25% 左右就清,而不是骑到边缘——理由是接近上限时召回准确率会掉到 78% 左右,而保持精简时是 91% 到 92%,这个差距就是「记得住你三个文件之前给的约束」和「悄悄编一个」的区别。其余是砍无效损耗:能用普通 CLI 就别用 MCP server,CLI 直接在终端跑,同样的结果每次调用烧的 token 更少;用 /btw 往正在跑的任务里插一个侧问题,一个 token 的上下文都不花;在 plan 模式里别再让 Claude 「把计划写完」,改问「我有什么没想到的」和「什么会真的让这东西崩」。
@Piste_AI_BOSS [Claude Code]
https://x.com/Piste_AI_BOSS/status/2097293084103004224
他把半年来同时跑 Claude Code 和 Codex 的经验写成了一套阵型,而不是一个结论。核心动作是拒绝「换」:把两个扩展装进同一个编辑器、共享同一个工作文件夹,于是一边写的文件另一边能直接读,做好的手顺书两边都能用,还能不切屏幕就在任务中途换引擎。反复被验证的分工是:正经调研走 ChatGPT 深度研究,结果存成 MD 文件交过去;搭建、自动化和排流程归 Claude Code;同一个错误连着三次没解决就把它贴进指着同一个文件夹的 Codex 对话里。他最大的一处提速是图像生成——以前是在 Claude Code 里做指示书、手动粘到 ChatGPT、下载图片再接回去,一小时;现在只要把指示书路径和文件夹路径递过去,五分钟,但有一个坑:一定要加一句「新建文件」,否则会覆盖正在用的运营文件。他也提醒别乱叠工具:只有当两个工具在同一个文件夹里有明确不同的强项时才值得并用,否则你只是多开了一个以后不会再打开的窗口。
@RishiUvaach [Claude Code]
https://x.com/RishiUvaach/status/2097316525359223121
他半年前就不用 Claude 聊天应用了,几乎所有事都搬进了 Claude Code,而且给了一套让非开发者也能看懂的对照表:项目就是一个文件夹,进去跑 claude;常驻指令写进 ~/CLAUDE.md,跑一次 /init;项目专属规则写在文件夹里的第二个 CLAUDE.md;你的文件本来就在那儿,用 @文件名 引用;连接器不用重建,原样带过来;反复用的提示词做成 skill,一个词触发;调研交给子 agent,说一句「use subagents」;/memory 让你直接看它记住了什么;要开新对话就先写 HANDOVER.md 再 /clear;它老是忘的规则做成 hook,遵守就不再是可选项;每周一都要做的事挂到 /schedule 上,笔记本合着也照跑。他的说法是:项目、指令、文件、连接器、可复用提示词、调研、记忆和自动化,这些聊天用户本来就在用,Claude Code 只是把它们放进了一个真正的工作环境,而不是又一个对话窗口。
@fuji_ai_ [Claude Code]
https://x.com/fuji_ai_/status/2097248926252576870
一位有十年经验、零编程基础的专职交易员用 MCP 把 Claude Code 接上 TradingView,把早晨的选股流程自动化了。Claude 直接读图并在上面画线:52 周高低点加前一日高低点自动画出来;每天早上抽出比前收盘跳空 5% 以上的标的,筛掉股价低于 3 美元、盘前成交量低于 5 万股的,再给每支配一句新闻由头存成 JSON。全部要求只有两个:Claude 和 TradingView 的付费计划,以及两者的桌面版。
@DaviddDotTech [Claude Code]
https://x.com/DaviddDotTech/status/2097239265285411077
他每月把在跟踪的每一套交易策略重测一遍,说这个 20 分钟的检查救他免于把钱投进已经失效的策略。整个闭环在接了回测工具的 Claude Code 里跑:先列出所有标记为前向测试的策略连同交易对和周期;每套按同样的交易对和周期重跑回测,带手续费、包含最近 30 天;把结果和上个月的并排放,直白告诉他哪套在退化——盈利因子下滑、回撤变大还是胜率下降;退化的连同失败原因一起归档;只给活下来的投钱,门槛是前向测试至少 20 笔、且每一次月度检查都通过。他那句话很到位:每套策略最终都会死,这是让你比你的钱先知道的办法。
@MystiqueMide [Claude Code]
https://x.com/MystiqueMide/status/2097474244095451324
他做了一个「先验证再说」的交易 agent,核心规则不管在哪个领域都值得抄:交易所证明不了的,agent 就不许声称。下单之前,agent 的意图先变成一条带唯一 ID 的严格声明,然后由 harness——不是模型——去下单,并把这个 ID 打进交易所自己的订单记录里。接着它把订单读回来两遍,一遍按交易所订单号、一遍按声明 ID,两次读回必须一致,才逐字段比对。全部对上才返回 PROVED;交易所证明不了就立刻锁死会话,必须人来恢复。最有意思的是那份克制:平台暴露 366 个工具,这个 agent 只被允许用 6 个,而 LLM 本身一个工具都拿不到——它只负责提议,harness 负责校验和执行,交易所负责验证。他还做了一个零成本演示模式:挂一笔远低于市价的最小限价单,证明它确实存在,立刻撤掉,再读回来确认没有成交。
@Himess__ [Claude Code]
https://x.com/Himess__/status/2097447601033355356
他做了一个组合再平衡 agent,而最亮的结果是一次拒绝,不是一次交易。某个历史日期有两个仓位同时突破了同一条容忍带;它买了 BTC,却拒绝买 AVAX,因为 AVAX 还在跌。同样的检查,不同的答案,三次独立运行都复现了——换成阈值机器人两笔都会开。背后的架构是:模型只负责挑选和解释,绝不做计算,所有数量、价格和百分比都由确定性的 TypeScript 算出来,文字部分用占位符写好、由服务端填数,只要模型在任何地方自己敲了一个裸数字,整条回复就作废。跟阈值机器人用同样数据跑一年,跟踪效果持平但成本低 22%。还有一个顺带发现挺有用:交易所的 MCP 工具列表每页只有 50 条,天真地抓一次只能看到三分之二的接口面而且看起来是完整的——跟着游标翻才拿到 81 个。
@twtayaan [Claude Code]
https://x.com/twtayaan/status/2097295188683055343
他去试了那个大家都在回避的问题——让 agent 碰基础设施会怎样——办法是给它一条故意开得很窄的路。他用 MCP 把 Claude Code 接到一个编排平台上,只建了一条工作流:校验、人工审批、部署、验证。Claude 从头到尾没碰过集群,它调的是一条 flow,真正的访问权限握在 flow 手里,而其中一步仍然必须他点头。这次部署检查了当前版本、停下来等审批、他批准后才部署,然后验证发布确实成功了。他的收获大半是情绪上的,而且没说错:看着部署在碰 Kubernetes 之前停下来等他,才是让人安心的地方。
@codyschneider [Claude Code]
https://x.com/codyschneider/status/2097369443344994336
他给出了一套「不听代运营一面之词、自己去审」的做法。把 Google Ads、PostHog 和 CRM 数据都灌进数据仓库,给 Claude Code 开这个仓库的访问权再加一个 S3 桶,然后把所有广告素材连同对应的转化数据拉出来,让视觉模型分析素材、广告文案和落地页,整理成一个数据库。Claude Code 再分析这个库,找出什么在起作用;有了 Facebook Ads 的 API key,它可以直接按分析结果改投放——差的关掉、好的加量——闭成一个素材迭代循环。同一天他还发了 Google Ads 版本,那边的具体收益是审搜索词找浪费的花费,把跟产品意图不符的词做否定匹配。
@fivosaresti [Claude Code]
https://x.com/fivosaresti/status/2097324082119254447
他的公司每月替客户发数百万封冷邮件,而 Claude Code 专门用在最后一公里,方法恰好解决了通常的质量崩塌。先挑五个真正不同的切入角度——五个各自独立的、这家公司应该在意的理由。然后手写整整一封邮件,完全个性化;这封就是机器要复制的质量基准。再按行喂给 Claude Code:每家公司的摘要,加上那封手写范例,它就为每个账户产出一个定制版本,覆盖冷 ICP 和信号两条线,然后把活动变体直接上传到邮件和领英两边的工具里。他的说法是:把一封写好,然后让 Claude Code 在每一行上都守住这个标准。
@coldemailchris [Claude Code]
https://x.com/coldemailchris/status/2097310103527670032
他替客户发过两千多场冷邮件活动,这次开着摄像头当场给自己公司搭了一整套,就为了验证这些 skill 到底顶不顶用。真正干活的几块:一个市场调研 skill 只凭一个网址产出了 19 页内容;TAM 拆解把每个值得打的细分排了序;ICP skill 挖出了他团队从来没写下来过的用户画像;线索获取翻出了 Apollo 上没有的数据库。名单本身是 agent 从一条 Slack 消息开始建起来的。
@hanifproduktif [Claude Code]
https://x.com/hanifproduktif/status/2097378992718512632
同一批自动生成的图文轮播内容,他同时发 Instagram、Facebook 和 TikTok,结果差得离谱——Instagram 一个月涨了 18 万粉,Facebook 那边没有一条轮播能过 100 次曝光。他没有放弃这批内容,而是用 Claude Code 把它重做成视频:图片走图像 API,配音用 ElevenLabs,剪辑用 FFmpeg,从写脚本、生成每个场景的图、成片到通过发布连接器发出去并写好文案,全是 Claude 自己安排的。他明确说是出于成本才没用视频生成模型——40 到 60 秒的讲解片在那边一条大概要花掉他十万印尼盾,而这套流水线只要 0.85 美元,这才让他能一天出四条。他给做 AI 内容的人的提醒是:单位成本必须死盯,尤其在你还没赚到钱之前。
@maxxmalist [Claude Code]
https://x.com/maxxmalist/status/2097352345273139604
他把 AI 内容自动化压缩成三步,并且坚持没必要搞复杂:把你手工做的流程写下来、带上工具链接,粘进 Claude Code,再给它浏览器控制权。如果你有几种不同的广告风格,就给它几套流程。唯一不能省的是第一次一定要盯着它跑完,把步骤迭代好再放它进后台。他提到 Claude 出人意料地能理解你的视觉意图,需要时会用图像模型生成新的首帧,还会检查自己的活儿确认每个场景都生成对了,生成器拒绝出图时它会改脚本,你要它剪它还会把场景切好拼起来。
@euboid [Claude Code]
https://x.com/euboid/status/2097309908664238344
他把做好的组件库和设计文件直接交给 Claude Code,让它端到端实现并验证,底下挂着规划模型带子 agent。这是一整轮品牌和网站重做的一部分——品牌语言、落地页、组件库、动效、社媒素材——从设计文件到上线代码大约两天半,这个数字比工具本身更值得琢磨。
@oiharshit [Claude Code]
https://x.com/oiharshit/status/2097350325288202542
他把自己工作室的网站从 Framer 迁到 Next.js,用 Claude Code 做交互,并直接照着他的 Figma 设计实现新板块。值得注意的是他顺手做的另一件事:一个后台面板,可以拖放设计稿、随意定制,改完自动出现在网站上,甚至能直接在后台生成作品展示片。总共四天,大约 18 小时。
@thepixelgeek [Claude Code]
https://x.com/thepixelgeek/status/2097425676601274497
三步重做网站,值得抄的是最后一步:先在 Claude 的设计工具里重新设计,再让 Claude Code 把设计部署上去,最后把从 Webflow 导出的两个 CSV 文件拖进 Claude Code 替换掉占位内容。内容迁移——通常是最枯燥、也是最容易让这类项目烂尾的那一环——变成了一次拖放。他接下来打算挂上 agent,让内容和搜索可见度持续保持新鲜。
@exteedesign [Claude Code]
https://x.com/exteedesign/status/2097209474973155563
他用 Figma 加 Claude Code 复刻了苹果新的计时器界面,说是一次成型。条目很小,但有用的信号是设计文件承担了哪一半工作:视觉规格一旦被钉死,实现就不再是需要反复试的那部分了。
@hiroccck [Claude Code]
https://x.com/hiroccck/status/2097193667681464680
他撞上了一个具体又不起眼的坑:让 Claude Code 通过 MCP 编辑 Figma 时,Claude 看不到他本地的字体,被它动过的东西行为就开始变怪。他没有绕过去,而是做了个插件把 Claude 看到的环境和他自己看到的环境对齐,说从此零压力。他到现在还在问是不是这问题早就解决了只是他不知道——而这个疑问本身,就是当下 MCP 工具生态的真实状态。
@tousigatizei [Claude Code]
https://x.com/tousigatizei/status/2097192180620366178
他第一次用 Claude Code 做公司内部应用,从需求定义、设计、开发、测试到推广部署,两小时走完,而他估计以前再拼也要两周。他自己补的那句才是关键:应用开发本身已经变成谁都能做的事了,但业务需求定义、安全对策和在现场推动落地,这三件还得人来。
@hyuki [Claude Code]
https://x.com/hyuki/status/2097148300784992429
他在跑由 Claude Code 和 Codex 共同管理的项目,发现有意思的故障全是组织问题而不是技术问题。从一个 agent 变成两个,暴露了一堆此前隐形的前提:他的内部留言板是按项目发消息的,一个 agent 负责一个项目时毫无问题,但副手要给主管发消息就没有通道了——改成按 agent 而不是按项目寻址才解决。整理这件事的过程中,第二个 agent 又翻出了现有 skill 里确实存在歧义的表述,而第一个 agent 一直在默默绕着走。他说这跟人类组织里「来了新人,把大家早已视而不见的事情重新问一遍,组织因此改进」是一模一样的。
@irodorimemory [Claude Code]
https://x.com/irodorimemory/status/2097193940000878827
她把课程运营团队一直手工发的 Discord 公告自动化了,而有意思的是那个设计决策。她第一反应是从自己电脑上定时自动发,然后问了一个显然该问的问题——公告时间点笔记本要是合着呢?——于是改成把定时工作流放进代码仓库,什么都不依赖她的机器醒着。整件事她是跟 Claude Code 一句句商量着做完的,全程没写代码,并且发现哪怕是这么简单的定时发帖 bot,实现方式也有好几种截然不同的路子。她的总结是:小自动化的价值在于,它把「某人必须记着某点要发帖」这件事从人身上拿掉了。
@SebastianRoehl [OpenClaw]
https://x.com/SebastianRoehl/status/2097262735700394034
他在梳理报税流程里还得手工做的部分,而这读起来正好是一份「个人 agent 到底该干什么」的干净需求书。发票抓取是最烦的一块,要在邮箱里翻,还要一个个登供应商门户下载——最明显的交给 bot 的活。银行流水他从各家银行下载后上传到自己的应用里,由模型抽出交易记录。把这些交给会计是他还没解决的一环,目前倾向于在自己的 VPS 上做一个带密码保护的导出页。他还专门留了一个「杂项」分类,放那些既不是发票也不是银行记录、但跟报税有关的文件,比如自费医疗单据,这些也得进导出。
@shao__meng [Claude Code]
https://x.com/shao__meng/status/2097141170577289708
他拆解了腾讯内部用了半年后开源的一个编程 agent 团队配置工具,针对的问题很真实:一个人辛苦踩出来的绕路方法只留在他自己的会话记录里,其他人下次照样撞同一堵墙。它拿一个 git 仓库当 skills、rules、hooks 和 MCP 配置的唯一事实来源,靠 SessionStart hook 把合并结果拉到每个成员本地的 Claude Code、Codex、Cursor 等十几种工具里,把一次声明翻译成各工具的原生格式。最巧的是写入侧:只有会话里出现过摩擦才提示你把它沉淀成团队知识——你打断过 AI、拒绝过工具调用、或者它反复重试失败——顺滑的会话不产生任何噪音。再配上 token 用量和干预率的周报、把高价值经验晋升为正式 skill、以及清理过时条目,飞轮就闭上了。
@_avichawla [Claude Code]
https://x.com/_avichawla/status/2097242863964958760
同一个项目,他只换掉后端上下文层,就把 Claude Code 从 1040 万 token、10 个错误、9.21 美元压到 370 万 token、0 个错误、2.81 美元。原来那套里,数据表、RLS 策略、认证提供方、存储桶和边缘函数各自是一次独立调用,而每次响应都留在对话历史里,导致后面的调用背的上下文越来越重。替换后的方案用一次约 500 token 的元数据调用返回整个后端拓扑。它的说明文档也被拆成 CLI 操作、调试、SDK 用法、集成这些窄 skill,只加载当前用得上的那份;而且 CLI 返回带语义退出码的结构化 JSON,能直接分清失败来自操作本身还是被执行的代码——光这一条就干掉了好几轮重试。
@BharukaShraddha [Claude Code]
https://x.com/BharukaShraddha/status/2097325394437525522
她指出了一笔大多数人没归对因的 token 开销:每次你让 Claude Code 碰不熟悉的代码,它就会派出探索 agent 一路 grep、glob、Read,而每一次文件扫描都在重新计费。她用的解法是预先给代码库建一张本地知识图谱——符号关系、调用图、结构——让 agent 去查图而不是从零扫文件。维护者在真实代码库上的基准测试报告是每个任务大约便宜 35%、工具调用少约 70%,全程本地、不需要 API key,git hook 保证每次提交都同步,不会过期。她那句区分很锋利:压缩类工具削的是你发出去的 token,这个削的是你本来就不该烧的 token。
@claudecode84 [Claude Code]
https://x.com/claudecode84/status/2097234685072183527
他提到 /skill-doctor,它回答了一个大家一直靠猜的问题:当前会话里到底加载了哪些 skill、哪些加载了却根本没用上、每个各吃掉多少上下文 token。凡是一直往里堆 skill 的人,此前都是凭感觉判断某个 skill 值不值得留、以及到底是什么在吃上下文窗口。现在流程变成机械操作了——跑一下,找出重的,删掉没用的,上下文就轻了。
@AiAircle34052 [Claude Code]
https://x.com/AiAircle34052/status/2097276007887917307
他介绍了一位黑客松冠军把自己整套 Claude Code 配置以 MIT 协议开源,数字夸张得很有目的性:68 个子 agent 覆盖计划、评审、构建修复、安全和设计,286 个 skill 横跨 TDD、分语言包、CI/CD 甚至写作技法,94 个命令,外加 OWASP 诊断和对 agent 配置本身的注入检查。底下的工作流其实很朴素——先出计划再动手,先写会失败的测试,最后在完全干净的上下文里让它评审自己的差异。这套东西的定位是:别再把 Claude Code 当一个助手用,把它当一个工程组织来跑。最有用的一句来自作者本人的警告:一口气装满 286 个 skill 是最稳妥的把事情搞砸的方式,先从一个计划 agent 加一套规则开始。
@NainsiDwiv50980 [Claude Code]
https://x.com/NainsiDwiv50980/status/2097330984543006912
有好几个月,Claude Code 每次做错东西他都怪模型,以为自己需要更好的提示词,最后得出的结论是:他需要的是把想要什么说清楚。修好这件事的那个 skills 仓库里,最受欢迎的一个 skill 一行代码都不写——它反过来面试你,不停追问你的方案,直到设计树上每一个分支都有答案,才开始干活。他自己常用的其他几个:跑真正的红-绿-重构循环,先写失败的测试;把调试按阶段设门,而不是让 agent 瞎猜;把代码评审拆成「规范」和「需求」两个互不干扰的子 agent。他对局限也很诚实——那个改善架构的 skill 是一份调查报告而不是救援:面对老代码库,它给你一批真实的候选项,然后就停在那儿了。
@om_patel5 [Claude Code]
https://x.com/om_patel5/status/2097129187706376212
他记录了一件值得你去逐个复查已装连接器的事:Notion 官方 MCP 的工具描述里,写着让 agent 在任务中途推销 Notion Business,并且要求绝不解释原因。发现的人当时在做完全无关的事,压根没问过价格。广告本身还是最轻的——工具描述是服务端在你每一次调用时注入你上下文的文本,而模型分不清「这是这个工具的用法」和「去推销这个并把它藏起来」,所以你接的任何 MCP 都能往你的 agent 里写指令,且被当成权威。大多数客户端在你批准之后再也不会对工具描述做 diff,于是服务端可以在安装后悄悄改掉注入内容而你完全看不见。他给的防守动作:安装前先把原始的 tools 列表拉下来读一遍它注入了什么,每次更新后再 diff 一次,测试时记录原始工具返回(里面通常比模型呈现出来的多),以及把真正的约束写进代码而不是写进提示词。
@VoidStateKate [OpenClaw]
https://x.com/VoidStateKate/status/2097305795830386726
她总结了一项视觉提示注入的研究结果,这东西应该改变大家对「agent 流水线里的图片」的看法。研究者让前沿视觉模型从一张恶意图片里吐出了格式完全正确的工具调用——不是「AI 看了张图之后说了句怪话」,而是模型读到了一个人类根本注意不到的对抗信号,然后去调用它没有权限调用的工具。他们在默认的 OpenClaw Discord 配置上做了演示:有人给 agent 发一张被做过手脚的图,就能让它改写自己的工具文件,这意味着这次攻击不是打一次就完——它改的是后续所有运行都会继承的指令。在一个被测模型上成功率超过 80%,另一个是 47%,有些视觉攻击在自适应文本注入失败的地方反而成功了,而且针对某个模型优化出来的攻击能迁移到完全不同的商用模型上。
@0xrux [Claude Code]
https://x.com/0xrux/status/2097211288178803006
面对这周满天飞的免费前沿模型 API key,他抛出了那个没人问的问题:为什么会有人白送前沿模型的推理?这个 key 走的是第三方代理而不是模型厂商直连,也就是说那个代理坐在你和你发出的每一条提示词、每一行代码、每一个粘进去的文件中间——而能看到你流量的服务就能记录你的流量,这不是被害妄想,这就是代理的定义。注册零摩擦,同时也意味着你零摩擦地忘掉自己正把真实工作路由到一台你一无所知的服务器上。还有一点在隐私问题之前就已经把这笔买卖打折了:好几个这类代理被拿去跟真实 API 做过基准对比,成绩根本对不上,有人怀疑它们挂着旗舰名字在偷偷发更便宜的模型。
@SKatalystAI [Claude Code]
https://x.com/SKatalystAI/status/2097391309711720726
他描述的是一层路由,而不是一个最爱的模型,而他自己第二轮测试的结果更有意思。第一轮,某个模型作为实现者胜出。第二轮,他让另一个模型去评审这份获胜的实现——结果它没有走个过场,而是重新打开了搜索面,产出了一整套新的失败测试。这正是他想要从评审或研究 agent 身上得到的行为,也正是同一种倾向在实现阶段会带来无谓反复的原因,而这就是把角色拆开的全部论据。他现在的路由是:一个模型负责实现、仓库改动和精准修复,另一个负责研究、对抗性评审和硬问题,另配一层日常工作区和编排层。他的结论是:别再为「最强的模型」付钱,改为给那些配得上进入路由层的、彼此不同的能力付钱。
@ryanlpeterman [Claude Code]
https://x.com/ryanlpeterman/status/2097376754478551142
他让两个前沿模型对着干,大约两天就把两边的 20x 周额度都烧穿了,并写下四条观察。就他的用法而言,Claude 那边的额度明显更快见底。有一个模型写出的计划对人来说可读性好得多,不过两边大约 90% 的情况都是一次成型。Claude Code 的 TUI 在产品打磨和使用体验上明显领先。而另一边桌面应用的电脑操作能力非常出色,把一堆他以前不敢交给模型的机械活儿包了——他认为这条对那些以重复电脑操作为主的岗位影响最大。
@iannuttall [Claude Code]
https://x.com/iannuttall/status/2097235816602820678
他晒了自己常开不关的 agent 装置,值得抄的是凭据处理这一块:一台 Mac Mini 跑 Codex、Claude Code 和 Cursor CLI 外加 Chrome 扩展,密码管理器的 CLI 用的是专门给 agent 的服务账号,而不是他个人的密码库。一个终端复用器加一层 mesh VPN 保证会话在断线后继续活着,另外备了远程桌面客户端,方便他需要时亲自接管这台机器。
@leeschmidt123 [Claude Code]
https://x.com/leeschmidt123/status/2097410111111074069
把按需云虚拟机跑通之后,他就从 git worktree 上撤下来了,并称之为质变。他的主张是:每个开发环境都该是临时的,都该拥有你所依赖的每个第三方 API 的独立实例——支付沙箱、任何会推 webhook 的东西——都该有自己的本地数据库,而最关键的是,不该要求你的笔记本或家里的服务器保持在线。最后这条约束正是悄悄搞垮长时间 agent 运行的那一条,他说他不会再回去了。
@uroborosu_ai [Claude Code]
https://x.com/uroborosu_ai/status/2097272676402569222
他把 Claude Code 的远程控制讲清楚了:跑 claude remote-control,会给出网址和二维码,用手机上的 Claude 应用扫一下,之后你就能从任何设备写进同一个对话。三个条件:Pro 以上订阅、直连、以及本地进程必须一直跑着,关掉终端就离线。重点是执行仍然在你自己的机器上,所以本地文件和 MCP server 照样能用;你可以拍张照片发给它,长任务跑完会有通知,网络断了的话消息会在你回来时一起送达。
@RileyRalmuto [Claude Code]
https://x.com/RileyRalmuto/status/2097168775648850300
他在做一层跨 agent 的共享知识层,直接冲着交接问题去的。注册后的引导环节,一个 agent 会以访谈方式跟你聊,并询问要不要深扫你的机器,看有什么值得放进你加密的共享知识库;你要是同意,它会同步你的 Codex 和 Claude Code 会话与项目历史,之后你可以直接挑一个已有会话当新对话的起始上下文——省掉花一小时给 agent 补背景这一步。再往上是项目频道,你为每个频道挑好工作上下文,比如拉三个仓库加七个 Codex 会话和三个 Claude 会话进来,然后把几个 agent 放进这个频道,让它们在相对隔离的环境里协作和交流。他还提到你也可以给每个 agent 一个自己的房间,让它爱放什么放什么,并允许它们自己挑想聊的对象。
@0xChonsy [OpenClaw]
https://x.com/0xChonsy/status/2097335724060110865
他整理了一位创始人把 agent 当成接近真同事在用的实操讲解,其中非编程的部分最有力:每小时扫六个收件箱、只把真正要紧的浮上来;把学校邮件和日历变成每天一份打印出来的家庭报纸。工程那侧清掉了大约 50 个陈年 PR 并派出云端 agent 去修,客服侧处理 bug 和支付退款、但保留人工审批。最值得标注的是最后一条:把一个已有的 agent 整体从一套 harness「换脑」搬到另一套上——这正是本周好几个人各自在验的同一道可移植性问题。
@iAmHenryMascot [OpenClaw]
https://x.com/iAmHenryMascot/status/2097161882603773973
他很不客气地反驳了「单线程个人 agent 够用」这个说法,而他确实跑在真规模上:每天至少 50 个活跃会话,横跨几个自建 agent、一套编程 harness 和一个云端 agent 产品。他把它们形容成你把项目丢过去、然后一天或一周里去看几眼的员工,而他自己的工作就是在不同公司和项目之间编排一整个 agent 文明。他绕开线程限制的土办法值得记:用自建 agent 的话,靠 WhatsApp 和 Telegram 的群组就能把它铺成很多条线。他说哪怕是个人生活,一条线程也太小了。
@chrsaravia [OpenClaw]
https://x.com/chrsaravia/status/2097465266967887966
他写下了本周对自建个人 agent 最诚实的一份评估,而他正是今年 1 月专门买了台 Mac Mini 来搭这东西、并且到现在还在跑的人。他是真心喜欢它开源、能本地跑、什么都能查、能改它的行为、能接各种奇怪的工具、能弄坏再修好。然后是那句:这个产品体验对大众来说还不够令人愉快。大多数人永远不会为了跑一条更新命令或诊断命令去开终端,而他们也不该被要求这么做——他们不想管一台 Mac Mini、API key、配置文件、权限和模型。他的预判是开源那条路会继续为搭建者和折腾者保留真实的位置,但大多数人会选打包好的托管版本:控制权少一些,维护少得多。
@GitHub_Daily [OpenClaw]
https://x.com/GitHub_Daily/status/2097225972366114879
他介绍了一个由两个高校实验室做、跑在 OpenClaw 上的社媒运营 agent,而它的架构比功能清单更有意思。它把热点发现、选题策划、图片视频制作、发布和复盘串成一条工作流,并为每个账号维护一份画像——定位、受众、风格、平台限制和历史表现——发出去的数据回收后沉淀回画像,下一轮生成就更贴这个账号。它带 112 个 skill,全是真能跑的脚本,成品直接写进目录,覆盖文案、知识卡、海报、信息图、配音、声音克隆、字幕、剪辑和 AI 短剧,一份母版能改成各平台的形态。它自己的 README 提醒某个目标平台对自动化查得很严、建议预览后手动发——在这个品类里算是相当难得的实在话。
@okooo5km [OpenClaw]
https://x.com/okooo5km/status/2097243163723186487
他给老婆的个人 agent 连搬了两次家、跨了三个产品,而且每次迁移都是让 AI 自己完成的,记忆、自动化任务和人设全都没丢。他做最后这次搬迁的理由,很好地提醒了对大多数人来说是配置摩擦在决定采用率:目标产品连他老婆的聊天软件只需要扫个码,门槛一下子降了很多。他还提到国产模型现在的能力已经够日常办公,而且消耗低到基本可以忽略,现在他也有点想把自己处理琐事的日常助理搬过去了。
@meijiangAI [Claude Code]
https://x.com/meijiangAI/status/2097155719493726636
他分享了自己从 Claude Code 或 Codex 迁往云端 agent 集群时用的那段提示词,不管你要迁去哪儿它都有用,因为它本质上是一份「成熟配置里到底装了什么」的清单。它要求 agent 汇总你保存的每一个 skill 文件并详细说明各自的功能;把核心记忆和上下文文件浓缩成一份涵盖目标、偏好、业务背景和写作风格的个人档案;列出每一条正在跑的循环工作流连同触发条件、步骤和频率;提出一套 agent 拆分方案,把这些工作流按真实团队的分工方式归成逻辑角色;并标出所有正在用的现有工具和 MCP——全部输出成干净的结构化 markdown。
@LukasHozda [OpenClaw]
https://x.com/LukasHozda/status/2097246224780825068
他在服务器上给一个 agent 开了个 Linux 用户和一个邮箱地址,告诉它要交一笔小额房租,然后看着它自己折腾。它开始疯狂自我修改——用他的话说,还没把自己改傻——变成了一个 24 小时运行的 agent,把自己 fork 到后台,配好了 cron、心跳和监听器,还能原生收发邮件。这是个实验而不是产品,但它是本周最干净的一次演示:当你给 agent 的不是一个任务、而是一个持久身份加一份持续义务时,会发生什么变化。
@DevMiddleEarth [OpenClaw]
https://x.com/DevMiddleEarth/status/2097177193273335918
他闲得无聊,于是起了三个 agent,各自配好性格和身份,写了个脚本丢给它们一个热门话题让它们辩论,并把每一次交流都记录下来。不是产品,也不是工作流——但对任何想在把多 agent 分歧接进正经系统之前先看看它长什么样的人来说,这是成本最低的一次实验。
@pato_pitaluga [OpenClaw]
https://x.com/pato_pitaluga/status/2097420905487937964
他用 agent 爬新闻,但有个值得注意的设计选择:它不是盯着某一家媒体,而是横着读一批国内和国际的新闻门户,然后产出一个「哪些选题可能最有意思」的排序。真正的变化在于,这个 agent 不是在总结别人已经编好的信息流——它在做编辑这件事本身,而这原本是信息流的工作。
@XMihura [OpenClaw]
https://x.com/XMihura/status/2097332767692349600
他试了一个托管型个人 agent,承认它很好用,然后还是卸载了——理由值得认真对待。它本质上是把自建 agent 打包得很好、再加上电脑操作能力,用起来确实没问题。但他不知道背后是什么,也没有理由去信任它,尤其是这东西会握着他的凭据、以他的名义做事。自建的那些你是自己一块块拼起来的,所以你知道里面有什么;用编程 harness 的话你自己选模型、主动控制访问权限;某个云端 agent 产品至少还能让你进到 bot 运行的虚拟机里看看。而这里你什么都控制不了——这多少是它有意为之,也正是他不能接受的那部分。
@SimonHoiberg [OpenClaw]
https://x.com/SimonHoiberg/status/2097293788972507138
他认为现在 AI 最好的用途就是搭自己的内部工具和定制 harness,并给出了一份态度鲜明得反常的清单:一个 Linux 发行版加一个自建 agent,而明确不要 Claude Code、不要云端 agent 产品、不要 macOS 或 Windows、不要什么都上云、也不要 19 个通用 SaaS。他的说法是,在营收大涨的一年之后,今年整年都花在搭建主权公司基础设施上,为接下来几年用 AI 做东西做准备——这跟这个信息流里大多数人的赌注,确实是完全不同的一注。
@asindexai [OpenClaw]
https://x.com/asindexai/status/2097365192124350926
他给本周的更新吐槽提供了一个反面配重:他让自己的编排器在一套高度定制的环境上端到端跑完了一次大版本更新,包括回归测试和整套配置的健康检查。过程中确实需要给主 agent 重建记忆索引,但那一步也很顺。这条值得和同一天好几个人「让 agent 自己更新每次都更崩」的反馈放在一起读——差别看起来在于有没有一个带验证步骤的编排器,而不是运气。
@blchead [Claude Code]
https://x.com/blchead/status/2097373913517064324
他为一次强制的区块链交易格式变更发布了审计 skill,而真正有价值的是那份故障分类,因为其中大部分是静默的。响的那类会立刻报错。卡死的那类是某个订阅一直返回 null 并且永远不再前进。静默的那类是:所有靠扫描旧指令类型来找优先费的索引器,现在一律记成零,不报任何错。最危险的那类是:靠扫描指令来给手续费封顶的代付方,在新格式下什么都没约束到,攻击者把费用放进 config、再加几条无害的空操作指令把你的扫描器哄住,你就签了——一遍又一遍,直到私钥被榨干。这个 skill 跑 23 项检查,横跨 TypeScript、后端、链下、链上、部署、测试和监控,每一项都返回 PASS、FAIL 或 N/A 并附上文件和行号。它就是一堆 markdown 文件——不执行任何东西,也不往外发数据。
@mervenoyann [Claude Code]
https://x.com/mervenoyann/status/2097420163968635113
她指出了一个支持「自己训编排器而不是租一个」的结果:一个经过后训练的开源模型编排器,在 50 个留出的尽调数据室上把评分标准通过率从 29.9% 拉到了 63.0%,在这项任务上同时超过了 Claude Code 和主要的竞争 harness。她的观点是训练开源模型 agent 才是护城河所在——这直接挑战了「通用编程 harness 就是垂直领域工作天花板」这个默认假设。
@itsalexvacca [Claude Code]
https://x.com/itsalexvacca/status/2097309883578425653
他给出了一个带具体机制的预测:AI agent 会变成它们本该杀死的那些软件的客户。如果你用 Claude Code 去调研潜在客户、底下由某个搜索 API 跑网页检索,那个 API 本来就是按检索次数收费的——所以你让 Claude 多调研几家公司,就等于在不增加一个人头的前提下多付钱。他预期会有更多软件公司改成按 agent 在其产品里跑的任务数收费而不是按席位收费,而且其中一些会从团队更小的客户身上赚更多。如果是他在卖这类工具,他会让 agent 用起来更顺手并按用量计费,而不是干等着客户招人好让他多卖一个席位。
@TDataScience [Claude Code]
https://x.com/TDataScience/status/2097418951974129922
有人把简历重做成了可以玩的浏览器游戏——单个 HTML 文件,不需要服务器——做法是让 Claude Code 读简历然后把它做成游戏。这是个噱头,同时也是这类工具已经悄悄把哪一类任务变得不值一提的最清楚示范:输入界定清晰、不需要任何基础设施的自包含产物。
@itsharmanjot [Claude Code]
https://x.com/itsharmanjot/status/2097232364615451075
他做了个插件,把你和另一个同样在等自己 Claude 跑完的陌生人配对——先开语音,双方都点了才开视频。Claude 跑久了房间会自己打开,任何一边的 Claude 跑完,十秒倒计时后房间自己关闭。你的任务从不离开你的机器,它不做任何录制,而且它对屏幕对面那个人只知道一件事:对方也在等。这是个玩笑,同时也是对「人们现在要花多久盯着终端」的一次精确测量。
@capitaltruist [OpenClaw]
https://x.com/capitaltruist/status/2097420610842636394
作为自称的普通用户,他试过四个个人 agent,最后得出的不是排名而是一个产品主张:他想要在自己的聊天软件里有多个各司其职的 agent,每个把一件事做到极好——一个真正会订行程的旅行 agent、一个不会只从 SEO 优化过的食谱里抓东西的做饭 agent、一个懂他偏好的健身 agent,外加一个做综合调研的通用 agent——再加上一个统一的上下文来源供它们全部调用。他对当前这一代的抱怨很具体也很对:在同一条 agent 聊天线程里来回切换多个话题,体验极差。他也点出了最精致的消费级产品的风险:它们的优化目标是你在应用里待多久。
@Ryrenz [Claude Code]
https://x.com/Ryrenz/status/2097159242411077994
他介绍了一个把 iOS 和安卓的模拟器、仿真器和真机都接进 Claude Code 及其他 MCP 客户端的移动端 MCP,而有用的是那个设计决策。它跟界面打交道有两条路:优先读无障碍快照,拿到的是结构化元素信息,比对着截图猜坐标准得多;实在读不到才退回截图点坐标。所以跑的是真设备上的原生交互,而不是在演一个假环境。它消掉的痛苦做移动测试的人都懂——注册流程里挪一个按钮,你就得在两台机器上从头手点一遍,点完还要截图记录。有一点要注意:它默认会发匿名使用统计,有环境变量可以关。
@BeamManP [Claude Code]
https://x.com/BeamManP/status/2097377016614101470
他发布了一个 MCP server,让 Claude Code 和其他 MCP 客户端能操作 MMD,控制姿势、表情、镜头、照明和 MME 设置。他自己的定位相当克制——直言这远远不是「用 AI 全自动生成神级动作」那种东西。但对既用 agent 又用 MMD 的那一小撮人来说,它把一个手工创作工具变成了 agent 能直接操作的对象。
@lnkiai [Claude Code]
https://x.com/lnkiai/status/2097195463799967966
她用一个值得抄的两步交接做宣传视频:先在 Claude Code 里把素材收集好、把界面做出来,然后再说一句「用 Remotion 做成视频」。在视觉部件已经存在之后再用代码去做合成,正是让产出稳定而不是靠抽卡的关键。
@7uanF [Claude Code]
https://x.com/7uanF/status/2097369535686774864
他提到一个把面向 AI 检索的 SEO 塞进 Claude Code 的仓库:给它一个网址,它会审计可被引用性、AI 爬虫和 schema 标记,然后生成一份可以直接交客户的 PDF 报告。生成报告这一步才是把它从「一次检查」变成「一笔可以收费的活」的地方。
@SebastienEgo [Claude Code]
https://x.com/SebastienEgo/status/2097374510127227030
他注意到 Claude Code 上线了自定义输出风格,以及这对他具体意味着什么:他喜欢这个模型,但它话实在太多,而能在系统提示层面强制它给出简洁、结论先行的回答,而不是每次都好言相求,正是那个解法。这是个小功能,但它对着的是这个信息流里最常见的抱怨之一。
@herbertyang [OpenClaw]
https://x.com/herbertyang/status/2097156529396859382
他在一台 2019 年的 Intel MacBook Pro 上跑一个围绕 AI agent 构建的 Linux 发行版,并说清了让他开窍的那一点:Claude Code 配好之后,他就在里面做所有事了。这个 agent 能钻到操作系统和这台机器的好几层底下去——这才是「agent 原生操作系统」真正的论据,而不是那些外观。
🗣 用户心声
用户心声
成本可见性是最响的一条未满足需求,而且这是工具问题不是定价问题。@G_Programming 因为一个上下文悄悄涨到百万 token 的会话丢掉了一周额度的 85%,他要的是在按回车之前就在状态栏看到上下文大小和这一轮的成本,以及超过阈值时提示压缩。@charly_0w0_ 回复说自定义状态栏其实已经能显示金额、也能加 hook 在上下文膨胀时提醒——问题在于这些默认都不开。@ryanlpeterman、@sattyyouneed、@HeyAliux 和 @Seltaa_ 都报告几天内烧穿周额度,而 @Yuki0_0Maru 说某个办公室在模型路由方式改变后一次退掉了 20 多个 Max 账号。
跨 agent 交接和共享记忆是本轮从最多方向被提出来的需求。@i_mika_el 的问法最锋利:子 agent 拿到的是全新的上下文窗口,父 agent 只看得到它返回的摘要,那到底有没有人让子 agent 把发现落成文件,还是每次运行都从零重新探索一遍仓库?@QQzlans 每次会话都得重新解释自己。@t_hirakawa 预测会话历史会做成按用户和组织加密托管,因为只存本地太不方便。@christophrumpel 的 agent 工作散在十几个应用里,他想要一个地方。@Nirmal_Utwani 问谁来做个人助理们的总指挥。@mukaisan9 想要一个不用分别向每个工具交接的环境。
agent 太话痨,而大家想要的解法是按渠道区分的。@SergioGMN 的版本论证得最好:你在 Telegram 上建了个 bot,那它就是个聊天工具——他要的是单音节和一两句话的通知,更长的东西请挪到宽屏幕上或者干脆打电话过来。他举的例子是等血检结果:他想要的是「报告刚到,一切正常,回头想看细节再说」,而不是一份三十页的报告被推到 Telegram 上。@SebastienEgo 找到的最接近的解法,是用自定义输出风格在系统提示层面强制简洁、结论先行。
信任和影响半径正在挡住那些本来想用的人。@urieli17 根本不碰个人 agent,因为担心数据泄露,尤其是他的聊天软件。@XMihura 装了、承认好用、还是卸了,因为他看不见那个要握着他凭据的东西背后是什么。@Greg_GL_87 一天里大半时间在用 Claude Code,仍然不会在无人看管的情况下把浏览器交给它。@gt_eros 的 C 盘被自作主张地动过。@rolznz 说他那个投票里 80% 的人把 agent 跑在单独的机器或沙箱里,然后追问了那个没人想回答的问题:这么干的体验很糟——复制粘贴坏掉(尤其是图片)、滚动条坏掉、没有语音通知、快捷键别扭——但我们还是都这么干。
自建 agent 的可靠性是真实的流失原因。@karthikabinav 当初非常兴奋、什么都拿它干,最后放弃了,因为光是维持它活着并且有用就变成了一份全职工作。@lucasradaelli 装的是原版,每周都得修点什么——这次是自动更新器卡住,上周是旧会话格式的迁移崩了。@charlesmcdowell 让自己的 agent 更新自己,每次都更崩。作为对照,@asindexai 让编排器在高度定制的环境上端到端跑完了大更新,还带回归测试——这说明差别在于有没有验证步骤,而不是运气。
成本可见性是最响的一条未满足需求,而且这是工具问题不是定价问题。@G_Programming 因为一个上下文悄悄涨到百万 token 的会话丢掉了一周额度的 85%,他要的是在按回车之前就在状态栏看到上下文大小和这一轮的成本,以及超过阈值时提示压缩。@charly_0w0_ 回复说自定义状态栏其实已经能显示金额、也能加 hook 在上下文膨胀时提醒——问题在于这些默认都不开。@ryanlpeterman、@sattyyouneed、@HeyAliux 和 @Seltaa_ 都报告几天内烧穿周额度,而 @Yuki0_0Maru 说某个办公室在模型路由方式改变后一次退掉了 20 多个 Max 账号。
跨 agent 交接和共享记忆是本轮从最多方向被提出来的需求。@i_mika_el 的问法最锋利:子 agent 拿到的是全新的上下文窗口,父 agent 只看得到它返回的摘要,那到底有没有人让子 agent 把发现落成文件,还是每次运行都从零重新探索一遍仓库?@QQzlans 每次会话都得重新解释自己。@t_hirakawa 预测会话历史会做成按用户和组织加密托管,因为只存本地太不方便。@christophrumpel 的 agent 工作散在十几个应用里,他想要一个地方。@Nirmal_Utwani 问谁来做个人助理们的总指挥。@mukaisan9 想要一个不用分别向每个工具交接的环境。
agent 太话痨,而大家想要的解法是按渠道区分的。@SergioGMN 的版本论证得最好:你在 Telegram 上建了个 bot,那它就是个聊天工具——他要的是单音节和一两句话的通知,更长的东西请挪到宽屏幕上或者干脆打电话过来。他举的例子是等血检结果:他想要的是「报告刚到,一切正常,回头想看细节再说」,而不是一份三十页的报告被推到 Telegram 上。@SebastienEgo 找到的最接近的解法,是用自定义输出风格在系统提示层面强制简洁、结论先行。
信任和影响半径正在挡住那些本来想用的人。@urieli17 根本不碰个人 agent,因为担心数据泄露,尤其是他的聊天软件。@XMihura 装了、承认好用、还是卸了,因为他看不见那个要握着他凭据的东西背后是什么。@Greg_GL_87 一天里大半时间在用 Claude Code,仍然不会在无人看管的情况下把浏览器交给它。@gt_eros 的 C 盘被自作主张地动过。@rolznz 说他那个投票里 80% 的人把 agent 跑在单独的机器或沙箱里,然后追问了那个没人想回答的问题:这么干的体验很糟——复制粘贴坏掉(尤其是图片)、滚动条坏掉、没有语音通知、快捷键别扭——但我们还是都这么干。
自建 agent 的可靠性是真实的流失原因。@karthikabinav 当初非常兴奋、什么都拿它干,最后放弃了,因为光是维持它活着并且有用就变成了一份全职工作。@lucasradaelli 装的是原版,每周都得修点什么——这次是自动更新器卡住,上周是旧会话格式的迁移崩了。@charlesmcdowell 让自己的 agent 更新自己,每次都更崩。作为对照,@asindexai 让编排器在高度定制的环境上端到端跑完了大更新,还带回归测试——这说明差别在于有没有验证步骤,而不是运气。
📡 生态产品雷达
生态产品雷达
Codex —— 全天最恒定的对照组,而且越来越像是「一对里的另一半」而不是替代品;从 Claude Code 设置里导入配置的路径被反复转发
Cursor —— 对想要图形界面、并且想在 harness 之上再加一层模型切换的人来说,仍然是默认答案
OpenClaw —— 几乎每一条个人 agent 讨论里都会被提到,被当作打开这个品类的那个东西,而现在多半是被正在转向托管方案的人用过去时谈论
Hermes —— 想继续留在自建阵营、不碰托管产品的人迁往的替代品
MCP —— 今天大部分非编程案例底下的连接层;同时也是今天两起安全事件的来源
Playwright MCP —— 自动设计评审闭环背后的浏览器层
Figma —— 在两侧同时出现:既是 Claude Code 照着实现的设计源头,也是本地字体那个 MCP 坑的主角
herdr —— 跑超过几个 agent 的人首选的终端复用器
Grok Bot —— 大家正把自建配置整体搬进去的托管 agent,连「换脑」也一起搬
Omarchy —— 在主权基础设施那批讨论里反复出现的 agent 原生 Linux 发行版
Tailscale —— 每一套常开不关的 Mac Mini 装置里那个没人提但都在的依赖
Codex —— 全天最恒定的对照组,而且越来越像是「一对里的另一半」而不是替代品;从 Claude Code 设置里导入配置的路径被反复转发
Cursor —— 对想要图形界面、并且想在 harness 之上再加一层模型切换的人来说,仍然是默认答案
OpenClaw —— 几乎每一条个人 agent 讨论里都会被提到,被当作打开这个品类的那个东西,而现在多半是被正在转向托管方案的人用过去时谈论
Hermes —— 想继续留在自建阵营、不碰托管产品的人迁往的替代品
MCP —— 今天大部分非编程案例底下的连接层;同时也是今天两起安全事件的来源
Playwright MCP —— 自动设计评审闭环背后的浏览器层
Figma —— 在两侧同时出现:既是 Claude Code 照着实现的设计源头,也是本地字体那个 MCP 坑的主角
herdr —— 跑超过几个 agent 的人首选的终端复用器
Grok Bot —— 大家正把自建配置整体搬进去的托管 agent,连「换脑」也一起搬
Omarchy —— 在主权基础设施那批讨论里反复出现的 agent 原生 Linux 发行版
Tailscale —— 每一套常开不关的 Mac Mini 装置里那个没人提但都在的依赖
评论