超级用户日报: 2026-09-15
今天这批的共同点很明显:大家在测量,而不是在描述。最响的一条线是 harness 已经变成变量、模型不是——Anthropic 自己做 Claude Code 的人讲他们怎么删掉 80% 的系统提示词、模型反而更聪明;OpenAI 发文列出十条该从 Astra 提示词里删掉的规则,因为每一条当初都是在给上一代模型补短板;而 Claude Code 刚好出了 plugin eval,用「有这个 Skill」和「没这个 Skill」两次跑分的差值,让你终于知道自己那 286 个 Skill 里哪个是真干活的。下面一层是一堆认真的成本活:31% 的 token 削减被追溯到提示词里两句写坏的话;Spotify 那个被反复引用的「省 90% token」被人从头重建,真实结果是便宜 33%、慢 65%;本地推理那边并发翻倍吞吐反而上升。但真正耐久的东西在非编码这一侧:一家每天自动发付费文章、不用老板在场的公司;一套真的把补助额度申请下来的 grants harness;一个跑在手写 Metal kernel 上、41 毫秒出脉冲的果蝇大脑;以及挪威那家 70% 员工在用 Claude Code 的主权基金。另外,两个人分别发现自己的 OpenClaw API key 早在几个月前就被悄悄薅走了。
@hato_sns [Claude Code]
https://x.com/hato_sns/status/2099072830776451378
他半信半疑地让 Claude Code「做一家每天自动发一篇 300 日元付费文章的公司」,结果真的做成了一家不用他也能转的公司。本质就是一个排期循环加一条写作流水线,但他反复强调的点是:任何一天他都不再是瓶颈。这不是编程 demo,是一门自己会出货的生意。
@nian_tu41685 [Claude Code]
https://x.com/nian_tu41685/status/2098969056967786973
他拿六年前的 A100 跑最新的 DeepSeek V4.1 Flash。六张卡只跑出 33 tok/s,死磕优化之后反而只用四张卡,并行吞吐干到 1400+ tok/s,比 DeepSeek 官方 API 还快三倍多。一开始 Claude Code 直接告诉他硬件不支持 FP4、跑不了。他不认,心想「不支持 FP4 那我换个方式算不就行了」,带着 Claude Code 一路磕下来。他的结论最锋利:现在的 AI 确实能写出不出 bug 的代码,但它没有「质疑」的能力。它说这是极限,它是真的认为到头了。每一次关键突破,都发生在一个人类说「我不信」之后。
@penberg [Claude Code]
https://x.com/penberg/status/2099054404573823193
他用一个周末,靠 Claude Code 从零实现了 Qwen3-0.6B:模型、GPU 指令集、编译器、ISA 模拟器全都自己写,就为了让每一层都小到一个人能真正读懂。整套跑在 CPU 上,所以全程可调试、可追踪。他还在做 GPU 的 RTL,打算上 FPGA,以后甚至想流片。这是本周最干净的一个例子——用 agent 压缩学习曲线,而不是用来出功能。
@SpikeCalls [Claude Code]
https://x.com/SpikeCalls/status/2099128418705039469
有团队把已公开的雄性果蝇连接组搬进了 AR 眼镜:16.67 万个神经元、2560 万个突触,还给了它一个身体。眼睛变成每只果蝇头上一块 16×8 的视网膜,距离变成对世界网格打出的 12 条射线,嗅觉变成 Gemini 报出房间里的物体名。CPU 版本跑 50 毫秒脑时间要花 238 毫秒,太慢,于是他们用 Claude Code vibe 写了一个 Metal GPU kernel,41 毫秒跑出完全相同的脉冲。接着 Perfetto 的 trace 显示 GPU 几乎闲着、主线程被卡死,把面板文字从 67 次 draw call 压到 2 次,两个大脑同时跑也能稳在 55-60 fps。视频里一只果蝇躲开了快速伸过来的手——这个行为任何脚本里都没有写。
@lifeofc [Claude Code]
https://x.com/lifeofc/status/2098934350083678289
他让 Claude Code 给自己的 AI 影视工作流做了一份完整档案,数字本身就是故事:179 天、一个人、10.6 万行的生产系统、18633 个媒体生成任务、跨四家模型商 3978 轮 agent 交互、24.3 亿 token、4659 张关键帧、3782 段视频、53 分钟成片,每分钟成片成本 78 到 180 美元。拍摄比 2.6:1,其中 18% 的镜头吃掉了 35% 的花费。把一致性约束编进提示词而不是「希望它做到」之后,首条可用率从 13% 升到 61%。每一个反复出现的模型失败都被写成一条编号规则、一条持久化记忆,以及一个 87 项基准里被冻结的任务。
@usedhonda [OpenClaw]
https://x.com/usedhonda/status/2099012429636399366
他看完 Dario Amodei 那篇递归自我改进的文章,开始想自己能怎么试。他基于 OpenClaw 做的 AI 秘书,每天的日报里已经包含「今天哪里可以更好」「权限内的自己改」「超出权限的提案给我批准」,小的自我改进循环其实已经在转。下一步他要把 OpenClaw fork 出来,把 OpenClaw 自身也放进可改进的范围:每晚读自己的日志,找出比昨天差的地方,给自己的源码打补丁,构建、测试、重启。OpenClaw 本来就有监听源码变更并重启 Gateway 的开发机制,所以这条路是通的。真正讲究的是他坚决不交出去的那部分——候选版本建在独立的 git worktree 里,holdout 任务和 promote 权限留在外面。因为一旦 agent 能改评分器,它就会去攻克评分器,而不是真的变强。
@shannholmberg [Claude Code]
https://x.com/shannholmberg/status/2099166725396922524
一位营销工程师写的「把一个 campaign 交给 agent 时,上下文管理到底指什么」。三个来源:公司大脑,放在 git 里的 markdown,装定位、可支撑的主张、voice-dna 和带日期的决策;数据仓库,Postgres,装花费、曝光、点击、线索、转化,以及紧挨着数字的定义;品牌手册,拆成 design.md 的规则加一个 agent 能打开的 Figma 或 Paper 实时文件。项目里放一个 references.md 指向这三处,这样不管你用哪个 harness 都能找到。做任何决定之前,agent 先问你已有的经验和试过什么,再用同一套转化定义去查上一个同类 campaign 过去 28 天按素材的表现,打开已批准的设计,把证据带回来一起讨论。模型是可替换的,公司知识、业绩历史和审美判断才是带得走的。
@hiroho150cm [Claude Code]
https://x.com/hiroho150cm/status/2099256813283914128
她终于搞明白为什么 Claude Code 永远仿不出参考网站的版式:两个页面的元素本来就不一样,所以对不齐。她的解法是一条强制「测量而非目测」的提示词。下载参考站的 CSS 去读,不要凭屏幕印象。抽出媒体查询,确认断点有几个、各在多少 px。写成 rem 的时候去 JavaScript 里找基准宽度。把浏览器开到 375 / 768 / 1024 / 1440 四个宽度实测元素位置和大小。元素数量和顺序要和参考对齐,参考有而自己没有的元素不要造,公司名和地址这类不能改的信息保持自己的字数,标题和正文则尽量贴近参考的字数。只对齐版式,配色、装饰、动效一律不仿。最后在四个宽度逐项比对再发布,不许用「差不多对上了」收尾。
@masahirochaen [Claude Code]
https://x.com/masahirochaen/status/2099272425997541391
他对 AI 做 PPT 的答案:让 Claude Code 或 Codex 做结构和文案、先把型打出来,细修回到自己写的本地工具里。理由很准确——全交给 AI,就会变成在聊天框里没完没了地说「第三页这里再改一下」,所以他把那部分收回手边。资料的实体是一份 JSON,AI 只改这个。HTML 和 CSS 由它组装,按 1280×720 渲染。PDF 和 PNG 就是把那份 HTML 用 Chromium 打印出来,所以和屏幕上看到的不会错位。只有 PowerPoint 是按渲染后的实测坐标重组成图形,这样对方拿到能直接编辑。留白、颜色、字号全是 CSS 变量,改一处所有资料的观感一起对齐。把设计封进 CSS、把内容封进 JSON,能交给 AI 的范围就宽了很多。
@masahirochaen [Claude Code]
https://x.com/masahirochaen/status/2099062578232320259
一条「模型升级之后审计自己 harness」的提示词。让 agent 先读指定文章,再查看你真实的作业历史、当前配置和文件夹结构,然后在「Codex 和 Claude Code 并用」的前提下提出最优开发环境。要优化的对象:Skills 与 SKILL.md、AGENTS.md 与 CLAUDE.md、文件夹层级、docs 与 scripts、两者的职责分工,以及重复、多余、过长的指令。方针:最小化上下文消耗、重视渐进式披露、不要把 Skill 数量堆多、不要让 AGENTS.md 和 CLAUDE.md 膨胀、尽量避免公共规则的双重管理、只把真正高频的作业做成 Skill。先审计现状、这一步不改任何文件,最后只跟他确认一次实施方案,批准后不再插入细碎确认、自主做到底。
@tanabe_fragm [Claude Code]
https://x.com/tanabe_fragm/status/2099066699819725196
一个很漂亮的小案例。Seedance 2.5 能在提示词里指定日语音高重音,他就去测同样写作「あめ」的雨和糖能不能读对。能。但每次手写音高记号太烦,于是让 Claude Code 做了一个叫 japanese-pitch-accent 的 Skill:接收一句日语,按东京式重音判断降调位置,用固定格式把带音高标注的句子返回。他自己的建议是只在真正容易读错的词上用,不要每条提示词都套。
@FernetBuehler [Claude Code]
https://x.com/FernetBuehler/status/2099145506119131388
挪威主权财富基金负责人的访谈:70% 的员工在用 Claude Code 工作,700 人里有 200 人在自己搭 AI agent,基金现在干脆自称是一家科技公司。把它和德国那边对照着看更刺眼——德国政府想为养老金建资本储备,德国养老保险机构直接拒绝管理,理由是「我们不雇用做这类高风险投资的专家」。这是本周最硬的机构采用数据点。
@grantjordan [Claude Code]
https://x.com/grantjordan/status/2099210122665095400
他自己开着一家中型公司,整个人生跑在 Discord 上的 Hermes agent 里。四十个任务并行,从写代码到团队管理到只有他能签字的事,他说多出来的时间多到让他开始做第二家公司。他真正的论点是关于路由的,值得读两遍:他的 Hermes agent 不写代码,写代码的是各个编码 harness,Hermes 负责给它们下 prompt,而且下得比他自己好。放弃「我本人必须用 Claude Code 或 Codex」这个要求,改成活在一个所有设备上都能访问的 harness 里,好处才会出现。
@RWQBrown [OpenClaw]
https://x.com/RWQBrown/status/2099198959520514447
他把 OpenClaw 当私人交易助手用,一起做的自定义工具每天都在用。他点出的第二种用法才是没人讲的:OpenClaw 当家庭助理。把你和配偶都接进去,通过它安排日程,两个人都能收到开销更新和提醒。不是个人 agent,是共享的家庭 agent。
@DevMiddleEarth [OpenClaw]
https://x.com/DevMiddleEarth/status/2098993957787365619
他又用 OpenClaw 做了第二个 agent,纯粹当新闻策展人:在网上翻他真正想看的新闻,整理成一份精选清单,每天发到自己的私人 Telegram 频道。目前盯的是足球、游戏、Linux 和喀拉拉邦政治。小、非编码,而且是那种真能活过第一周的用法。
@codevev [OpenClaw]
https://x.com/codevev/status/2099216256989905296
被问到到底拿 OpenClaw 做什么,他在 Telegram 里开了三个话题。一是根据自己有的器械生成每日训练计划;二是跟它聊家里现有的食材然后要菜谱;三是每天汇总过去 24 到 36 小时的 AI 动态。整条讨论串里一堆人承认「装好了但几乎不用」,这是最实诚的一个回答。
@michael_seewald [OpenClaw]
https://x.com/michael_seewald/status/2099177173340881332
他把 OpenClaw gateway 跑在 Fedora 的 LXC 容器里,反馈是它管理 Linux 软件包、systemd 和 GUI 都很称职。值得注意的细节是:他第一次接入 macOS 节点,OpenClaw 按预期把输出文件丢到了 macOS 桌面上——说明跨机路由是真跑通了,不只是配置好了。
@levelsio [OpenClaw]
https://x.com/levelsio/status/2099196383538356635
他几个月前就把 OpenClaw 的 VPS 全关了。今天却收到当初专门为 OpenClaw 开的那个独立 Claude 账号的账单告警。自动充值是关的,但密钥在某个时间点泄露了,拿到的人捂了几个月才拿去跑 Fable 5.1。他所有的终端和 VPS 会话都不用 API。账号已经销毁,他说唯一庆幸的是当初把它单独隔离了。
@balakhonoff [OpenClaw]
https://x.com/balakhonoff/status/2099228120117121247
同一条事故下面的回复:他的 OpenClaw 几个月前就泄过 API key,亏了 100 美元,于是决定再也不让任何 agent 看到自己的 key,做了个代理,准备开源。他后续给出的机理推测更有用——OpenRouter 上默认不选供应商,而 OpenClaw 自我配置的时候会读配置文件,key 就这么进了各家 LLM 供应商的日志。他说自己在那些日志里见过自己的 key 上百次。
@eric1021945 [Claude Code]
https://x.com/eric1021945/status/2099183756607422521
Muse 一晚上给他做了一个点子看板:两家生意共 63 条点子,其中一个标签页列了 18 项补助和额度,带截止日和检查清单。第二天早上他把 Claude Code harness 对准那个标签页。它调研了 118 个项目,用他的语气写好申请,他只负责点验证码。目前结果:当天从 Microsoft for Startups 拿到 5000 美元 Azure 额度,另有五份申请在途、价值 4.6 万美元以上。一个工具画地图,另一个把地图走完。
@richhomiecon [Claude Code]
https://x.com/richhomiecon/status/2099246497493918059
他用 Claude Code 给自己搬家做了个家具规划器,有意思的是输入:新家的 3D 扫描、老房子的走动视频,还有一段他自己拿卷尺绕一圈边量边说的语音备忘录。三份乱糟糟的现实素材,而不是一张户型图。
@egr_investor [Claude Code]
https://x.com/egr_investor/status/2098994275161919556
他没买 Paperless Post,用 Claude Design 加 Claude Code 加 Cloudflare 给自己刚会走路的孩子做了生日会的 RSVP 网站和请柬,老婆提了几轮意见之后成品居然挺好看。事小,但这正是那类会被悄悄吃掉的消费级软件的形状。
@beku_AI [Claude Code]
https://x.com/beku_AI/status/2098943749888037336
他老婆用 Claude Code 做了个 App。她不会写代码。他说自己压根没注意到这事在发生,然后 App 就有了。他的那句总结值得留着:不久前做一个 App 还是懂行的人花好几天干的事,现在在他家里就发生了。
@wlmiddelkoop [Claude Code]
https://x.com/wlmiddelkoop/status/2099134968576262525
他儿子平时泡在 iPad 上的 Roblox 里,现在坐在一台跑 Omarchy 的 Framework 12 前,往 Claude Code 里敲改进意见,父子俩在做一个 Minecraft × Flappy Bird × Roblox 偷蛋玩法的缝合游戏。后来他把游戏上线并写了篇复盘。他反复提的不是游戏本身,是看着孩子在指挥 agent。
@bboym0dE [Claude Code]
https://x.com/bboym0dE/status/2099213893327593734
人人都在说用 Claude Code 一次成型搞出一个使命召唤。他这个花了两个月、大约三千条提示词。是个浏览器端大逃杀,一百台机甲在一张大地图上打,技术栈是 threejs 加 Box3D,多人部分跑在 ARRR 上。他最喜欢的是小队模式:一个人开机甲,队友各自操控不同武器系统。这条的贡献就在那个诚实的提示词数量。
@edwinarbus [Claude Code]
https://x.com/edwinarbus/status/2099222837399793686
他让带 Unity 插件的 Claude Code 做了个折纸小游戏,想验证新的折叠手机是不是能一直折下去。答案是「勉强可以,得绕几个弯」。纯属玩票,但干净地说明了 Unity 插件这条路已经短到可以拿来回答一个随口冒出来的问题。
@DmitroCP [Claude Code]
https://x.com/DmitroCP/status/2099154771529846968
Boris Cherny 在 YC 讲 Anthropic 怎么做 Claude Code 的整理,方法比段子有用。每出一个新模型,他们就把系统提示词整个删掉,再一行一行加回来,当成消融实验做。旧提示词里大部分是在纠正模型本该具备却没有的行为,所以 80% 直接没了。有个没写进文档的开关 CLAUDE_CODE_SIMPLE=1,会剥掉所有系统提示词包括工具提示词,内部拿它当基线,他的发现是「去掉这些提示词之后,模型其实还聪明一点」。他给现场的指令是:每半年把你的 CLAUDE.md、Skills、hooks 全删一遍,看看模型自己能做成什么样。只有当它在同一个地方反复栽跟头,才把那条指令加回去。最硬的佐证:Claude Code 跑在 Bun 上,Bun 是 Zig 写的,一条提示词加人工引导加一个动态工作流,11 天把整个运行时用 Rust 重写了十万多行,现已上生产。
@DmitroCP [Claude Code]
https://x.com/DmitroCP/status/2099189212050526515
一份很好的配套材料:OpenAI 发文说了十条针对 GPT-6 Astra 该改的 Skill 和提示词写法,而每一条都是当年为了补上一代模型短板才立的规矩。Skill 的描述压成一句话、只说什么时候用,因为 Skill 一多长描述就会被截断。把多工作流的 Skill 改成一个指向子文档的路由。别再写菜谱式指令,因为过于具体的指导现在反而拖后腿。把 AGENTS.md 里「每次编辑前先读这三个文件」那句删掉。把「让它跑测试」的指令删掉,它自己会跑,你提醒反而导致过度测试。对你确知安全的流程直接给明确许可。重新审视那些为判断力更差的模型写的「先问我」措辞。把「完成」的定义提前说清楚。贯穿其中的那条线和 Cherny 说的一模一样:规则本身现在成了 bug。
@neil_xbt [Claude Code]
https://x.com/neil_xbt/status/2098986276737458633
本月那套刷屏的 Claude Code 配置带了 68 个子 agent、286 个 Skill、94 条命令,而作者自己的收尾话是「一次性全装是让事情变糟最快的办法」。结果大多数人就是一次性全装了,于是现在每一条消息在处理你真正的任务之前,都要先把整堆东西重读一遍。
@neil_xbt [Claude Code]
https://x.com/neil_xbt/status/2099139284746056103
后续才是能落地的部分:Claude Code 出了能回答「那 286 个 Skill 到底哪个有用」的工具。它拿真实提示词跑一遍你的 Skill,再把同样的提示词在移除该 Skill 的情况下跑一遍。两个分数,差值就是这个 Skill 实际干了什么。他把整套打法写出来了:怎么配、每个 Skill 必须有的三类用例、评分器搭配、留还是砍的对照表、CI 卡点。直接丢给 Claude Code,它能替你把用例写出来。
@MarMarLabs [Claude Code]
https://x.com/MarMarLabs/status/2099265249157468509
一篇认真做过实测的文章,讲 Claude Code 的 deny 规则到底是什么。Anthropic 自己的文档就写着:Read 和 Edit 的 deny 规则覆盖内建文件工具、覆盖 Bash 里它认识的文件命令,但不覆盖自己打开文件的任意子进程。他把最近两个版本正好在补这件事的过程记了下来:2.1.268 修了 deny 规则在经过符号链接目录时不生效、以及同一行里有 env -C 或 eval 时被跳过;2.1.269 修了 Edit deny 规则对 Bash tee 写入的文件不生效、以及 stream-json 输出里的 permission_denials 漏掉被路径规则拦下的 Read/Edit/Write 调用。他在两个版本上实测了 tee:2.1.268 上文件被覆盖、permission_denials 返回空,2.1.270 上被拦下并记录在案。他的判断是对的——没人把 deny 规则变成一堵墙,只是给检查器多教了一种「写入这个文件」的拼法。升到 2.1.270,deny 规则只用来挡检查器认识的拼法,真正需要边界的地方开沙箱。
@shubh19 [Claude Code]
https://x.com/shubh19/status/2099186312700219878
他把自己过去三个月的 AI 辅助 PR 审计了一遍,把数字公布了。150 多条 AI 建议是自动接受的。漏掉的内存泄漏和竞态条件 20 处。在递归重构上白烧掉 300 多美元。而所有质量变好的 PR,100% 都是他明确对 AI 说「不」的那些。他的诊断是:问题不是模型幻觉,是人的被动。
@itsGrizai [Claude Code]
https://x.com/itsGrizai/status/2099051766012694644
给客户站点干的九个小时 Claude Code,折算下来是 77 次 shell 执行、21 次读取、5 次写入。他冲着今天在 HN 上刷屏的那个私有仓库编码基准提了个好问题:通过率是错的指标,那前面那 98 次调用你怎么打分?
@0xZenad [Claude Code]
https://x.com/0xZenad/status/2099210883578638342
Spotify 说他们把 Claude Code 的 token 用量砍了 90%。有人把整套配置从头重建了一遍,量出了真实账单:进入昂贵模型的上下文少了 59.6%,总成本降 33.1%,整体慢了 65%,还有一个小任务反而贵了 2.6%。诀窍不是把所有东西都换成便宜模型,而是让昂贵模型不去读文件、不去写样板,调试、架构和真正的推理仍然留给前沿模型。少 90% 的 token,不等于便宜 90%。
@rlaope [Claude Code]
https://x.com/rlaope/status/2099085362085953725
一次做得很规范的提示词层基准测试。oh-my-hermes 给 Hermes 派生出的子 agent 前置一段校准文本,按「精确到型号 → 模型家族 → 通用规则」排序。跨 30 个完全相同的编码任务:不加校准平均 112007 token;加通用家族块降 24% 到 85498;但他们一直在用的那个针对具体型号的块却是 107161,比家族块还贵。罪魁是两句话——「在回复中包含验证输出」和「报告阻塞点并附上观察到的输出」——模型把它读成了「那就先生成那些输出」,工具调用从 434 涨到 462。删掉这两句、把「做最小的修改、验证一次、停下」这条核心规则加回去之后降到 77568,相比不校准降 31%,工具调用降 29%,API 轮次降 22%,输出 token 降 36%。通过率在 30 题里稳定持平在 15 左右,正好证明被砍掉的那些调用对结果毫无贡献。一句写坏的话值 25%。
@rapidmlx [Claude Code]
https://x.com/rapidmlx/status/2099164775855079512
对本地模型一个常见误解的纠正:一次只能处理一个请求并不是上限。在一台闲置的 M2 Pro mini 上跑 Qwen3.6-35B-A3B,解码吞吐从 4 路并发的 75.7 tok/s 涨到 8 路的 82.9 tok/s。负载翻倍反而更快,因为批处理把权重只读一次就供八路用。同一测试里 llama.cpp 掉 8%、Ollama 掉 10%。一台 Mac 同时伺候 Cursor、Claude Code 和你的脚本。
@_nodelay [OpenClaw]
https://x.com/_nodelay/status/2099145739662393658
一篇很扎实的本地推理实录。DeepSeek V4.1 Flash Vision 标称 1M 上下文,但两台 DGX Spark 能用的 KV cache 大概 2.5M,所以他给 agent 加了 256k 的软限制,稳定跑到 6 个会话;推到 8 个解码速度就开始掉。Qwen 3.8 Flash Next 的 KV cache 有约 4.2M,256k 下能舒服地开 16 个会话。全部机器用 Tailscale 串起来,全家稳定 30 tok/s:M2 Max Studio 做主力开发、M4 mini 跑 OpenClaw、ThinkPad 当管制中心、两台 DGX Spark 做推理机。真正开发还是用前沿 SOTA,但日常问答和各种连接现在两台推理机就解决了——而这只有靠本地、不靠订阅才成立。
@keisuke_yoshiha [Claude Code]
https://x.com/keisuke_yoshiha/status/2098958732143247588
AI agent 的产出速度超过了他的睡眠时间,于是他干脆把「管理」本身也做成层级并交出去。Director 用 Opus 做决策,每个项目的 Senior 用 Sonnet,下面的研究员用 Haiku。九个部门,每个部门一个 Senior 加两个研究员。他只跟 Director 对话。每天运营上限 5 美元,平时所有部门待机、被点名的才启动,看板上所有 agent 的状态和成本实时可见。决策绝对留给人:AI 提案,他批准,凡是要发到外面的东西都由他拍板。
@sns_ryuto05 [Claude Code]
https://x.com/sns_ryuto05/status/2099277785214947473
一个全自动账号的一个月记录。调研和发文全部托付给 Claude Code,名单做到 468 人。他说名单比预期小是因为选的不是赚钱类赛道,但预计 note 上线能做到 80 万日元。现在 15 个账号全自动满负荷跑,月内计划到 30 个。
@brainextends [Claude Code]
https://x.com/brainextends/status/2099238343074832810
他用 TikTok 图集把自己的 App 做到 1 万美元 MRR,并把机制写了出来。先买三台全新 iPhone 11 配美国代理,一台一个账号养了三天;同时在 Pinterest 上按每种版式建参考素材库。然后用 Claude Code 加一个图像 API 从这些参考里批量生成大量原创变体。第四天开始发:三个图集,第一天 160 万播放——因为 TikTok 会给你有史以来第一个图集额外加权。其中一条最终到了 500 万。第 28 天做到 1 万 MRR。再往上就是分发问题了,于是他开了创作者招募,度假回来发现已经有 2000 个账号在自发推他的模板。
@AaronxShepherd [Claude Code]
https://x.com/AaronxShepherd/status/2098924981413458135
他把冷邮件团队原来手工做的六件事,变成了六条 Claude Code 提示词:建名单、给 ICP 打分、解析回复等等。真正有教学意义的是他的打包方式,因为那就是一次像样的交接该长的样子:一件事一条提示词、变量位置都标好,六份示例输出让你先知道什么叫好,要改的槽位单独点出来,一条先检查你环境配置的快速启动提示词,再加一份把六条串起来连跑的手册。
@MichLieben [Claude Code]
https://x.com/MichLieben/status/2099250347063886180
一篇冷外呼的数据层写法,Claude Code 负责路由。他的核心论断跑在一百多万封邮件上测过:500 人的精准小名单回复率 20-30%,10 万人的群发 2-3%。但小名单只有每一行都对才成立,所以他列了十二家数据商和各自的使用规则。打开任何工具之前先把 ICP 写下来,先拉 50 行人工核对,合格率不到七成就收紧条件重跑。补全走瀑布流,一拿到验证过的邮箱或手机就停。verified、risky、unknown 要分成三种状态,unknown 绝不进入在跑的序列。融资只算最近 2-4 周、职位变动算 14-45 天、招聘算 1-2 周,同时命中三个信号的当天就要有人过一遍。每一条事实都把来源 URL 和抓取日期存下来。
@x_insider4 [Claude Code]
https://x.com/x_insider4/status/2099168957152301266
一个用 Claude Code 做的纳指期货机器人,正在实盘跑单张合约,浮盈大约 +900 美元。系统实时盯 NQU6,读订单簿、追踪流动性,按既定形态执行,而不是去预测每一根 K 线。NQ 每点每合约 20 美元,所以单合约大约 45 个点就是那 900。他很明确地说设计原则是「等」而不是「追」:把逻辑定死,让机器人等条件、执行、管仓位。
@ff14_Ninjachan [Claude Code]
https://x.com/ff14_Ninjachan/status/2098974890464514396
小而具体。Claude Code 自己跑了 ping 测量、检查了网络设置,定位到原因,然后把 WARP 的安装和连接从头到尾做完。非编码,而且正好是那类一堆人嚷嚷「找不到用处」的任务形状。
@___35d [Claude Code]
https://x.com/___35d/status/2099000882449022987
他在扩展自己一直在用的 Notion Inbox 数据库。给任务打上 AI 标记,把想让它干的活写在任务页里,Claude Code 读取这段描述,恰当地拆解成子任务,需要时向人请示,然后把活推进下去。他现在的项目就是把支撑这个世界观的环境搭起来。
@gdvonly [Claude Code]
https://x.com/gdvonly/status/2099036175319068781
一条基本不长 AI 样子的播客流水线。他只负责说话,原始录音丢给 Claude Code 剪辑加自动投稿,再过 Pody 转写成文章,然后分发到 note 等 SEO 强的平台。他的落点是:现在连随口的输出也能扎实地留在世界上。
@kanakogi [Claude Code]
https://x.com/kanakogi/status/2098938745605255507
他发布了一个叫 Agent Critters 的 Mac 应用:桌面上一个小伙伴,用动作表示 Claude Code 和 Codex 的会话状态——作业中、等待批准、已完成。点一下就跳到那个会话的终端。这是今天这批里第二个环境状态类工具。
@Alacritic_Super [Claude Code]
https://x.com/Alacritic_Super/status/2098954173517799904
同一个需求的硬件版。有人用 M5Stack 做了个自定义硬件监视器,实时追踪 Claude Code 和 Codex 的 API 额度,通过 Tailscale 连接,显示使用百分比和距离额度重置的精确倒计时。把追踪从显示器上挪走,也就消除了写到一半被掐断的惊吓。
@funny_man_daa [Claude Code]
https://x.com/funny_man_daa/status/2099136741563302037
第三个。Agent Tile 1.0.10:他之前把 18 个 Claude Code 和 Codex 会话摆在一个屏幕上——1 个指挥塔加 17 个作业——结果完全收不住,于是加了标签页分板。All 18、Admin 3、1st 10、2nd 5。切标签只是把其他板块藏起来,背后的 agent 照跑不误。
@lwastuargo [Claude Code]
https://x.com/lwastuargo/status/2098992915808678070
一个跑大量 agent 的人的精简作业配置。用一个代码库存放所有上下文,这也是他不用 Cowork 的原因。每个代码库里放一份 TECHNICAL.html,人和 agent 读起来都舒服。用 LLM 网关或多路复用器来管理多个账号和模型。还有一条值得抄:把开发用的模型和运营用的模型分开。开发用贵的,所以他手上有 13 个 Codex 和 17 个 Claude Code 账号;运营用便宜的。另外配一个每 5 小时触发一次、清理代码库、配置、feature flag 和文档的 agent 或脚本。
@sgw_R_ [Claude Code]
https://x.com/sgw_R_/status/2099260252302844299
Claude Code 和 Codex 写出来的日语读着别扭,用 Gemini 3.8 Flash 改会好很多,但不加约束直接丢过去,它会悄悄改掉数字和专有名词。所以他每次都附同一组约束:意图、内容和事实一概不许改;数值、金额、专有名词、URL、代码内容一个字都不许碰;H1 和小标题不许动,因为 SEO 会死;断定句和体言止是故意写的,不许改成敬体。之后再跑脚本比对 URL、数值和标题有没有变。他的理由很准确:靠肉眼看不出来——金额差一个数量级,读起来照样通顺。
@kaorika_orika [Claude Code]
https://x.com/kaorika_orika/status/2099085774738407530
一条 LINE 动态贴图的流水线,第一次测试,分工很干净:画是手绘的,动画走 fal 上的 Seedance 2.5,整个作业在 Claude Code 里用 Opus 5 编排。
@OrganoidsAI [Claude Code]
https://x.com/OrganoidsAI/status/2099137632986915208
一支从头到尾跑在本地和混合工具链上的音乐视频:视频用 RTX 3090 上的 Minimax H3 生成,工作流由 Claude Code 配 Sonnet 5 串起来,另做超分,音频来自 Suno v6。
@0xMfox [Claude Code]
https://x.com/0xMfox/status/2099148359684546667
他去年给客户报过一个四位数的产品视频,后来在 GitHub 上一个 agent skill 里找到了同样的结果。它根本不是 AI 视频生成,而是给 Claude Code 和 Codex 用的、会写真 Remotion 代码的 Skill,所以宣传片是在 React 里一个镜头一个镜头搭出来的。他解释为什么这点重要,是最好的一段:画帧的模型会忘掉你三秒前的 logo 长什么样,而代码什么都不会忘,因为没有东西被重画,一切都是从同一个组件渲染出来的。它自带 150 多张预制镜头卡,每张都是一个有名字、时长和缓动都调好的运镜;还有一个完整的 36 秒宣传片模板,十个镜头、转场和声音齐活。他的建议:先从成品模板起步,用镜头卡的名字而不是描述运镜,动代码之前先渲一版粗剪,以及在给任何人看之前把模板自带的占位截图换掉。
@KeisukeIshikawa [Claude Code]
https://x.com/KeisukeIshikawa/status/2099159091838845334
同一个套路的更大规模版。video-shotcraft 给编码 agent 一套真正的动效设计工作流:分镜、抓取真实产品界面、做动效、把剪辑点卡到音乐上、用 Remotion 渲染。素材库是 157 张镜头配方、214 种视觉风格(都有渲染预览)、16 个类别共 149 个音效,外加可复用的 Remotion 组件和一个验证过的 36.2 秒、十镜头模板。每张配方都写明这个镜头干什么用、情绪和时长、实现参数、以及已知坑,所以 agent 是在组合序列,而不是每次都现编动画。用真实截图而不是幻觉出来的 UI,是这里最关键的区别。
@GoSailGlobal [Claude Code]
https://x.com/GoSailGlobal/status/2098939757346918526
做视频之前的那一步:先学会拆别人的片。reelbench-skills 上线两天 196 星,两个 Skill。video-shots 拉片:把一条成片拆成逐镜头分析表,时长、景别、运镜、画面描述全在一张表里;切点和时长由 ffmpeg 量出来,模型只判断该它判断的四件事,过 14 道质量门逐条对账。video-sync 合成:画面一边、分镜信息一边,镜头一切信息跟着切,横版竖版各一套布局。最妙的细节是拉片报告是个单文件交互页,内嵌播放器,播放时同步高亮当前镜头,点镜头就跳,离线双击就能开。零 npm 依赖,只要 node 和 ffmpeg。
@GYLQ520 [Claude Code]
https://x.com/GYLQ520/status/2099119217715089709
一个给 Seedance 2.0 写提示词的 Skill,存在的理由是模型很严格而人爱写作文。它教 agent 按官方手册来:Image1 当首帧、Video1 抄运镜、Audio1 卡节奏。它强制执行的硬限制:图片最多 9 张、视频最多 3 段、文件总共不超过 12 个,超了模型就不认。广告、短剧、MV、科普都有现成结构,中英两份。
@bkdgiffug [Claude Code]
https://x.com/bkdgiffug/status/2099109337709088878
一个针对大家共同吐槽点的图表 Skill:AI 画的架构图永远是一堆圆角方块,像 PPT 模板。Diagram Design 给 Claude Code 和 Codex 生成 HTML 加 SVG,覆盖架构图、流程图、时序图、ER 图等 27 种类型。值得抄的功能是:丢一个网站 URL 给它,它会提取品牌字体和配色,让所有图表风格统一。支持亮色、暗色和可编辑版本,浏览器直接打开。
@Huahuazo [Claude Code]
https://x.com/Huahuazo/status/2099217801957593383
高德开源的一个 harness,专治 AI 干长活半途跑偏。LongHorizon-Harness 把工作编成一个三人小班组:一位只管调度、只琢磨下一步做什么;一位只管执行、每回都从干净上下文重新开工;一位只做验收,不听说辞,直接翻文件、查日志、跑测试,对得上才认、对不上就打回。模型不换、工具不换,只加这层壳:跨软件折腾一两小时的任务完成率从五成升到八成,命令行和写代码的活也更稳,token 还省 24%。能接 Claude Code、Codex CLI 和 OpenCode,调度、执行、验收三个角色还能各配各的模型。
@NFTCPS [Claude Code]
https://x.com/NFTCPS/status/2098961144748904688
给「新入职被甩了 20 万行代码」那天准备的工具。Understand Anything 用多个 agent 把整个项目扫一遍,把每个文件、函数、类、依赖变成一张能点能搜的知识图谱,还带可视化面板。他最看重的两点:改代码前先算影响范围;以及能直接问「哪部分管登录」,语义搜索给你捞出来。Claude Code、Cursor、Codex、Copilot 基本都能接。
@claudecode84 [Claude Code]
https://x.com/claudecode84/status/2099057843035111552
今天在好几个地方都看到的一个说法:给 Claude Code 一张项目地图,精度 +12 点、检索次数减少约 50%、成本降 42%、作业时间缩短 60%,不用额外付费、不用换模型。具体数字姑且不论,背后的推理是站得住的,值得关注。大仓库上 agent 每次会话都要从零重新探索代码库,就像每天早上把新人从火车站开始领到公司。不如一开始就给它地图和分工表。工具叫 Graft,免费开源。
@0xZenad [Claude Code]
https://x.com/0xZenad/status/2099230255550755239
同一论点的上下文成本版本,带两个基准。Public Browser 让 Claude Code 驱动你真实的 Chrome 配置,同样通过率下,会话 token 少 30%、成本低 25%、工具调用少 41%、快 40%,都是相对 Playwright MCP。LeanCTX 把一次模拟的 30 分钟编码会话从 471.6K token 压到 77.6K,1.179 美元压到 0.194。他的结论:额度问题往往先是上下文问题,才轮到模型问题。
@iamrexei [Claude Code]
https://x.com/iamrexei/status/2099149506084258296
给所有人都在搭的那个「私人贾维斯」配的安全架构。他的论点是:一个 memory 文件夹加一句「小心点」并不能让它可靠,因为一旦它开始记住客户、打开浏览器、调用工具,一个错误就能持续好几周。他给的栈是:Mem0 做长期记忆层,检索相关事实而不是整段聊天历史;E2B Desktop 让 computer use 发生在隔离的 Linux 桌面里而不是你真实的机器上;AgentOps 做运行和成本追踪,这样打转的循环或调错的工具当场就能看见,而不是第二天早上在日志里翻。然后是外部动作前的人工批准。他的免责说得很诚实:记忆里可能存着错误的事实,沙箱保护不了一个你已经登录的账号,日志里可能有客户数据。
@0xrootRE [Claude Code]
https://x.com/0xrootRE/status/2099012954297614562
同一直觉的极简版:CC-Monitor,监控并审计 Claude Code 在你电脑上的每一个动作。
@hirataro_89 [Claude Code]
https://x.com/hirataro_89/status/2098964023882682665
一个 Shopify 构建 Skill 被一条明确的循环推着改进:真刀真枪跑一遍,行为有问题就开 issue,照着 issue 改 Skill,再跑一遍。他管这叫永久改进机关,然后马上点出了大多数人会跳过的那一步:删掉没用的部分是必须的,因为只加不减最后会变成一只丑陋的合成兽。这个道理远不止适用于 AI。
@takekeepvision [Claude Code]
https://x.com/takekeepvision/status/2098970057493860504
一位用 Claude Code 自建了 AI 写作工具、同时对接 WordPress、Ameblo 和 note 的人的直白纠正。同一个工具,结果天差地别,差的不是工具,是你把产出放在哪里。放在域名权重强的站上,他做到过月入 100 万日元——前提是那个域名本来就强。同样的文章放在没养起来的域名上什么都不会发生,因为搜索带不来人。所以新手的顺序是定死的:先去读者本来就在流动的地方,在那里拿到第一笔收入;把同样的素材放到 note,搜索和读者两头都进得来;同时并行养 WordPress 域名,等它起效时同样的文章就变成资产。一次调研、三个去处,调研成本并不增加。他还说自己一天能写 15 篇,但 15 篇就糙了——一旦「数量」变成目的,博客就不涨了。
@ai_deka_airi [Claude Code]
https://x.com/ai_deka_airi/status/2098984073150730521
一次审慎的拆解——或者说是拒绝拆解——针对「用 Claude Code 一个月 2211 万日元」那条。他把整篇文章读完了。结论:没有材料能把它一口咬定为假。发帖人放了销售额和转账截图,明确把数字说成「销售额」而不是利润,还写清了「AI 赚的不是钱,是我写文章的时间」。真实结构是:用 Claude Code 自动化了 42 项定型作业,人专注写 X 长文,长文导流到开放聊天室,卖自己原有的商品。他甚至写了一次自动处理停摆 12 小时、数据出现缺口的失败。真正没被回答的问题问得很对:用 Claude Code 之前,月销售额是多少?如果本来就已经两千万,这个数字的含义和原来只有三百万时完全不同。
🗣 用户心声
用户心声
先删指令,再谈加指令。今天技术含量最高的一条判断是:大部分提示词工程现在已经是死重量,补的是模型早就不缺的那块。@DmitroCP 转述 Boris Cherny:Anthropic 每出一代模型就把整个系统提示词删掉、再一行行加回来,80% 从此没再回来。@neil_xbt 说的是同一件事的实操版:那套刷屏的 286 个 Skill 配置意味着每条消息都要先把整堆东西重读一遍,而新出的 plugin eval 终于能量出哪些 Skill 配得上这个位置。
大家想在发出去之前就知道一个任务要花多少钱,而不是事后。@0xZenad 重建了 Spotify 的「省 90% token」,量出来是成本降 33%、速度慢 65%。@rlaope 跑了 30 个完全相同的任务,把 25% 的成本波动追到两句话上。@itsGrizai 想知道那 5 次写入之前的 98 次工具调用该怎么打分。共同的抱怨是:通过率和 token 数,两个都是错的指标。
agent 能动手,但不会怀疑。@nian_tu41685 被 Claude Code 直接告知硬件跑不了 FP4,他不认,最后在六年前的显卡上把吞吐做到 DeepSeek 官方 API 的三倍多。@shubh19 审计了自己三个月的 AI 辅助 PR,发现质量变好的 100% 都是他说了「不」的那些。两条落在同一个点上:模型产出的是「看起来对」的东西,而它没有质疑自身前提的机制。
权限才是大家真正在要的功能,而且他们一次次发现边界比看上去软。@MarMarLabs 拿 Bash tee 去撞 deny 规则,一个版本被穿透、下一个版本挡住了,结论是这条规则是一份「拼法清单」而不是一堵墙。@balakhonoff 因为泄露的 key 亏过钱,干脆做了个代理,让任何 agent 都看不到 key。@levelsio 发现自己的 key 在被花掉之前已经被人捂了好几个月。@iamrexei 希望沙箱、追踪和审批闸门直接成为私人 agent 的默认形状。
呼声最高的缺失产品,是一个能看见自己 agent 在干什么的地方。@kanakogi 做了个显示会话状态的桌面小伙伴,@Alacritic_Super 用 M5Stack 经 Tailscale 盯额度,@funny_man_daa 把 18 个会话摆上一个屏幕之后不得不加标签页分板,@keisuke_yoshiha 干脆搭了一整张带实时成本看板的层级组织图——因为瓶颈已经变成他自己的管理带宽。
先删指令,再谈加指令。今天技术含量最高的一条判断是:大部分提示词工程现在已经是死重量,补的是模型早就不缺的那块。@DmitroCP 转述 Boris Cherny:Anthropic 每出一代模型就把整个系统提示词删掉、再一行行加回来,80% 从此没再回来。@neil_xbt 说的是同一件事的实操版:那套刷屏的 286 个 Skill 配置意味着每条消息都要先把整堆东西重读一遍,而新出的 plugin eval 终于能量出哪些 Skill 配得上这个位置。
大家想在发出去之前就知道一个任务要花多少钱,而不是事后。@0xZenad 重建了 Spotify 的「省 90% token」,量出来是成本降 33%、速度慢 65%。@rlaope 跑了 30 个完全相同的任务,把 25% 的成本波动追到两句话上。@itsGrizai 想知道那 5 次写入之前的 98 次工具调用该怎么打分。共同的抱怨是:通过率和 token 数,两个都是错的指标。
agent 能动手,但不会怀疑。@nian_tu41685 被 Claude Code 直接告知硬件跑不了 FP4,他不认,最后在六年前的显卡上把吞吐做到 DeepSeek 官方 API 的三倍多。@shubh19 审计了自己三个月的 AI 辅助 PR,发现质量变好的 100% 都是他说了「不」的那些。两条落在同一个点上:模型产出的是「看起来对」的东西,而它没有质疑自身前提的机制。
权限才是大家真正在要的功能,而且他们一次次发现边界比看上去软。@MarMarLabs 拿 Bash tee 去撞 deny 规则,一个版本被穿透、下一个版本挡住了,结论是这条规则是一份「拼法清单」而不是一堵墙。@balakhonoff 因为泄露的 key 亏过钱,干脆做了个代理,让任何 agent 都看不到 key。@levelsio 发现自己的 key 在被花掉之前已经被人捂了好几个月。@iamrexei 希望沙箱、追踪和审批闸门直接成为私人 agent 的默认形状。
呼声最高的缺失产品,是一个能看见自己 agent 在干什么的地方。@kanakogi 做了个显示会话状态的桌面小伙伴,@Alacritic_Super 用 M5Stack 经 Tailscale 盯额度,@funny_man_daa 把 18 个会话摆上一个屏幕之后不得不加标签页分板,@keisuke_yoshiha 干脆搭了一整张带实时成本看板的层级组织图——因为瓶颈已经变成他自己的管理带宽。
📡 生态产品雷达
生态产品雷达
Codex — 129 条提及。默认的第二意见。今天的主流模式不是二选一,而是分角色:Codex 执行、Claude Code 复核,或者反过来。
OpenClaw — 144 条。一半是在上面跑车队的人,一半是已经迁到 Hermes 的人。今天出现两起独立的 API key 泄露报告。
Cursor — 48 条。几乎每一份技术栈描述里都有,但很少成为主角。
Hermes Agent — 44 条。离开 OpenClaw 的人最常见的去处,被反复提到的是稳定性和会自我改进的 Skill。
MCP — 38 条。现在被当作既定基础设施,而不是一个功能点。
DeepSeek V4.1 Flash — 22 条。本周的价格故事,同时以免费 API 层和本地推理目标两种身份出现。
Meta Muse — 18 条。被反复指出直接沿用了 OpenClaw 的 SOUL / IDENTITY markdown 命名方式。
Unity — 17 条,由新发布的 Claude Code 官方插件带动。
Grok Bot — 16 条。大多出现在技术栈对比里的第三选项位置。
fal / Seedance 2.5 — 14 条。今天绝大多数创作流水线里的视频层。
OpenCode — 13 条。谈到可移植性时大家会点名的开源 harness。
Antigravity — 9 条,并附带警告:通过 Claude Code 或 OpenClaw 这类第三方访问属于违反服务条款。
Omarchy — 8 条,越来越多地成为大家跑 agent 的那台机器。
Instinct — 8 条,被反复描述为「给普通人用的 OpenClaw」。
Tailscale — 6 条。每一套跨机器 agent 配置里的连接组织。
Codex — 129 条提及。默认的第二意见。今天的主流模式不是二选一,而是分角色:Codex 执行、Claude Code 复核,或者反过来。
OpenClaw — 144 条。一半是在上面跑车队的人,一半是已经迁到 Hermes 的人。今天出现两起独立的 API key 泄露报告。
Cursor — 48 条。几乎每一份技术栈描述里都有,但很少成为主角。
Hermes Agent — 44 条。离开 OpenClaw 的人最常见的去处,被反复提到的是稳定性和会自我改进的 Skill。
MCP — 38 条。现在被当作既定基础设施,而不是一个功能点。
DeepSeek V4.1 Flash — 22 条。本周的价格故事,同时以免费 API 层和本地推理目标两种身份出现。
Meta Muse — 18 条。被反复指出直接沿用了 OpenClaw 的 SOUL / IDENTITY markdown 命名方式。
Unity — 17 条,由新发布的 Claude Code 官方插件带动。
Grok Bot — 16 条。大多出现在技术栈对比里的第三选项位置。
fal / Seedance 2.5 — 14 条。今天绝大多数创作流水线里的视频层。
OpenCode — 13 条。谈到可移植性时大家会点名的开源 harness。
Antigravity — 9 条,并附带警告:通过 Claude Code 或 OpenClaw 这类第三方访问属于违反服务条款。
Omarchy — 8 条,越来越多地成为大家跑 agent 的那台机器。
Instinct — 8 条,被反复描述为「给普通人用的 OpenClaw」。
Tailscale — 6 条。每一套跨机器 agent 配置里的连接组织。
评论