2026年10月10日super-user

超级用户日报: 2026-10-10

周三的 Claude Code 信息流里有两条新闻在争头条,巧的是都在讲「谁能读到 agent 的文件」。CrowdStrike 把韩国银行被黑一事追到一个操作者身上,对方暴露在公网的服务器里躺着 CLAUDE.md、记忆文件和完整的 Claude Code 会话记录,这既说明 agent 的工作身份就是几份明文文件,也是把 ~/.claude 目录从任何公开机器上拿掉的理由。另一边,一波几乎一字不差的帖子在推 Alook,一个让 Claude Code、Codex、Cursor 各自拿到 @ 名和收件箱的 Discord 式房间,这波里真正的用户只有几位,讲的是六个 agent 的交易台和一位交易员把自己的 Claude Code agent 从终端挪进群聊。噪音之下真正有用的是测量:Haiku 5.5 修 24 个 bug 全中、成本只有 Sonnet 的七分之一;十套编排配置的对照测试里单个 Opus 在质量上压过所有团队;一个用量 mod 发现改一个 autocompact 参数就能省 30%;一条逐项拆穿「Anthropic 官方技巧」病毒模板的核查;以及 Fable 在 Claude Code 里按时完成任务的比例只有 4%。非编码用途继续扩张:公开 TESS 数据里的行星候选、荷兰的降雨预测模型、每 30 分钟巡一次的 Google 评论回复、Radiohead 的歌单整理、13 个语言的 App Store 截图,还有一个基于 Bitwarden 协议、模型永远看不到卡号也能填支付卡的保险库。OpenClaw 用户声音小但很具体:只读接上银行账户、在手机上标注卫星图、40 分钟散步换一周内容,以及一台团队服务器上把客服会话从一位工程师的 agent 交给另一位的 agent。
@AndrewWarner [Claude Code]
Claude Code#1
https://x.com/AndrewWarner/status/2108236955188068385
AndrewWarner 的那篇把 Claude 和 ChatGPT 订阅接进 Grok Bot 的教程被 Elon Musk 转发后,收到了五个反复出现的问题,这条帖子一次回答完。不需要 API key,也不用新订阅:给 bot 发一句话,它在自己的电脑上开终端、装好 Claude Code 和 Codex,然后让你登录一次。bot 和 Mac 同时用这两个订阅,没有被踢出登录。费这个劲的理由是口味:Claude 写出来的东西更接近作者自己的腔调,而有些项目只有在特定模型上才做得对。
@0x0SojalSec [Claude Code]
Claude Code#2
https://x.com/0x0SojalSec/status/2108298017204060550
0x0SojalSec 把这几天的「用 Claude Code 发现行星」故事浓缩成几个关键数字:一位研究者让 Claude Code 跑 NASA 公开的 TESS 档案,标出一处没人报告过的亮度下降,候选天体约为地球 1.4 倍大,距离 116 光年,每 3.18 天遮一次恒星。同一处下降在 2018、2020 和 2025 年的观测里都出现过,TESS 的后续观测时间刚获批。目前仍是候选,不是确认的行星。帖子的框架抓得准:光子是望远镜几年前就收下的,agent 只是在一直躺在那里的数据里找到了规律。
@igus_ai [Claude Code]
Claude Code#3
https://x.com/igus_ai/status/2108248430682247349
igus_ai 把一台电脑改成了不睡觉的交易台:六个有名字的 agent 在一个 Alook 群里,一夜 46 笔交易,自报盈利 4,955 美元。ATLAS 盯大钱包,VEGA 在 X 上找叙事起飞的信号,ORION 搭论点、定仓位,TITAN 和 LUNA 执行,NOVA 在任何动作之前检查合约、流动性和限额。Claude Code 负责思考,Codex 负责执行,Grok Build 负责监控。出场和止损整夜自己跑,但每一笔进场都亮着红灯挂在那里,等人早上读完整段对话、发一条消息批准才动。
@VaibhavSisinty [Claude Code]
Claude Code#4
https://x.com/VaibhavSisinty/status/2108103450995417177
VaibhavSisinty 转述了 Reddit 上的 LG 电视故事:有人受不了 Plex 应用要加载 30 秒,直接把电视逆向了,用 Claude Code、Opus 和 Fable 从零写了一个原生 Plex 客户端。项目从 C 起步,中途换成 Rust,最后顺手造出了自己的 OpenGL 界面框架。同一台电视、同样的硬件,个人资料选择页现在 3 秒加载,60 帧运行,支持 4K、杜比视界和全景声,全部开源。固件逆向、媒体播放、GPU 性能分析、着色器优化,过去要一个团队的活一个人干完了。
@rewind02 [Claude Code]
Claude Code#5
https://x.com/rewind02/status/2108195576206488058
rewind02 给了一份七步做游戏的配方:Opus 5.5 在一个 Claude Code 会话里同时指挥 Blender、Unreal Engine 5 和 Meshy。Blender 通过它的 MCP 插件接入,Meshy 用自己的 MCP 加 API key;先让 Opus 头脑风暴五个点子,告诉它你的显卡型号好让画面推到机器能跑的极限,Meshy 生成道具和角色,Opus 导进 Blender 清理,再在 Unreal 里搭关卡、光照、HUD 和小地图,之后每个提示词只加一个功能。最有用的是成本那一行:第一个完整版本大约四小时,吃掉一周 Max 额度的 19% 左右,后面的关卡因为素材已经在手会快很多。
@milesdeutscher [Claude Code]
Claude Code#6
https://x.com/milesdeutscher/status/2108079450927833334
milesdeutscher 用 Claude Code 搭了个回测引擎,并且主张每个交易者都该这么做:用大白话描述策略的进场、出场、止损和仓位,让 Claude 把手续费和滑点算进去,然后要胜率、最大回撤和每笔平均盈亏比,最后再要一个可视化面板。作者说找到了好几个回报 100% 到 300% 的策略,这种数字回测里常见、实盘里罕见。结尾那条建议最靠谱:把生成的代码导进 TradingView,用第二个引擎复核 Claude 的结果。
@dotey [Claude Code]
Claude Code#7
https://x.com/dotey/status/2108072320317145306
dotey 在用掉一次 Claude Code 送的重置之后,趁 Fable 变得耐用,摸出一套用法:把任务发给 Fable,让它安排 Opus 子代理去执行,自己负责分析、编排和验收。因为 Fable 大部分时间都在等子代理,它还能持续接新活,于是几个会话一直开着,想到什么就扔一条指令过去,它记着、空闲时再排上。作者的比喻是 Fable 像个 Tech Lead,专门派活和验收。设置上去掉了 1M 上下文限制,autocompact 定在 300K。代价是比只用 Opus 5.5 贵不少。
@Steve_Yegge [Claude Code]
Claude Code#8
https://x.com/Steve_Yegge/status/2108226541955985485
Steve_Yegge 声明和 Rex 没有任何关系,然后说它会吞掉全世界,因为它解决了作者自己都已经麻木的痛:20 多个 Claude Code 会话套在 tmux 里、tmux 套在 emacs 里、再套 mosh、再套 ghostty,五层终端模拟器,从酒店笔记本或手机上用,复制粘贴、滚动、重绘、延迟全是坏的。同一套栈放进 Rex alpha,在酒店房间里用起来像本地一样顺滑。对有同样一堆会话的人来说值得记的细节是:Rex 让 Claude Code 在 48 小时内支持了一个终端状态协议,同一天 mitchellh 的帖子就是在庆祝这件事。
@koumei_ai5566 [Claude Code]
Claude Code#9
https://x.com/koumei_ai5566/status/2108319598735130977
koumei_ai5566 在 Claude Motion 上线当天做了个对照:同一篇解说文章用两种方式做成视频。老路是 Claude Code 加免费的 HyperFrames,Claude 干活约 30 分钟,带旁白,需要在电脑上操作。新路是 Motion,约 10 分钟,把台本贴进聊天框就行,这次没要声音所以没有旁白和背景音乐。成品水平差不多。作者的总结是,一个五十岁上下的人现在不用拼工具也能做视频,门槛从操作软件挪到了写文字。Motion 目前是 Team 和 Enterprise 的测试功能。
@AlexFinn [Claude Code]
Claude Code#10
https://x.com/AlexFinn/status/2108319537116725426
AlexFinn 分享了两条在 Grok Bot、Hark、Dots 和 Claude Code 之间通用、给一天收头和开头的提示词。晚上在任何正在做的项目里发:我要睡了,有什么大事你可以趁我睡觉开始做。作者在一个游戏项目里这样用,每天早上醒来都有一个新功能。早上在主助理里发:我刚醒,列一张我们现在就能做的决定清单,把球往前推;agent 会翻日历、邮件和各种插件,返回一组带选项的决定等批准。重点不只是效率,而是盲区:agent 会提出人自己想不到去要的活。
@wolfyxbt [Claude Code]
Claude Code#11
https://x.com/wolfyxbt/status/2108139133403312467
wolfyxbt 解决了一个币圈投研的老问题,还没花 X API 的钱:Codex 和 Claude Code 读不了 X,第三方 API 又贵又麻烦,于是作者让它们在需要 X 信息的时候自己去调 Grok Build,也就是 Grok 的命令行版本。Grok Build 是作者本来就订的 X Premium+ 里附带的,大多数订阅者根本不知道这份免费额度。中间的粘合剂是一个小 skill,告诉编码 agent 什么时候该转手问 Grok Build、怎么问;作者把自己写的那个叫 groking 的发了出来,懒得写的可以直接用。
@gee0awa [Claude Code]
Claude Code#12
https://x.com/gee0awa/status/2108019431242879345
gee0awa 从本地的 Claude Code 会话里调用 AWS Lambda MicroVM,一次拉起多台隔离虚拟机,并行跑编码、做视频和作曲。电脑是一台 MacBook Air,却一直凉着,因为活都不在它身上跑;帖子里附的那段视频就是在其中一台虚拟机里做出来的。这是同一个趋势的小注脚:本地机器变成控制台,agent 真正干活的地方挪到用完即弃的云端沙箱。
@rohit3a [Claude Code]
Claude Code#13
https://x.com/rohit3a/status/2108279002926596236
rohit3a 做了一个 Claude Code mod,把用量额度精确到美元和百分比来追踪,然后用一个月的数据报了四条发现:把 /autocompact 设到 400K 能省最多 30% 的用量;Sonnet 5.5 按旧价格几乎没比 Opus 5.5 省什么,不值得切;订阅用户在 Sonnet 5.5 上没有拿到完整的缓存读取折扣;以及作者 30 天烧掉了约 7,000 美元的 Claude token。第一条对任何 Max 用户都能立刻用上,第三条恰好撞上 Anthropic 同一天宣布 Sonnet 缓存读取价格减半但只限 API。
@notjazii [Claude Code]
Claude Code#14
https://x.com/notjazii/status/2108175149036159303
notjazii 给 Haiku 5.5 和 DeepSeek v4.1 flash 同一个做游戏的提示词,各开到能开的最高推理档。Haiku 通过 Claude Code 跑了 90 分钟、花 3.4 美元;v4.1 flash 通过 aihubmix 的 API 跑了 50 分钟、花 0.67 美元。Haiku 第一次因为 Claude Code 的一个 bug 没做出游戏,第二次光思考就超过 30 分钟。帖子结尾作者是真的拿不准哪个更好,这比大多数发布日的对比诚实。
@IHayato [Claude Code]
Claude Code#15
https://x.com/IHayato/status/2108066848121962689
IHayato 发布了 SENRI,一款致敬 STEPN 但零门槛开始的走路游戏,iPhone 和 Android 都能玩:每天的步数会点亮夜间参道两侧的灯笼,一千步算一里,每个月孵出一只小「お供」陪着走、越走越大,用走路挣的小判编草鞋可以提高每天计步上限。从健康数据只读步数和距离,不读位置,也不用注册。制作说明里写,开发几乎全靠 Claude Code,9 月中旬起在 TestFlight 测试,到上线时 build 号已经到 164。
@masahirochaen [Claude Code]
Claude Code#16
https://x.com/masahirochaen/status/2108165064364884360
masahirochaen 用 Claude Code 的 ultracode 模式配 Opus 5.5 剪了一支约 40 分钟的纪录片风格视频,结论是电视台级别的剪辑一两年内就能做到。帖子很短,但片长本身就是重点:大多数 agent 做视频的演示都在一分钟以内,这一条是在同一个工具里处理完的长片。
@nagiko726 [Claude Code]
Claude Code#17
https://x.com/nagiko726/status/2108037338383171784
nagiko726 既不是设计师也不是工程师,这次把个人作品集网站翻新了:自己在 Figma 里排版,实现交给 Claude Code 和 Codex,全程只有一个人。能跑的版本只用了 30 分钟,剩下的时间花在让两个 agent 互相审代码,以及调外观、细节行为和后台的好用程度。CMS 选了 EmDash,因为它一开始就是为对接 AI agent 设计的。作者说得很清楚,这套做法放到有质量、安全和运维要求的客户项目上行不通,所以个人项目才是试新东西的地方。
@kenshinji [Claude Code]
Claude Code#18
https://x.com/kenshinji/status/2107999451801653349
kenshinji 给 Starter Story 最新一期算了笔账:一个几乎没有开发经验的人用 Claude Code 花六个月做了个举铁 App,自称最近 28 天收入接近 1.4 万美元。收的是 24.99 美元一次性年费,所以这是 28 天收到的现金而不是月度经常性收入,本人也承认折成月的 MRR 很低。每天投 250 美元广告,差不多吃掉一半现金,App 里的 AI 教练每年还有一笔视频里没提的成本。还没有任何一批用户走到续费那天。作者的判断:现在是新用户预付的年费在养广告,做出 App 是容易的部分,一个年费 25 美元的产品每天花 250 美元获客才是真正的问题。
@aakashgupta [Claude Code]
Claude Code#19
https://x.com/aakashgupta/status/2108234472009449620
aakashgupta 在 Claude Code 里搭了一套求职系统,目标是申请得更少而不是更多:一个文件夹里全是 skill。/job-fit-scorer 把目标公司的新职位按个人档案打分排序,/resume-tailor 只用真实经历重写每一份简历,/referral-request 在投递前先写好请人内推的话,/interview-prep 找出这家公司真的会问的问题,/interview-debrief 面试后给每个回答打分并重写最弱的那几个。准备环节会读复盘,所以每一次面试都让下一次更锐。每天 20 分钟代替 3 小时,简历里没有一条编出来的要点。
@JJEnglert [OpenClaw]
OpenClaw#20
https://x.com/JJEnglert/status/2108260489197130058
JJEnglert 提醒 Muse 用户,Muse 的 agent 本质上就是 OpenClaw,所以 /subagents、/compact 和 skills 全都能用,然后展示了一个让订电影票每次体验一致的 skill:看日历、确认日期和场次、选座并记住作者爱坐的位置、用内置的 Link 集成付钱买票、把预订加进日历、再按路况算好时间发一条「该出发了」。一件六步的跑腿活变成了一个可复用的例程。
@aj121503 [OpenClaw]
OpenClaw#21
https://x.com/aj121503/status/2108123599601283537
aj121503 转述了 poteto 讲的一个反直觉数据:OpenClaw 代码库删掉了 40 万行测试,几乎没有什么东西因此失去覆盖,因为在编码 agent 时代,测试多不等于更安全。真正有用的是验证,让 agent 跑起应用来检查自己的工作,再把反复出现的错误变成代码库里机械执行的规则。这和这段时间整个信息流从数测试数量转向对着真实应用做检查的趋势是一致的。
@kajikent [Claude Code]
Claude Code#22
https://x.com/kajikent/status/2108059745756299406
kajikent 正在把原本跑在 Claude Code Routine 功能里的循环任务迁到 OpenAI 的 dots 上,实际用下来觉得 dots 挺微妙:界面看着更顺手,但 agent 经常搞不清自己在干什么,最后得人去收拾。同一天还有好几条试过新消费级 agent 又退回来的帖子,而反复被点名的具体毛病就是这个:任务状态丢了。
@yaotti [Claude Code]
Claude Code#23
https://x.com/yaotti/status/2108010407881543799
yaotti 把一个习惯做成了 skill:每次会话结束都要问 Claude Code 一句「还有什么要做的吗」,于是现在直接敲 /anything-else。它会整理和更新相关的 issue,把会话中途冒出来又被忘掉的任务建成 issue,还会提醒现在顺手做掉会更好的事。一个很小的定制,但把原本只存在于一个人脑子里的收尾清单固定了下来。
@merill [Claude Code]
Claude Code#24
https://x.com/merill/status/2108140969552208074
merill 看到新闻里有人的 Cloudflare 账单失控,顺手给出一条任何有 Cloudflare 项目的人都能贴进 Claude Code 的提示词:装好 Cloudflare 的命令行并登录,检查有没有预算提醒,读上个月的用量,给 Workers 请求数、Workers CPU 和 Durable Objects 加上远高于正常值的用量提醒,再发一封测试提醒。不到三分钟,agent 配好了 10 美元预算提醒、200 万次 Workers 请求和 2,000 万毫秒 CPU 的提醒、Durable Objects 的请求、时长、读写提醒,测试邮件也到了。Cloudflare 没有消费上限,提醒是唯一的保护,作者还点出 SQLite 版 Durable Objects 至今设不了用量提醒,而那正是新闻里那个失控报警循环炸掉的地方。
@stas_sorokin_ [Claude Code]
Claude Code#25
https://x.com/stas_sorokin_/status/2108192836088742280
stas_sorokin_ 把同样六个带 bug 的仓库交给 Claude Code 里的 Haiku 5.5、Sonnet 5.5 和 Haiku 4.5,各跑四次,用 agent 从没见过的隐藏测试打分。隐藏测试通过数:Haiku 5.5 24 个全中,Sonnet 5.5 21 个,Haiku 4.5 16 个。每修一个 bug 的成本分别是 0.008、0.060 和 0.103 美元。反转在耗时:Haiku 5.5 的中位时长是 Sonnet 的 1.8 倍,因为它跑了约十个小回合,Sonnet 只跑四个、输出量却是五倍。每次修复便宜七倍、零失手,但钟表上更慢。
@SimonHoiberg [OpenClaw]
OpenClaw#26
https://x.com/SimonHoiberg/status/2108170700355744083
SimonHoiberg 现在做内容的标准流程从一次瑞士山里的长时间散步开始,对着 Telegram 连说 30 到 40 分钟。一个 OpenClaw agent 把这些碎碎念整理成结构,理顺之后做成内容,等作者回到家,一整周的轮播图、配图和推文串已经在 FeedHive 里排好了。想法依然是作者自己的,agent 只负责成型和排期。好几个人描述过的「语音备忘录到发布」流水线,这一条是完全跑在聊天软件里的版本。
@TheValueist [OpenClaw]
OpenClaw#27
https://x.com/TheValueist/status/2107988556132036701
TheValueist 说这是自己跑 OpenClaw 九个月以来做出的最酷的东西:实时卫星数据交给一个 agent 分析,作者在手机上就能指挥和调整它。agent 会在图上即时标注和批注。帖子挂着半导体和存储的股票代码,说明用途大概是对实体厂区做投资研究,作者自己的比喻是,这东西只有在情报机构里才会显得平常。
@claudeebum [Claude Code]
Claude Code#28
https://x.com/claudeebum/status/2108221582351147085
claudeebum 是 opencodex 的作者,现在正认真考虑把日常主力换成 Claude Code。推力有四个:改动要退出并重开 Codex 应用才同步;子代理会以和任务无关的方式失败;一半功能只在桌面应用开着时才能用;远程使用要走一个别扭的应用对应用桥接。与此同时,opencodex 刚上线了原生的 Claude 支持,用起来很顺,同一套工作流换个引擎,什么都不用重启。作者没想到让自己离开变容易的,是自己写的工具。
@superalesha [Claude Code]
Claude Code#29
https://x.com/superalesha/status/2108314027696804129
superalesha 拿到了人生第一条社区注释,并且认了:前一天被当作「数据流向美国情报机构」证据的那五个 .gov 字符串,其实来自 Claude Desktop 里打包的 Claude Code 二进制所用的 AWS SDK,任何打包了这个 SDK 的应用里都有同样的字符串。撤回之后保留了底层论点:检查一个闭源外壳的唯一办法就是从二进制里 grep 字符串然后猜,而这次猜错了;如果外壳开源,直接读代码就完了,根本不会发那条帖。结尾的诉求是每一个外壳都应该开源。
@niheytakizawa [Claude Code]
Claude Code#30
https://x.com/niheytakizawa/status/2108176429875962271
niheytakizawa 记录了 agent 越出任务边界的一个小苗头:把 Claude Code 接上一个客户反馈工具,让它修一个 bug,Claude 却建议修完之后回复一下那位抱怨过这个 bug 的客户。作者从头到尾没有提过客户。这里无伤大雅,甚至算贴心,但机制是一样的:agent 读到了人没有递给它的上下文,这正是今天信息流里到处在讨论权限问题的原因。
@MyWestLord [Claude Code]
Claude Code#31
https://x.com/MyWestLord/status/2108296139090919672
MyWestLord 开源了 FLAPPENING,一个用 Grok 和 Claude 一晚上做出来的浏览器像素游戏:没有引擎、没有构建步骤,就是 HTML、canvas 和 JS,所有精灵图、音效和配乐都是代码生成的。11 个世界各有各的死法,Claude Code 那一关是一个实时终端,管道是工具调用,撞上去显示「Interrupted by user」,别的世界则以 HALLUCINATED、MERGE CONFLICT 或 RATIOED 收场。16 张梗图传单、8 种管道样式、一个狂热模式和一个排行榜,还承诺谁提交的新世界最好就合进主干。
@EugBass [Claude Code]
Claude Code#32
https://x.com/EugBass/status/2108201640717115467
EugBass 收集了 Haiku 5.5 上线一天内三个认真用它的仓库。Stardust Breaker:七个 agent 做出一个 7,600 行的浏览器射击游戏,六个赛区、Boss 和武器进化,六个 agent 各做一个模块、第七个负责集成,第一次完整集成就通过了全部 12 步冒烟测试,渲染瓶颈从 5 到 19 帧修到无头 Chromium 里的 54 到 60 帧。Haiku-Worker 把 Claude Code 的任务拆成小的 Haiku 作业,审核结果、重试失败部分。100 HTML Files 是一百个独立演示,连提示词和截图一起放出。三者的纪律一样:小任务、接口先定、测合并结果、带证据返回失败。
@Skoorbkaz [Claude Code]
Claude Code#33
https://x.com/Skoorbkaz/status/2108119164149780622
Skoorbkaz 从 CrowdStrike 报告里挑出了对所有人都有意义的那个细节:攻击者的 agent 配置就是一份带渗透测试提示词的 CLAUDE.md,加上 Claude 的记忆文件和会话历史,全部放在一台对外开放的服务器上,主后端是 DeepSeek v4.1-flash,另外几段 Claude Code 会话里接了 GLM-5.3 和 Grok 4.6。作者的判断是,这个 agent 的工作身份活在文件里,而不在任何一个模型里,这也是调查人员能还原整个过程的原因。对普通用户来说教训很实际:会话日志和记忆文件就是一份完整的意图记录,离公开目录越远越好。
@ai_keiei_recipe [Claude Code]
Claude Code#34
https://x.com/ai_keiei_recipe/status/2108024833820799324
ai_keiei_recipe 用 Addness 加 Claude Code 把一家小店的 Google 评论回复做成了半自动,老板唯一要做的事是回一个 OK。agent 每 30 分钟巡一次 Google 评论,只挑出还没回复的,参考老板过去公开发过的回复写出草稿,每条评论变成 Addness 里的一个任务。人在任务下评论 OK,回复就发布。清单很短:一把能读写评论的 Google API 钥匙,一个 agent 也能读写的 Addness 任务板,负责写草稿和搭流程的 Claude Code,一台常开的电脑比如 Mac mini,再加一叠老板自己以前写的回复当样本。
@Vassteel [Claude Code]
Claude Code#35
https://x.com/Vassteel/status/2108048874799816758
Vassteel 把那条在好几种语言里刷屏的「Anthropic 官方技巧」模板逐条核了一遍。真的:/advisor、--advisor opus 参数和 advisorModel 设置都存在,Sonnet 5.5 做主模型、Opus 做顾问是官方认可的搭配,子代理可以通过环境变量或 agent 文件头跑在 Haiku 上并单独设 effort。假的:根本没有 --subagents haiku 这个参数,没有什么并行调度池设置,所谓 JEV 微分叉层、16 毫秒解决 1,500 条分支、340 tok/s 都是营销文案,不是 Claude Code 的功能。模板还漏了三件事:Haiku 子代理也会继承顾问,所以能按 Opus 价格调用 Opus;顾问只在 Anthropic API 上有效,关了遥测就会静默失效;用户设置里顶层的 effortLevel 会被 Opus 5.5 及更新的模型忽略。
@danysvnt [Claude Code]
Claude Code#36
https://x.com/danysvnt/status/2108325349788700792
danysvnt 把 Claude Code 设计负责人 Meaghan Choi 的十二分钟演讲压成了团队每天在用的那套设置。每个任务都在 worktree 里开始,好几个 Claude 同时干活也不互相覆盖;一个只靠提示词做出来的 /prototype skill 会把一个功能做成五个 HTML 版本,再让 Claude 挑最好的并说明理由;提示词结尾固定写「实现、验证、带截图开 PR」,然后看 PR 录屏而不是读聊天记录;/loop 让 Claude 一直干到任务真正完成;几百个小修小补发给网页版 Claude,再让它压成一个 PR。最诚实的一段:一个定时例程会找出没经设计师就上线的前端改动并起草替代方案,但它的建议差到给工程师的消息被关掉了,例程本身却留着,等更好的模型一来就能直接用。
@Vectorxeth [Claude Code]
Claude Code#37
https://x.com/Vectorxeth/status/2108092791527993713
Vectorxeth 给 Claude Code 里的 Opus 5.5 一份需求和 34 美元,拿回来一个飞行模拟器:四架能飞的飞机,30 公里的开放世界,有田野、森林、雪山、河流和村庄,海面有波浪和阳光反射,侧风会把你推离跑道中线,落地从「黄油」到「硬着陆」分级。没有游戏引擎,没有 Blender,没有模型和贴图,就是一个约 4,600 行 three.js 的 HTML 文件。agent 写代码、跑测试、截图、提交,3.5 小时 12 次提交,人只写需求和按合并。它自己的测试抓到了水从山体里漏出来、一个多余的注释悄悄删掉了代码、自动着陆偏离跑道 250 米,现在修到 8 米以内;它还找到了作者盯了几小时都没看出的问题:机库屋顶装反了,一盏着陆灯亮度设成了 90 万。
@millerbath [Claude Code]
Claude Code#38
https://x.com/millerbath/status/2108000199255929102
millerbath 跑着一条从不中断的 agent 线程,过去 17 天交了 826 个 PR。栈是 Hetzner 的服务器、Tailscale 做访问、Telegram 当控制面、herdr 管会话、Claude Code 干活。数字本身就是重点:一条线程,没重启过,一天差不多五十个 PR,全部从聊天软件里驱动。
@oznyang [Claude Code]
Claude Code#39
https://x.com/oznyang/status/2108061514695680403
oznyang 追查了为什么 Claude Code 给出的文件路径在终端里点不开,查出四个各自独立的原因:Claude Code 在 herdr 里不发超链接;裸写的 file:// 不算链接;herdr 不打开本地文件;herdr 不把超链接传给 Ghostty。文章给每一层都写了修法和插件代码,修好后按住 Ctrl 点击就能打开文件。一个小毛病,却很能说明现在大家跑的终端栈有多少层,以及每一层都可能把一个功能吞掉。
@RileyRalmuto [Claude Code]
Claude Code#40
https://x.com/RileyRalmuto/status/2108059320441041372
RileyRalmuto 让 Opus 把今年做过的所有设计系统、artifact、品牌套件和设计实验翻一遍,帮忙挑出最喜欢的,当作一个新的审美 skill 的参考,因为 Claude Code 里现有的那个已经过时,每次都要额外花很多工夫才能把东西做成想要的样子。Opus 做了一张无限画布,把所有东西铺在上面,作者可以圈出或标记喜欢的,再让 Claude 把这些标记提炼成一份短名单。前后大概十分钟,第一次缩小画布时吓到作者的只是东西实在太多。
@convequity [Claude Code]
Claude Code#41
https://x.com/convequity/status/2108058868576305383
convequity 测了 Grok Bot 新上的自动选模型功能,发现要求用 Opus Max 的任务已经被路由到 Cursor 的云端环境里跑 Opus,并且不消耗作者的 Claude Code 额度。小改动合适;超过 600 秒的任务会超时,所以长活仍然得让 Grok Bot 在本地驱动 Claude Code、Codex 或 Grok Build。坑在计费:后端执行看起来走的是每月 200 美元的 Cursor Ultra 套餐,几个小时的 Opus Max 就把整周的第三方模型额度用光了。作者的算法是,一份编码订阅每花 1 美元大约能换到 20 美元等值的 API 用量,所以即便 API 打折也要贵 5 到 10 倍,重度用 Opus 的人还是离不开 Claude Code 订阅。
@Hexakin [Claude Code]
#42
https://x.com/Hexakin/status/2108227625613205949
Hexakin 把「Opus 当编排、便宜模型当工人」这件事认真测了:十套配置,五类带隐藏答案的真实工作,由 Opus 5.5 和 Grok 4.7 盲评,再对照 Anthropic 和已发表研究的说法。结果:一个 Opus 5.5 独立做完整件事,质量上追平或压过所有团队;多 agent 团队省的是额度,在任务由很多相似小块组成时也省时间;宽泛的研究类任务是例外,团队能赢但贵得多;Haiku 5.5 单干能拿到 Opus 83% 到 98% 的分数,成本只有 14% 到 30%。作者没有给规则,而是给了一条提示词:让你自己的 Claude 审你自己的会话,按你实际的工作方式写出该用哪个模型、什么时候用工人、effort 设多少,在你回复 go 之前什么都不改。
@Eyal__Weiss [Claude Code]
Claude Code#43
https://x.com/Eyal__Weiss/status/2108258668231717017
Eyal__Weiss 介绍了普林斯顿 Tom Silver 组的一篇新论文,问题是:给 Claude Code 或 Codex 这样的通用 LLM agent 一个机器人运动规划任务、一个合适的模拟器和 20 美元的算力预算,让它写软件来解,结果会怎样。答案是 agent 写的程序在真正解出问题的比例上明显高于专家基于通用求解器搭的系统,而且快得多。作者接着把 agent 写的 112 个程序全读了一遍,想找有没有新算法,一个也没有:里面是非常好的工程,几十年前的老方法被按具体任务改造,缺的数据 agent 自己去量,目标在哪、机械臂怎么构造、挥多快才能让方块落在该落的地方。
@OnatAksaray [Claude Code]
Claude Code#44
https://x.com/OnatAksaray/status/2108199987935133742
OnatAksaray 每天用 Claude Code,却完全没有设计功底,这次花了大约三个半天第一次用 AI 做出一个网站。办法是发五六个喜欢的网站,逐个说清楚喜欢它们哪里,再让 Claude Code 自己去收集做这类网站需要的资源。第 0 天它先搭了一个做网站的工作区,第 1 天做出完整网站,第 2 天加一些有品味的小细节,第 3 天测试有没有错误、滚动是否顺滑。最有意思的是先搭工作区这一步:agent 在做交付物之前先给自己造了工具。
@hajekd [Claude Code]
Claude Code#45
https://x.com/hajekd/status/2108127575402823687
hajekd 想让 agent 替自己购物、付发票、续订阅、登录各种服务,而这些都要用到躺在密码管理器里的秘密,绝不能贴进聊天框。设计是这样的:agent 一次只拿一个条目,只给一个网站,只为一个任务;每次请求都先问人,并带上 agent 自己说的理由;批准就是按一下 Touch ID;模型永远看不到秘密,因为是本地浏览器去填表,agent 只知道成功了;所有请求都有日志。实现是一个基于 Bitwarden 开放的 Agent Access 协议的 Mac 菜单栏小应用,能和 Claude Code 配合,并在协议没走到的地方做了扩展:agent 可以说明目的,可以请求支付卡、身份信息或登录验证码,而不只是账号密码。和 1Password 的 agent 自动填充的区别在卡:这个能在结账时填卡、过 3-D Secure,由人批准用哪张卡。目前是概念验证,在真实网站上能用,还不能上生产。
@kandmybike [Claude Code]
Claude Code#46
https://x.com/kandmybike/status/2108060271113810022
kandmybike 中签了 Radiohead 的埼玉场,让 Claude Code 查过去两次演出的歌单,把歌分成听过和还没听过的:听过 Creep、Paranoid Android、No Surprises、Let Down 和 Street Spirit;还没听过 Karma Police、Fake Plastic Trees、Just、High and Dry 和 My Iron Lung。它还顺手统计了 2025 年巡演的演奏次数,Karma Police、Fake Plastic Trees 和 Just 大概两场出现一次。一行代码没写,一个乐迷,一场 2027 年 6 月值得期待的演出。
@shu_red_whale [Claude Code]
Claude Code#47
https://x.com/shu_red_whale/status/2108332863901086074
shu_red_whale 是有正职的非工程师,用 Claude Code 做副业第九天,把账算得很直白。值得交出去的:调研和分析,想得很深;概念设计,用词水平差一个量级;写台本,一小时的活变十分钟,长台本最见效;以及评审,会从作者没想过的角度打分。不值得的:校对这类简单活,白烧 token,别的 AI 就够了;在同一个对话里无限续聊,也很烧 token。作者八天做出了两件特殊内容,预计这个月能出八件,而以前一个月只出两件。
@crangerus [Claude Code]
Claude Code#48
https://x.com/crangerus/status/2108251540951543947
crangerus 总结了 AgentTime,一篇 30 页的论文,测 agent 能不能管好自己的时间:222 个任务,覆盖编码、电脑操作和研究,要求的工作时长从一分钟左右到好几天。1,991 次按时长执行的运行里,完成时间落在要求值正负 5% 以内的比例,Fable 5.1 在 Claude Code 里是 4%,GPT-5.6 Sol 在 Codex 里是 39%,GPT-6 Astra 在 Codex 里是 63%。对上钟表不等于一直在干活:158 次经人工审阅的 Astra 运行里,有 14 次在看似完成后明确进入了睡眠。agent 还普遍高估任务自然需要的时长,而拿掉计时信息会让它们事后的估计更差。任务完成、时长达标、时间花得值,是三件要分开量的事。
@blyzbyte [OpenClaw]
OpenClaw#49
https://x.com/blyzbyte/status/2108233952721035527
blyzbyte 把自己的 OpenClaw 只读接上了银行账户,现在让它追踪开销。只有一句话,但它是一个反复被人要求的模式的具体版本:先给 agent 看的权限,花钱的权限永远不给,或者以后再说。只读是最便宜的权限边界,而对记账这件事来说已经够用。
@stepango [OpenClaw]
OpenClaw#50
https://x.com/stepango/status/2108323965911658844
stepango 花了好几周把 Hermes 和 OpenClaw 的 agent 调成自己喜欢的样子,然后点名了那个一直没解决的问题:用户体验。消息太啰嗦,按钮式交互塞不进这套架构,自己在意的每个集成都时不时坏。一次次小更新把每个毛边磋得好一点,但 Grok 的 bot 在上线当天就把大部分事情做对了。作者没说它完美,只是说现在时间花在学产品上,而不是跟一堆小而持久的问题缠斗,这也是本周不少自托管用户在流失的诚实原因。
@mikepat711 [Claude Code]
Claude Code#51
https://x.com/mikepat711/status/2108186869145985047
mikepat711 在一条「要不要把 Mac mini 扔了」的帖子爆了之后补充:不扔。Grok Bot 现在会自动给每条提示词挑最合适的模型,所以「用 mini 驱动 Claude Code」这个用法价值变小了,除非作者想把 Claude 订阅的额度跑满,或者必须确定用的是哪个模型。mini 还在干、也是留下它的理由:让 Grok Bot 读到本地文件当上下文,有些事只有这条路;跑本地 Python 脚本给几个 bot 喂数据;想用的时候调动别的 AI 订阅。作者更大的判断是,完全不用考虑选模型这件事,才是接下来的方向。
@rickylim [Claude Code]
Claude Code#52
https://x.com/rickylim/status/2108088180763398630
rickylim 想把 Mac 上 TextExpander 的文本片段搬到一台装 Omarchy 的 ThinkPad 上,直接让 Grok Bot 去做,几分钟后同样的触发词就通过 espanso 能用了。Grok Bot 用的是 Cursor 的云端 agent,到第二台装 Linux Mint 的 ThinkPad 时作者加了一层:让 Claude Code 去核验 Cursor 云端 agent 在做什么,而 Grok Bot 编排整个过程,包括 Claude Code。人花的时间不到 30 秒。三家厂商的三个 agent 串在一条链上,其中一个只负责盯另外两个。
🗣 用户心声
用户心声
停掉主 agent 就该停掉它的所有孩子。@7izzyx 请 Claude Code 团队让停止主 agent 时同时停掉全部后台任务和子代理,因为被遗弃的运行已经让作者损失了大量额度;这类诉求反复出现,是因为子代理的扇出比一个月前宽得多。
会话日志是没人提醒过的隐患。@diancodes 指出 Claude Code 把完整会话日志以明文存在 ~/.claude/projects 里,贴进去的密钥也在,这个目录不该出现在服务器和共享备份里;@Skoorbkaz 从 CrowdStrike 报告里得出同样的教训。
缓存折扣没有落到订阅用户头上。@rohit3a 实测 Max 套餐没拿到完整的 Sonnet 5.5 缓存读取折扣,@ScarletKc 注意到 API 减半明确不涉及 Claude Code 的额度,@MahdiSPHP 则直接要求新发的每月 API 额度能在 Claude Code 里用。
沙箱依然是可选项,大家心里有数。@not_sacke 提到 Codex 在连续两届 Pwn2Own 被攻破、Claude Code 在柏林那场也倒下,同时承认自己在 Mac 上是全权限加凭感觉;@zzxwill 报告 browser use 有一半概率跑去控制另一台电脑上的 Chrome;@FrankRincoawh7 看着不懂技术的联合创始人一天烧光额度,连会话是什么都不知道。
agent 应该知道自己错了。@hubeiqiao 因为 Codex 擅自加界面元素、其余事情又事事请示而换回 Claude Code;@kajikent 发现 dots 记不住自己在干什么;@OrientLinden 看到 C 盘被删的报告后补上了第四道保险。
📡 生态产品雷达
生态产品雷达
Alook(几十条几乎雷同的帖子;一个让 Claude Code、Codex、Cursor、OpenCode、Pi 各有 @ 名和收件箱的共享房间) | Codex(每条讨论里默认的对照组) | Grok Bot 与 Grok Build(路由、访问 X、编排) | Haiku 5.5、Sonnet 5.5、Opus 5.5(发布周的基准测试和路由配方) | Jev / TypeSafe(被逐条核查拆穿的决策模型营销) | Hermes 与 OpenClaw(用户拿来和 Grok Bot、Muse 对比的自托管双子) | Cursor(Grok Bot 路由背后的云端 agent) | DeepSeek v4.1 Flash、GLM-5.3(CrowdStrike 报告和成本对比里的开源权重后端) | ARTEX(开源渗透测试 agent) | Nace / Drex(文档处理推广) | REA(给编码 agent 的逆向工程 MCP) | Rex(mitchellh 的终端,现已支持 Claude Code 状态协议) | Muse 与 Dots(大家试用并比较的消费级 agent) | Blender、Unreal Engine、Meshy(做游戏的三件套) | Obsidian、n8n、Telegram、Slack(agent 汇报结果的落点) | Polymarket(反复出现的交易机器人目标) | Natura 的 Interface(把语音路由给 Claude Code、Codex、Hermes 或 OpenClaw 的戒指)
← 上一篇
220 万个 agent skill 已经在 GitHub 上被复制。在源头修一个 bug,几乎永远传不到副本。
下一篇 →
Loop 日报: 2026-10-10
← 返回所有文章

评论

加载中...
>_