超级用户日报: 2026-09-11
今天最清楚的信号是:真正有意思的活儿已经整个挪出键盘了。一位父亲把o3塞进自己写的harness里,拿到了顶尖新生儿实验室漏掉的罕见病诊断。一位安全研究者把「状态好的月份十到二十个bug」换成了「三周195个」。一个只有一个人的HR把招聘文章的制作自动化了八成,然后把同一个agent掉转枪口去查面试官的偏见。一位毫无技术背景的54岁女性,一小时做出了一个能玩的游戏。
底下有两条论证正在变硬。第一条是harness大于模型:一项覆盖近一万七千次真实agent任务的研究发现,Claude Code、Codex和Cursor选到同一个工具的比例只有42%;而一个要求agent端到端造出可部署agent的新基准,把最强组合摁在23.9%,人类专家天花板是82.2%。第二条是成本素养已经成了核心技能,而且大部分流传的经验是错的——强制复核和拉满的思考强度经常让agent既更贵又更差,系统提示词里一个时间戳就能悄悄毁掉你的缓存命中率。
个人agent这条线本周直接裂成两半。花了九个月定制OpenClaw的重度用户说,开箱即用的那些没有一个能碰到边。而那些压根没把OpenClaw跑起来的人说,它从来没让人觉得安全、而且太复杂。两边描述的是同一个产品,而且都没说错。
底下有两条论证正在变硬。第一条是harness大于模型:一项覆盖近一万七千次真实agent任务的研究发现,Claude Code、Codex和Cursor选到同一个工具的比例只有42%;而一个要求agent端到端造出可部署agent的新基准,把最强组合摁在23.9%,人类专家天花板是82.2%。第二条是成本素养已经成了核心技能,而且大部分流传的经验是错的——强制复核和拉满的思考强度经常让agent既更贵又更差,系统提示词里一个时间戳就能悄悄毁掉你的缓存命中率。
个人agent这条线本周直接裂成两半。花了九个月定制OpenClaw的重度用户说,开箱即用的那些没有一个能碰到边。而那些压根没把OpenClaw跑起来的人说,它从来没让人觉得安全、而且太复杂。两边描述的是同一个产品,而且都没说错。
@Michael_J_Black [Claude Code]
https://x.com/Michael_J_Black/status/2097585486466327003
一位从1992年就开始参加计算机视觉会议的资深教授,在去ECCV 2026之前把难堪的话说出口了:他今年被录用的论文VIGA做的是把一张图变成3D Blender场景,用的是agentic方法,结果很快被直接拿Claude Code干同样事情的人超过,接着被GPT-6 Astra彻底碾过去。他的判断很硬:你在会议上看到的任何论文,基本都过时两年了,因为它建立在当时已经一年旧的文献上。他的建议也具体——每篇论文都该有一节,跟Related Work并列,专门实测当前前沿模型在这个任务上的表现,以及它们到底怎么失败、为什么失败。没试过用现有模型解决你的问题,就等于作业没做。
@MTSlive [Claude Code]
https://x.com/MTSlive/status/2097814042673029496
今天最重要的一个案例跟写代码毫无关系。Gamow Labs创始人Daniel McKinnon的第一个儿子死于罕见遗传病,而全球顶尖的新生儿全基因组实验室给出的报告是阴性。第二次因遗传原因失去孩子之后,他依据HIPAA权利把所有实验室原始数据要了回来,自己写了一个他称之为agentic loop的东西——那时候Codex和Claude Code都还不存在——把o3塞进一个harness里,只给了一句话:把这个搞清楚。它诊断出了长子Owen的病,那个全世界最好的实验室漏掉的病。他现在整家公司就建在这个发现上。
@Sisinerd [Claude Code]
https://x.com/Sisinerd/status/2097667363738976415
Ezinne Kalu从医学院退学,找不到安全岗位的工作,于是开始给别人的软件挖漏洞,用来证明自己值得被雇。她现在的配置是:Claude Code当harness,一个照着Karpathy的模式搭的第二大脑,全部存在GitHub、在Obsidian里管理。以前状态好的月份能提交十到二十个bug,这套系统三周找出195个,比她整个手工挖洞生涯加起来还多,其中包括CVE-2026-79653——Eclipse SW360里的路径穿越,跑在三万多家组织内部,包括西门子,至少六个发行版本里一直躺着。最刺的一点是:大部分命中的软件根本没有赏金计划,所以一分钱没拿到,而且系统现在产出的漏洞已经多到她本人来不及披露。
@MatiasScalbi [Claude Code]
https://x.com/MatiasScalbi/status/2097807325251666027
他用AI从零搭了一个美股内部人交易监控盘,并且把整套做法公开了。五个部件:SEC EDGAR拉Form 4、国会官方披露、一个数据库、按代码/人/日期/金额/类型的筛选、一个简单的网页界面。他特意只留高管真金白银买入的那部分,把股权授予和期权行权这些会把信号搅浑的动作剔掉。他给的搭建顺序是先只做SEC加内部人买入,跑通了再加国会、提醒和收藏。他也明确说这不是抄作业工具而是研究筛子——国会那边的申报可能滞后45天,金额还是按区间公布的。
@LmyQs2 [Claude Code]
https://x.com/LmyQs2/status/2097535621804011946
他让Claude Code做系统迁移,结果它一路挖到把他整个联盟营销业务复盘了一遍。它先把所有ASP两个月的成果CSV全拉下来,把格式各不相同的数据合成一份,整理发生、承认、拒否、保留,算出每个案件的承认率。然后去读Gmail,从几百封邮件里抽出拒绝通知,再顺着往回查跟ASP负责人过去的往来、特单交涉、单价变更和承认条件。最后进他自己的访问数据,把广告到访问到送客到发生再到承认拒否整条链对一遍,找计测漏洞。做完这些它开始盘算该往哪个案件倾斜、该停哪个、之后该怎么打。这套顺序不是他定的,是它自己一路挖出来的。
@LmyQs2 [Claude Code]
https://x.com/LmyQs2/status/2097711754688279004
上面那次迁移本身:从樱花互联网搬到AWS,他原本预算一周,Claude Code两个小时干完。而且不是简单搬机器——源码按新环境改了,数据库也牵涉进来,所以是分阶段推进、反复测试,避免弄坏既有数据和功能,最后还确认到生产环境。
@yuvraj_io [Claude Code]
https://x.com/yuvraj_io/status/2097779401664688407
他把一台跑着Claude Code和Fable 5.1 Max的笔记本递给54岁的妈妈,让她想做什么就做什么,还教她开Wispr Flow,可以用说的代替打字。一小时后她做出了Magpie Hollow:第一人称的山谷探索游戏,每天早上你把随身物品摊在桌上,有十秒钟记住它们,然后一只喜鹊小妖冲进来把东西藏遍整个山谷,还撒了一堆碰不得的假货,你得在天黑前全找回来。他只帮忙做了Vercel部署。在那天之前,她跟AI最深的接触是在ChatGPT里生成图片。
@Offers_jp [Claude Code]
https://x.com/Offers_jp/status/2097496668916920669
一家日本创业公司里只有一个人的HR,用自己在Claude Code里写的skill把招聘宣传文章的制作自动化了八成。三个技能叠着用:成员访谈、把跟AI的对话日志变成文章、读新人入职时写的Notion自我介绍页。单篇文章原本约12小时的制作流程被大幅压缩。更有意思的是后半段:他在终面跑一套「魔鬼代言人简报」,让AI把评价意见和面谈记录里的偏见挑出来,宁可通过率下降,也要避开错配和早期离职。
@mylifcc [Claude Code]
https://x.com/mylifcc/status/2097528923789947063
他跑了16,893次真实的Coding Agent任务,只为回答一个问题:没人告诉Claude Code、Codex和Cursor该用什么工具时,它们自己会选谁。答案是它们活在三个不同的互联网里。Codex几乎逢任务必搜,94%的session会用Web Search,而且爱用site:把范围钉死在官方文档上。Claude Code反过来,只有约30%的任务会上网,其余时候直接靠模型已有的知识做决定。Cursor在中间,约三分之二。真正关键的数字是:三个agent最后选到同一个工具的比例只有42%。同一个需求,Claude Code可能选Twilio,Codex选OpenAI Realtime API,Cursor选Vapi。这已经不是「哪个工具最好」的问题,而是「哪个agent觉得哪个工具最好」。
@zengbozb [Claude Code]
https://x.com/zengbozb/status/2097572314426802314
上面那条的现场验证,来自一个被坑过的人。同一个需求,Claude Code在他的Python仓库里选了一个库,换到TypeScript仓库又选了另一个。他一开始以为是模型抽风,后来发现它是在读依赖文件、猜「这项目的人会用啥」。他的解法是直接在CLAUDE.md里把几个库写死,不然每次结果都不一样。
@askalphaxiv [Claude Code]
https://x.com/askalphaxiv/status/2097516844156330059
在你把整个项目交给agent之前,这个基准值得记住。大部分agent基准评的是别人已经搭好的agent,而τ^τ-Bench问的是另一件事:一个编码agent能不能从杂乱的多模态业务记录、客户需求、API、继承来的代码和服务约束出发,端到端地造出一个可部署的agent,然后把成品丢给留出来的模拟用户去跑。最好的组合是Claude Opus 5加Claude Code,得分23.9%,而专家撰写的天花板是82.2%。真正有用的是失败原因:证据检索太浅、几乎不追问客户、几乎没有架构和成本优化。
@Perpetualmaniac [Claude Code]
https://x.com/Perpetualmaniac/status/2097732678246429047
他用Claude Code做出了自称目前最强的C/C++/Rust跨平台内存分配器,底子是Bun项目那份微软Mimalloc的fork。他这一支加了全进程级的主动内存清理、交叉编译、通过DHAT和pprof改进的内存剖析,以及win-gnu的TLS泄漏修复。微软已经开始把他的修复合回自己的Mimalloc分支。这才是好结局该有的形状:不是又一个绿地玩具,而是给现有项目做了上游愿意收的系统级贡献。
@ClaudeCode_aca [Claude Code]
https://x.com/ClaudeCode_aca/status/2097641168100110632
今天讲自动化代价讲得最清楚的一条,而且全是真事故。一个30分钟的循环放着不管,一晚上烧掉约90万日元。子代理的递归bug在不到5分钟内消耗400万token。Uber据报道四个月就把2026年的AI预算花光了。对照组是另一个人,同样的无人值守,跑了27小时3分钟、完成84个任务、零事故。同样的玩法,相反的结局,作者的判断是:差别只在安全装置。
@onurtirpan [Claude Code]
https://x.com/onurtirpan/status/2097569252911776101
值得读两遍的失败案例。一个跑了22小时的任务,在完成度45%的时候把额度撑爆了。任务是把一个5000行的Python文件压到3000行,它交出来的是35000行。他还补了一句,模型放在Claude Code和OpenCode里其实不差,垃圾的是厂商自家那个CLI。
@Da7_Tech [Claude Code]
https://x.com/Da7_Tech/status/2097686758259388561
他看着自己的agent在每个大任务上重复同样四个错误之后,做了一个skill:还没搞懂需求就开始造、把没人回答的问题当成默认同意、抽查一个样本就宣布全部完成、然后自己review自己的活儿并批准。SureForge是一段纯文本,把工作切成调研澄清、计划、执行、交付四个阶段,每阶段结尾有一道必须通过的关卡。被跳过的问题永远不算作答案。每道关卡上agent要用三种不同方法自查,而不是同一种方法重复三遍;然后一个上下文全新、没看过它推理过程和自评的独立审查者,自己挑三种方法再查一遍。三轮之后还有真问题没关掉,它就把剩下的原样端回来给你决定,而不是宣布完工。
@GitHub_Daily [Claude Code]
https://x.com/GitHub_Daily/status/2097535485363257587
这里指出的问题几乎没人点破:agent干完活,用一堆commit哈希和行话汇报,不懂工程的人根本判断不了到底做完没有。作者不是工程师,做了二十年产品,公司里有五十多个开发,自己一个人用AI做产品时撞上了这堵墙。Open Steps是七个skill,专管让agent说人话:干完出一屏报告,先给结论做完没做完,再答三个问题——需要我做什么、有没有留下新的坑、能不能关掉。坏消息单独占一行,不藏在段落中间。要人动手时给编号步骤,agent先把自己能做的做完。做合同、迁移这类难回头的决定之前,另开一个没参与过的agent,假设这事已经失败了往回推原因。触发率是真测过的:21句日常问法各问三遍,Opus 5全中,Sonnet 5是95%。
@ThePracticalDev [Claude Code]
https://x.com/ThePracticalDev/status/2097541507704049782
一个安静但真花钱的发现:一套自定义的Claude Code agent阵容,大部分其实是死重——每次请求都被加载、都在烧token,却从来没被真正调用过。解法是两个脚本,一个记录调用,一个把没用过的标出来删掉。如果你也是那种一路收集子代理的人,这就是你还没跑过的审计。
@MartinSzerment [Claude Code]
https://x.com/MartinSzerment/status/2097551048902615369
Anthropic那套CI on-call agent里,真正有意思的不是它会读告警,而是lessons.md——每次事故之后agent往里追加,每次新调查开始先读它。中位诊断时间14分钟,架构上把一个编排agent和一批并行查日志、指标、部署历史的执行子代理分开。底下的论点其实是在重新定义「团队的运维知识」是什么:它以前会随着当时值班那个人一起消失,现在住在一个每次新事故都会被自动读一遍的文件里。
@JamesPelton18 [Claude Code]
https://x.com/JamesPelton18/status/2097711990927954345
他整个生意跑在一支Claude Code agent舰队上,管财务、赞助、邮件和内容,而且对难点在哪说得很直接:难的不是提示词,是围着它们的那套运维系统——它们启动时读什么、什么东西能拦住它们把东西发出去、以及它们怎么记住自己曾经错过。
@utekkare [OpenClaw]
https://x.com/utekkare/status/2097542913471447130
一次完全无人在环的多agent冲刺,每一步都写下来了。Codex和Cursor跟他一起规划sprint,Cursor列出并写Linear工单,Codex核验后启动,Codex在专门的Slack频道里按工单逐条给Devin下指令,而他们那只叫Ricia的OpenClaw替Cursor盯着这个线程。Devin写代码提分支,Codex拿产出对照工单,Cursor对抗性地审PR,要么在Linear上留问题,要么合并。订阅总预算每月600美元,Cursor、Devin、Codex各200再加用量。发帖时一周的sprint才走到一半,预计提前完工。
@Gozengogo_ [Claude Code]
https://x.com/Gozengogo_/status/2097694319302123542
公司里给每个人配agent bot运行了半年之后,他看到自己的Claude跟其他成员的Codex和Claude Code一起合作创建了一个PR。没人编排这件事。他的反应是诚实的那种:本身就挺吓人,而A2A就这么自然而然实现了,更吓人。
@hanifproduktif [Claude Code]
https://x.com/hanifproduktif/status/2097585652879745419
一条成本压到极致的AI网红带货流水线,而且有真实单位经济。视频用Minimax H3-Max,15秒一条约5000印尼盾,比Seedance便宜很多,提示词给对了效果差不多。Minimax做不好logo、文字和配音,所以剪辑那一道交给Claude Code走ffmpeg,加logo、加配音、加片尾文字。10美元能出约30条,一天一条够发一个月。他对agent的定位才是重点:就当成你雇的视频剪辑,直接使唤就行。
@rewind02 [Claude Code]
https://x.com/rewind02/status/2097629915851976934
一张产品图进去,一整套品牌campaign出来,而且流程是按顺序写死的。把照片丢进Claude Code的项目文件夹,把Higgsfield接成自定义MCP连接器。第一步brief:Claude只看这张照片,写出产品描述、品牌承诺、支撑点、色板、调性和目标买家,只用画面里真实存在的东西,不许编。第二步research:去TikTok、Reddit和Meta广告库找那个还没被解决、值得打的问题,并把brief里研究支撑不了的部分标出来。第三步design:slogan、语气规则、字体、色板,是给以后所有campaign复用的,不是一次性物料。然后出一张写实主视觉,Claude用视觉分析先自查再往下走,基于它派生十张campaign图,再通过Seedance出五种风格的视频。终点是一份内容日历、一份付费媒体预算方案和一本完整的品牌手册PDF。
@geekbb [Claude Code]
https://x.com/geekbb/status/2097581268783493619
一个基于102万字真实公文语料统计提炼出来的写作skill,兼容Codex、Claude Code以及任何认agents.md的agent。它特别的地方在于把文风量化成了可验收的参数:句长、顿号密度、标题字数、三级标题数量。覆盖调研报告、领导讲话、工作意见、经验材料、工作方案、经验总结和党建材料七类。把文风当成验收测试,而不是玄学。
@bond_ai1 [Claude Code]
https://x.com/bond_ai1/status/2097646196802142662
一个一行代码都不会写的18岁女生,搭了三个agent的外呼机器,不到三周成交14单。她一开始是在学校停车场挨个给修车厂和美容院打电话,连着被挂断40次,于是干脆不再用嘴卖,改成先把成品做出来给人看。bond负责在Google Maps上找评分4.7以上、门口排队却没有网站的店,把服务、价格、营业时间、地址和近三年的评论全抓下来。lego从中挑出客人真正夸过的点,直接翻译成页面结构。belfort把链接发过去,一个字不提钱。老板点开,第一屏就是自己的店名、自己的地址、自己的招牌,下面整整齐齐排着自己客人写的原话。拒绝,等于亲手删掉一件写着自己名字的东西。等对方说想留下,价格才出现:今天定800美元,明天起1200,再加每月200维护域名。原帖最后给了日本版做法——把抓来的评论丢给Claude Code生成落地页结构。
@Kay2289123 [Claude Code]
https://x.com/Kay2289123/status/2097704366069440778
一个工程师怎么对付AI焦虑,有具体数字。他固定拿每月工资的10%投进AI学习:公司token之外,个人订了三个200美元的Codex Pro和一个200美元的Claude Code,用来做投研、自动化工作流和强化学习。他把自己全部的工作、生活和投资经历都喂给GPT-6,并且大量用computer use,让模型在每个决策上都有真实上下文。最值得抄的是他的三段式提示词结构:背景(因为资料他已经收好了,所以只告诉AI去哪找)、要做什么、以及evaluation——他说这一项最关键。要明确告诉AI你想达到什么效果、怎样才算真的结束了。
@aehyok [Claude Code]
https://x.com/aehyok/status/2097658946618327226
关于「个人记忆」比「项目规则」多出了什么,这条说得最准。他让手机上的agent分析自己的X账号并生成一个可直接预览的网页,第一版风格、主题、视觉、布局全不对,调了三次才满意。惊喜出现在第二次:新开一个会话,做的是完全不同的个人介绍页,他一句要求都没重说,它却保留了上一个会话里的背景、排版和视觉偏好。而且它不是照搬上一个页面,是记住了他的判断偏好。他的概括很到位:Rule解决的是这个任务应该怎么做,Personal Context开始解决的是为什么我会选择这样做。他也提到,以前用Claude Code、Codex时要自己维护Rule、Skill和项目记忆,项目一大就很难维护。
@azamixx821 [Claude Code]
https://x.com/azamixx821/status/2097830127787012325
「天蓝领」案例。他一边干基建和农业的活,一边并行跑好几个Claude Code会话,趁间隙去做自己田里的农活。他的判断是:蓝领实体工作加上白领的agent监工,这个组合本身就是个很强的位置,而且是在能用手机驱动会话之后才真正成立的。
@mizuhoginhidoi [Claude Code]
https://x.com/mizuhoginhidoi/status/2097695869567222026
一个没人打广告的副作用:标准化的业务确实更容易交给AI,但反向也在发生。用Claude Code执行并记录工作之后,原本没被标准化的业务会被标准化掉。那些只存在于某一个人脑子里的判断标准和例外处理,不管当事人有意还是无意,都会被形式化出来。
@aiumeba [Claude Code]
https://x.com/aiumeba/status/2097512818266243103
她一行代码都写不了,从来不是工程师,做的是互联网行业里策划和接咨询那一侧,把需求交给技术、拿回成果物。她现在在用Claude Code,还是一行都不会写。她做的事跟以前一模一样:把要做什么,按顺序、不遗漏地说清楚。她的结论是整个feed里最不自吹的一句:我并没有变成一个会做东西的人,只是能拜托的对象从人换成了AI。
@DavidFlagg20 [Claude Code]
https://x.com/DavidFlagg20/status/2097497613914222968
一个没有计算机学位的业余开发者,花了好几年赌「把记忆解决了就能解锁更难的问题」,一路折腾过Claude Code、Hermes、OpenClaw和自制记忆系统。最后他撞墙了,而且把墙说清楚了:真正的记忆和持续学习还不存在,没有这两个地基,他想建的东西建不起来。他第二个发现更暗,也值得跟常见的末日论分开看:他怕的不是智能,是没有后果感的机器速度,以及那道很硬的算术题——如果你的防守系统需要人在环里、而进攻系统不需要,你就会输。
@socialwithaayan [Claude Code]
https://x.com/socialwithaayan/status/2097627095417651516
给这周正在从Claude Code搬去Codex的那批人的迁移清单。别重建。Codex会扫描你的用户配置和当前打开的项目,自动搬十一样东西:指令文件变成AGENTS.md、settings.json变成config.toml、skills、斜杠命令变成skills、子代理变成agents、hooks、MCP配置、插件、项目文件夹、项目记忆,以及最近30天的对话。五样要自己手动收尾:工具权限、自定义MCP的认证和请求头、行为不一样的hooks、插件和marketplace、参数与路径提示。跑migrate-to-codex之前先把config.toml复制一份,因为这个skill会重写它;删掉Claude之前,先在Codex里真跑一个任务。
@wquguru [Claude Code]
https://x.com/wquguru/status/2097630666792075271
一次押错方向的七个月复盘。他当初看空Codex独立App,觉得只是把CLI可视化了一层,隔离感重、切换成本高、性能还不好。七个月后,桌面端成了同行竞相模仿的产品形态。App补上的是CLI里很难做成一等公民的东西:Computer Use能在后台点原生App和模拟器;Local / Worktree / Cloud三种线程模式把并行隔离做成一等公民;Automations / Routine把定时巡检收进收件箱;内嵌浏览器能预览localhost、直接在页面上批注再改代码;文件浏览器和Git面板把看diff、暂存、提交、回PR评论收进同一个窗口。相比之下Claude Code这半年基本死守CLI,但也有后台自动更新、/checkup自我体检、Artifacts把终端过程变成页面、--teleport把云端会话连同分支拉回本地、Remote Control让手机变成本机会话的窗口。
@TheUltronAi [Claude Code]
https://x.com/TheUltronAi/status/2097717281270940163
同一条sprite提示词、同一档推理强度、两个harness,差别不在质量而在对意图的解读。任务是给一个还不存在的中世纪等距视角游戏做骑士精灵图。Codex CLI里的GPT-6 Astra交回一张干净的图集,16个关键姿势,问什么给什么。Claude Code CLI里的Fable 5.1交回992帧、四套完整色板、一个Python生成器让他自己接着造更多精灵,外加一个能逐帧翻看的浏览器预览。他的解读很对:Astra把「精灵图」按字面理解,就交精灵图;Fable把「我要开始做一个游戏」按字面理解,就交了一个游戏的开头。只有其中一个假设他明天还会回来要更多。
@btc_MasterPlan [Claude Code]
https://x.com/btc_MasterPlan/status/2097794727869325782
用Claude Code跑Opus 5、同时并行跑GPT-6 Astra循环的第二天,分工很明确:Claude Code负责造、解、执行;Astra负责审,他觉得Astra比Fable快、更便宜、更聚焦,而且很擅长抓住真正要紧的东西。他对这个转变的描述才是重点:感觉不再像在用两个AI工具,更像同一个团队里两个不同专长的人。
@SFourdrinier [Claude Code]
https://x.com/SFourdrinier/status/2097802953126269304
一条从失望里长出来的显式升级阶梯。他不再默认用Astra,退回Sol medium当底座,只有在需要大量推理、头脑风暴或第二意见时才升到Astra high,再通过claude cli升到Fable 5.1去拿计划的第二意见和评审。执行层交给grok和muse的CLI。他在Claude Code那侧也跑同一套结构,只是方向反过来。
@milan_milanovic [Claude Code]
https://x.com/milan_milanovic/status/2097573228571205633
三年AI编码提炼出四个真正反复出现的模式。规格先行:让agent产出SPECS.md或RESEARCH.md和PLAN.md,在plan模式里迭代到满意,再让它实现。上下文放仓库里:从AGENTS.md和CLAUDE.md引用的文档,加上ARCHITECTURE.md和ADR,并要求agent在实现过程中持续更新和复查,让它们成为活文档。每个任务都测结果:自动测试、构建、动了UI就截图,再加跨agent评审——用Claude Code写的代码丢给GPT去审,因为不同模型看到的问题不一样。小批次、频繁提交,回滚便宜,人工复查也还做得动。
@cansar [Claude Code]
https://x.com/cansar/status/2097523825101385741
2025年第四季度他在Block推过一轮高级上下文工程培训,为的是把Claude Code用到位;到了三四月,团队开始大批转向Codex。真正说服他的不是跑分,是compaction。以前那些子代理花招和刻意压缩的仪式可以不做了,就一直往下跑。他有一条线程横跨多个仓库和多种语言,建出了一整套同步协议、服务端和客户端,还把它们部署了。现在单线程是常见话题,他仍然惊讶于一条线程里能塞进多少东西。
@ScarletKc [Claude Code]
https://x.com/ScarletKc/status/2097499293649420700
今天最有用的成本贴,而且它推翻了三个大家以为很安全的习惯。给AI加上反复检查、必须按固定步骤执行、再把思考强度拉满,真的可能让它更贵还做得更差。为旧模型打的补丁会干扰新模型:一句「尽可能详尽」让模型多做了几十次没必要的知识库搜索;强制写推理草稿甚至出现工具调用被写进思考里、却没有实际执行。在一组客服测试里清掉这些指令后,平均成本降低14.6%、准确率提高5.3%。HLE上Fable 5.1升到max档,成本增加46%,成绩只多约0.5个百分点,还在测试波动范围内。反过来在CursorBench 3.2上,Fable 5.1的low就能达到Fable 5的high水平,成本只有三分之一。而缓存失效很多时候只是因为一个时间戳——系统提示词里变动的时间或ID、或者工具定义顺序变了,前缀就对不上了。
@RoundtableSpace [Claude Code]
https://x.com/RoundtableSpace/status/2097607189418688829
一次后端元数据调用,把一轮Claude Code从1040万token压到370万,成本从9.21美元降到2.81美元。放在这里是因为:你账单上最大的那根杠杆,通常不是模型档位。
@dotey [Claude Code]
https://x.com/dotey/status/2097751032113549395
一个很小但真有回报的配置发现。他一直在把Claude Code的1M上下文关掉用,从效果来说没有发现明显折扣,从token消耗来说确实更省。在你默认「窗口越大越好且免费」之前,值得自己测一下。
@matthewmillerai [Claude Code]
https://x.com/matthewmillerai/status/2097665956201795805
关于「跑步机」讲得最清楚的一条。2025年他为Claude Code付200美元一个月,从来不想额度这件事。2026年他付一千多,每天都撞墙:Claude Max配Fable 5.1、ChatGPT Pro配GPT-6 Astra、SuperGrok Heavy配Grok 4.6,其中几个还得开多个账号才能继续干活。模型更好了,所以他用得更多,所以撞墙更快。五倍的钱,换回200美元时候同样的感受。他的原话是:照这个速度,单干的创始人得给AI单开一条工资科目,而他那条已经开了。
@donbigby [Claude Code]
https://x.com/donbigby/status/2097789519240052770
一个天然有对照组的人给出的具体怀疑。他每天在同一个项目上同时跑VS Code的Copilot插件、Claude Code插件和Kiro IDE——因为公司有三份互相独立的额度——三个都用Opus 5。他的观感是:Claude Code烧额度的速度像冬天烧煤,另外两个不是这样。
@yulmu_coffee [Claude Code]
https://x.com/yulmu_coffee/status/2097592495630938304
给撞额度的人算的一笔套利账。每月10美元的OpenCode GO订阅跑Muse Spark 1.3 Contributor模型,实际给到的是每月60美元的用量,五小时窗口内最高可用12美元。Contributor的单价是输入0.1、输出0.2每百万,缓存读取0.002,而OpenCode自己的统计显示缓存命中率约95%。算下来五小时约45,300次请求,单次请求成本约0.000265美元。对比GPT-5.6 Luna:输入便宜2倍、输出6倍、缓存输入10倍,而且Luna月度用量被卡在15美元,所以实际请求数是它的约22倍。Claude Code、Codex、Pi、Hermes都能用。
@making [Claude Code]
https://x.com/making/status/2097476757494620519
承接同一个挤压的实操。他让Claude Code把任务写成md,并按难度分成low、medium、high,分别对应Sonnet、Opus、Fable三档。把high难度的任务丢给Muse Spark 1.3,它照样爽快做完,而且在允许数据用于训练的前提下,价格便宜得离谱。他专门开这个10美元的OpenCode GO订阅,就是因为Claude Code的促销下周结束、额度要缩水,按他现在的用法周额度会立刻见底。
@yasuhiks [Claude Code]
https://x.com/yasuhiks/status/2097506702417694957
Fable的速率限制把他逼成了一张完整的模型与harness分配表,而不是一个默认选择。对话走Hermes配GPT Astra、以及Claude Code配Fable 5.1。开发走Claude Code配Fable 5.1,加上OpenClaw分别配Astra、Kimi K3和Qwen 3.8 Max。运营走Hermes配Astra、OpenClaw配Kimi K3。保守管理走Hermes配Astra、OpenClaw配MiniMax。
@AlicanKiraz0 [Claude Code]
https://x.com/AlicanKiraz0/status/2097498388522533259
他在Claude Code里只打了一句「你好」,然后把上下文占用截图发了出来。他的结论是:开始对话之前得把所有MCP关掉,插件也清一遍,而且Claude Code现在真是个糟糕的harness。你同不同意这个结论另说,底下那个观察是真的、而且普遍被忽略:你的空转上下文成本,在你敲第一个字之前就已经定好了。
@ishimoto_legal [Claude Code]
https://x.com/ishimoto_legal/status/2097527141898588558
一位律师,让Claude Code一边用内置浏览器搜索、一边用computer use操作他的桌面,同时自己在手机上发这条推。他很诚实地说还是怕,做不到撒手不管,并且提出了正确的下一步:computer use哪次跑通了,就把那套操作技能化,别让它下次还得重新摸索一遍。
@takechan_lawyer [Claude Code]
https://x.com/takechan_lawyer/status/2097476634660184300
一个来自非工程职业的有效信号。Astra的Computer Use让Codex在日本税理士圈开始流行。他的论点是:桌面App的UI和远程控制都是Codex这边更好,所以除非你非要Claude那种文风,否则用Codex更合适;再加上token消耗少、还有额度重置,实际能用的量是Claude Code的两倍以上。
@pfernan95dev [Claude Code]
https://x.com/pfernan95dev/status/2097721530666856736
两个并排跑下来,他挑出了Claude目前仍然领先的一点。Codex在手机上是个遥控器,你的机器必须醒着并且正在跑codex。Claude Code可以直接从App里开一个会话、挑一个GitHub仓库,然后把笔记本合上。用他的话说:如果你是晚上做东西的人,这一点很重要。
@connect24h [Claude Code]
https://x.com/connect24h/status/2097526957634457864
一个瞄准的痛点是所有人都有、但很少有人说清楚的:编码agent把答案埋在长篇解释里,你得滚屏找结果。i-have-adhd这个skill的README摆明规则——行动先说,步骤给编号,砍掉多余的前置铺垫。它在Hacker News上拿到323分、257条评论,说明这个不满有多普遍。他的概括很准:AI几秒钟写出来的说明,人类要花好几分钟挖回去,这笔账怎么算都不划算。
@0xAlad [Claude Code]
https://x.com/0xAlad/status/2097608935830380637
两个免费数据集,能把Claude Code变成Polymarket的量化研究员。poly_data一行命令把Polymarket所有交易数据拉到本地硬盘:谁买的、什么时候买的、什么价格、多大规模、对手方是谁,第一次同步大约310万个市场、要跑几个小时,之后增量更新几秒完成。有了它你可以拆任何一个交易员的edge——他到底靠方向判断赚钱,还是靠成交价格、流动性、时间窗口赚钱。第二个pendulumflow archive存的是订单簿本身,已经记录2880亿个事件、每天还在新增23亿个,几乎可以按秒级回放,这种数据以前一个月要花200美元。它首页还放了现成的问题,可以直接复制进Claude Code跑分析。
@UXTown [Claude Code]
https://x.com/UXTown/status/2097779766002634943
他做了一个MCP服务器,把竞品在跑的Google广告直接拉进Claude Code、Codex或Cursor:按域名搜、统计某个市场里的在投广告数量、把创意素材下载下来。不需要API key,MIT协议。这些数据本来全是公开的——而这恰恰是agent最擅长的那类事:把公开但没人愿意翻的东西变得便宜到可以真用。
@itsharmanjot [Claude Code]
https://x.com/itsharmanjot/status/2097556855257997563
有人给「等agent跑活儿的人」建了一个虚拟屋顶酒吧,而且整个东西是用Claude Code做的。你有个虚拟形象,可以走动、用语音或文字聊天、坐下来跟人待着、打台球,或者干脆开着标签页让Claude Code在旁边磨活儿。起因才是重点:用了Claude Code之后他产出暴涨,但整天一个人盯着终端等构建结束,所以他做了个地方,让这件事不必一个人做。上线时人涌得太快,服务器中途还得紧急修一次。
@AndoniMartt [Claude Code]
https://x.com/AndoniMartt/status/2097756985265467799
整个网站是用Claude Code做的:灵感来自Pinterest上看到的几张图,先在ChatGPT里生成类似的东西,再拿到Higgsfield去加动效。3D部分他一开始用Three.js,最后换成Blender,因为效果更好;他也很坦白,火箭还能再迭代很多,性能上也有些问题没解决。他的实操结论是:只要skill配对了,Claude Code能给出跟Claude Design很接近的设计结果;但如果他想快速看好几个方案,Claude Design还是更灵活。
@levelsio [Claude Code]
https://x.com/levelsio/status/2097729222361932000
他在一段视频里看上了别人做的电子墨水屏观感,于是让Claude Code把它变成一套可以复用在自己所有网站上的CSS UI Kit。成了。事情很小,但这才是这个工具对很多人来说的日常形状:看到一个观感,直接要它背后的那套系统。
@levelsio [Claude Code]
https://x.com/levelsio/status/2097736836885987361
他的部署流程,给所有把这件事搞复杂的人参考:在Cloudflare注册域名,然后让跑在他Hetzner VPS上的Claude Code去配置——因为那台机器上已经有他Cloudflare账号的API key。剩下的它全包了,再配上Cloudflare Tunnel,SSL都不用管了。
@ClaudeCode_UT [Claude Code]
https://x.com/ClaudeCode_UT/status/2097531692953284888
端到端的视频剪辑:把素材和剪辑指示放进Claude Code的项目里,让它剪掉间延的段落、加上画面动效和素材、生成字幕,你只负责确认成品。他最有用的那句话其实不是在夸自动剪辑:真正管用的是能把「要做成什么样的视频」这个判断标准留在项目的文件里,下一批素材还能沿用同一套判断。
@sagivmal [Claude Code]
https://x.com/sagivmal/status/2097710770997837872
他用了HeyGen开源的HyperFrames——把HTML变成视频的工具:你用HTML/CSS加GSAP写好带时间轴的「合成」,引擎在无头Chrome里打开,逐帧捕获,再用FFmpeg编码成MP4,同样的输入永远得到完全一样的视频。他让Claude挑一个X上的热门话题,它选了Cognition那轮480亿美元估值的融资,自己写了视频代码、自己装好并运行了工具、自己产出了成品文件。他特意声明数字他本人没有核实,只是把这次实验原样分享出来。
@HuaHua_BTC [Claude Code]
https://x.com/HuaHua_BTC/status/2097625560545452108
n8n很好用,直到节点一多,手动连线和配参数就开始吃掉你一整天。n8n-mcp通过MCP协议把n8n完整的API交给Claude Desktop、Claude Code、Cursor或Windsurf,你只要在聊天框里用自然语言描述需求,agent就在后台自动创建节点、连接分支、配置认证并激活流程。已有的workflow它也能检查、调试和实时改参数。
@bkdgiffug [Claude Code]
https://x.com/bkdgiffug/status/2097748118330904749
Auto-Company把多个AI agent组成一个「虚拟公司」,自己做产品讨论、写代码、部署和营销,循环是唤醒、组队、执行、更新记忆、休眠、下一轮。支持Claude Code和Codex,macOS和Windows的WSL都能跑,还有本地Dashboard看进度和成本。它自己带的警告是对的:持续运行会消耗API额度,自动化程度越高,越要提前把权限和安全限制做好。
@Ryrenz [Claude Code]
https://x.com/Ryrenz/status/2097696535525888157
统一后台这件事,OpenHands的Agent Canvas给了答案,仓库已经8.7万星。以前同时用几个编程agent是什么体验:这个终端跑Claude Code,那个终端跑Codex,还有一个在服务器上,谁跑到哪一步全靠自己翻窗口,跑完了也没人通知你。Agent Canvas默认在本地跑、开箱自带开源的OpenHands agent,也能接别的后端——Docker容器里的、虚拟机里的、公司内网的、甚至云上的,只要认ACP协议。更省事的是自动化那块:接上Slack、GitHub、Linear、Notion之后,agent可以按计划或按事件自己触发。项目自己标着还是beta,别急着搬上生产。
@FaztTech [Claude Code]
https://x.com/FaztTech/status/2097734779273691170
如果你同时跑几个终端agent,最后那个把它们粘起来的胶水就是你自己:从一个那儿复制计划,讲给另一个听,再手动检查哪些活干了一半。Traycer坐在中间:你只跟一个你喜欢的agent说话,它出计划,Traycer把各阶段分派到你其他账号上去执行,Claude Code、Codex、Cursor和OpenCode都是原生支持,全在同一个workspace里。跑完之后它拿改动对照计划,告诉你缺了什么、有没有哪里被弄坏了。跨模型跨供应商共享记忆,所以任务中途换模型不断线;agent之间可以互相要review、通过各自的worktree传活儿;每个任务有自己的文件系统、产物和历史。
@lukeburgis [OpenClaw]
https://x.com/lukeburgis/status/2097496109312553174
在这波个人agent发布潮里,来自重度用户的一个反向砝码。他把自己的OpenClaw定制了九个月,说从Instinct到各种Grok bot,没有一个能接近——因为那些都是开箱即用的产品,不是模型无关的,是被商品化的,相对于他建的东西限制严重。他最后是在诚恳发问「有没有人的体验不一样」,这也是持这种立场时该有的姿态。
@Naaackers [OpenClaw]
https://x.com/Naaackers/status/2097488642231193972
四个月前他第一次装上OpenClaw,从那以后每天都在用,一分钱没赚到。而他说它彻底改变了他的商业生活。搭配一台AMD Strix Halo 395的Nimo PC当本地机器。这是整个feed里最诚实的ROI陈述之一:完全没有营收归因,而他不会放弃它。
@RealDanRyland [OpenClaw]
https://x.com/RealDanRyland/status/2097628715412803773
他最高频的那个工作流,跟代码没关系。看到X上一篇好文章,复制链接,通过Telegram丢给自己的OpenClaw,它去读、总结,并且判断这条跟他的「第二大脑」仓库里已有内容的相关性。他自己给出的结论就是产品需求:这东西应该做成Chrome扩展。
@giovannicintolo [OpenClaw]
https://x.com/giovannicintolo/status/2097680811646435410
他们把WordPress的权限交给了OpenClaw。Novamira让agent从OpenClaw能跑的任何通道去管理你的开发站点,演示是在Telegram上现场跑的。值得记一笔的原因是:这恰恰是那批托管型个人agent产品目前还弱的形状——不是跟你聊你的站点,而是从你本来就待着的那个聊天软件里,对它有写权限。
@ColinGardiner [OpenClaw]
https://x.com/ColinGardiner/status/2097678942962368711
他把所有新出的个人agent都试了一遍,最触动他的是这些东西的锁定效应有多低。把东西从OpenClaw搬到Grok Bot再搬回来一次、并且把一切模块化之后,他现在几乎可以在任何一家之间无缝迁移,代价只是花点时间重新接服务。他最后搬回OpenClaw的原因很具体:能给不同应用场景用不同模型,这是优势。他也注意到几乎没人问个人agent底下跑的是什么模型,他觉得这有问题。他的预测是:单人使用的个人agent很难建立网络效应,所以增长方式就是每一版都比竞品上一版好一百倍,像模型大战那样蛙跳。
@0xTyllen [OpenClaw]
https://x.com/0xTyllen/status/2097725786229014654
OpenClaw刚出来的头几周,他就疯狂地把它塞进公司所有系统里,理由是:如果我们没有用AI来干活,那我们就没有在以自己能达到的产能工作。六七个月过去,公司大量工作已经流经他们自己拥有的AI agent。他现在的开放问题,也是所有处在这个位置的团队都要面对的:把你自己控制的agent全拔掉、换成别人托管的产品,理由到底是什么。
@openclaw_lab [OpenClaw]
https://x.com/openclaw_lab/status/2097483848128794707
一个具体且可复现的缺陷,值得标出来。任务很简单:把一篇文章翻译成另一种语言,发布到他自己的平台上。OpenClaw以版权问题为由拒绝执行。Hermes用同样的模型毫无障碍地做完了。他去找可以改的system prompt,什么相关的都没找到。他能接受OpenClaw拒绝使用聊天里粘贴的API key,但这个版权拒绝根本没有解法,而且只有它一个agent是这种行为。
@andrew_schoff [OpenClaw]
https://x.com/andrew_schoff/status/2097728870237548902
真实用过之后,各家agent各自落在哪里,他分得很干净。Muse他觉得快、干净、舒服、安全,打算更多用在个人的、不太复杂的任务上。复杂活儿交给GPT、Claude甚至grokbot,基本是在电脑上而不是手机上,而且主要是工作。Instinct概念他喜欢,但用起来笨重、慢、不稳定,他已经把这部分活动全搬到Muse上了。OpenClaw他压根没用过,因为从来没觉得安全、而且太复杂——这正是需求侧版本的、每个OpenClaw重度用户对新产品的抱怨的镜像。
@martinvars [OpenClaw]
https://x.com/martinvars/status/2097788298399814135
整波个人agent浪潮里,第一手经历写得最完整的一条,每一个他都用过。OpenClaw开的头:跑在你自己的机器上,通过Telegram或WhatsApp回你。他当时立刻下载,花了好几个小时在Claude终端里给它编程。它证明了这个概念,然后就停在那儿了——一个给极客的产品,灵活、要求高、难维护。接着是Hermes,同样的哲学,稍微好上手一点。Claude Cowork往前走了一步:没那么极客、更可靠,文件处理和后台工作都不错,代价是没有开源项目那么灵活。他对最终格局的总结是:Grok Bot是你工作上的团队,Muse是你个人生活里的办公室主任。
@FredaDuan [OpenClaw]
https://x.com/FredaDuan/status/2097725146354045411
来自一个用过并且还在用大部分这些产品的人,问题问得很对:今年早些时候大家搭的那些Claw后来怎么了,为什么Instinct和Muse现在才有了牵引力,为什么OpenClaw之后要等六到九个月才冒出这一批个人agent,以及如果GPT和Claude拿到支付、凭证和更好的computer use,它们是不是就直接变成个人agent了。她收集到的几个说法值得记:OpenClaw的热度退去,一部分是因为大家日常任务又回到了GPT和Claude——更好的模型胜过端到端执行;很多生产力型的Claw,比如每日播客摘要、各种监控,做得并不够好;而computer use可能刚刚跨过了可靠性的阈值。
@sonicdr1p [Claude Code]
https://x.com/sonicdr1p/status/2097638136763339204
大部分人还在像2019年那样守着一个终端窗口。这条22分钟讲解里值得偷的几招:worktrees让你在同一个仓库的不同分支上同时跑独立的Claude会话,等于并行造三个东西,而不是干等一条线性会话跑完再开下一个。fork一个会话能从完全同一个节点分出两种做法,不用把上下文重讲一遍。remote control让你之前踢出去的任务,可以在手机上看进度。而那个最无聊、却安静地最重要的一条,依然是老老实实写一份真正的CLAUDE.md——这是「每个会话都重新学一遍你的代码库」和「一进来就懂你的项目」之间的区别。
@yungalgorithm [Claude Code]
https://x.com/yungalgorithm/status/2097727448079368671
一副五十年前的卡牌,可能是编码agent最好的提示技巧之一。Brian Eno的Oblique Strategies是一副写满奇怪指令的牌,本来是设计给艺术家打破创作死胡同用的,而它跟Codex、Claude Code这类harness在会话陷入循环时的处境,意外地对得上。
@DivyanshT91162 [Claude Code]
https://x.com/DivyanshT91162/status/2097682245616316501
一份基于Karpathy对LLM编码观察写成的CLAUDE.md,出发点是:不要让agent「更用力地写代码」,要让它在写之前更好地想。四条原则。想清楚再写:说出假设、把歧义摆到台面上、给出取舍、真的困惑就问,不许闷头猜。简单优先:不做投机性功能,200行能变50行就变50行。外科手术式改动:只碰任务要求的地方,不顺手重构,不改自己没看懂的代码。目标驱动执行:把含糊的指令翻译成可衡量的成功标准,所以「修这个bug」变成「用一个测试复现它、修好它、验证它通过」。
@kageyorozu [Claude Code]
https://x.com/kageyorozu/status/2097525601901097247
一个完全通过Claude Code发帖的账号,零主动回复,收到的回复也全部无视,彻底无人值守,而它还在持续涨。这条记在这里是作为「无人值守的分发实际长什么样」的一个数据点,不是当建议。
@JohnsGoated [Claude Code]
https://x.com/JohnsGoated/status/2097747120564375919
一个mod作者在纠结要不要把自己的NBA 2K27成果放进每年20美元的Patreon——尽管他之前说过不会藏私。他的理由是成本对话里最诚实的那个版本:这个项目跑完烧了几百万token,Claude Code并不便宜,而外面有公司为类似的东西一个月收七美元甚至更多。
@joanathanlmc [Claude Code]
https://x.com/joanathanlmc/status/2097475074425274779
他在融资,被一个问题问烦了:「这东西你用Claude Code不就能做了吗」——他说这是懒惰的投资人问题。他的反驳是:普通人讨厌软件。Claude Code上线十八个月了,全世界真正在用的还不到0.5%。你曾经vibe code出一个紫色网站,不代表所有人都会。人们忙着带熊孩子、忙着升职、忙着控制饮食,软件从来都不是优先级。
@stretchcloud [Claude Code]
https://x.com/stretchcloud/status/2097769509176135691
关于agent质量的进步到底来自哪里,这条讲得很好:编码agent的产出和工程师真正敢交付的东西之间的差距,是靠skill在收窄,而不是靠更好的模型。diagram-design一天之内冲过1000颗GitHub星,做的事是把38种图表能力注入Claude Code、Codex、Factory Droid和Pi,输出纯HTML和SVG,不需要构建环境也没有外部依赖。跟Mermaid的对比才是重点:Mermaid能出图,但一眼就是AI生成的——厚重阴影、排版别扭;而这个出的是出版级质量、用你自己的品牌色,甚至能从你网站上把色板抽出来用。它还能把已有的Mermaid源重画一遍,这是一条真实的迁移路径。
🗣 用户心声
用户心声
周额度本身已经变成了产品。@matthewmillerai 从「一个月200美元、从不想额度」变成「一千多、每天撞墙」,他管这叫跑步机而不是进步。@bridgemindai 每月1100美元养着三个ChatGPT Pro账号加Claude Max加SuperGrok Heavy,还指出Astra能在四小时内吃掉整整一周的Pro用量。@Ananth7e 在倒数Claude Code周额度加成被砍17%的日子,@making 则已经提前开了10美元的OpenCode订阅来分流。整体情绪主调不是抱怨,是做预算。
Plan模式并不等于真的在做计划。@usgraphics 想要一个Claude Code的「讨论模式」,因为这东西总是太急着动手,连在plan模式里都一样。@Da7_Tech 干脆围绕同一个失败造了一整套带关卡的skill——被跳过的问题被当成默认同意、抽查一个样本被当成全部完成。这是同一个诉求从两个方向被提出来。
「汇报」是一等公民的功能需求,不是锦上添花。@connect24h 那条以及 i-have-adhd 这个skill在Hacker News上的反响说明了这个不满有多普遍:AI几秒钟写出的解释,人类要花好几分钟把答案挖回来。@GitHub_Daily 的Open Steps打的是非工程师那个版本——commit哈希加行话不叫工作汇报。
在个人agent这条线上,安装复杂度就是真正的产品分界线。@sytaylor 说得很准:OpenClaw是持续的活儿但你拿到完整控制权,对重度用户极好,而对普通人来说九成以上的任务仍然不够可靠。@andrew_schoff 干脆连试都没试,因为从来没觉得安全、而且太复杂。@Otodidakt_20 贡献了段子版本:现在他需要一个私人助理,专门帮他跟上这些私人助理。
跨agent的上下文交接持续以「未被满足的需求」的形态浮出来。@FaztTech 直接点破:同时跑几个终端agent时,它们之间的胶水就是你。@DanKornas、@Ryrenz 和 @socialwithaayan 各自在建或记录不同的答案,@kevskgs 则认为个人harness的构建这件事被严重低估。那个显而易见的东西,还没人做出来。
周额度本身已经变成了产品。@matthewmillerai 从「一个月200美元、从不想额度」变成「一千多、每天撞墙」,他管这叫跑步机而不是进步。@bridgemindai 每月1100美元养着三个ChatGPT Pro账号加Claude Max加SuperGrok Heavy,还指出Astra能在四小时内吃掉整整一周的Pro用量。@Ananth7e 在倒数Claude Code周额度加成被砍17%的日子,@making 则已经提前开了10美元的OpenCode订阅来分流。整体情绪主调不是抱怨,是做预算。
Plan模式并不等于真的在做计划。@usgraphics 想要一个Claude Code的「讨论模式」,因为这东西总是太急着动手,连在plan模式里都一样。@Da7_Tech 干脆围绕同一个失败造了一整套带关卡的skill——被跳过的问题被当成默认同意、抽查一个样本被当成全部完成。这是同一个诉求从两个方向被提出来。
「汇报」是一等公民的功能需求,不是锦上添花。@connect24h 那条以及 i-have-adhd 这个skill在Hacker News上的反响说明了这个不满有多普遍:AI几秒钟写出的解释,人类要花好几分钟把答案挖回来。@GitHub_Daily 的Open Steps打的是非工程师那个版本——commit哈希加行话不叫工作汇报。
在个人agent这条线上,安装复杂度就是真正的产品分界线。@sytaylor 说得很准:OpenClaw是持续的活儿但你拿到完整控制权,对重度用户极好,而对普通人来说九成以上的任务仍然不够可靠。@andrew_schoff 干脆连试都没试,因为从来没觉得安全、而且太复杂。@Otodidakt_20 贡献了段子版本:现在他需要一个私人助理,专门帮他跟上这些私人助理。
跨agent的上下文交接持续以「未被满足的需求」的形态浮出来。@FaztTech 直接点破:同时跑几个终端agent时,它们之间的胶水就是你。@DanKornas、@Ryrenz 和 @socialwithaayan 各自在建或记录不同的答案,@kevskgs 则认为个人harness的构建这件事被严重低估。那个显而易见的东西,还没人做出来。
📡 生态产品雷达
生态产品雷达
Codex — 全天被提及最多的替代品,也是人流的方向。被反复提到的点:后台computer use、更好的桌面App和远程控制、更强的compaction,以及一条命令把整套Claude Code配置导入过来。
GPT-6 Astra — 本周大部分迁移背后的模型,因computer use被夸,因吃token被骂。多位用户的做法是升级到它,而不是默认用它。
Fable 5.1 / Opus 5 — 同一批对比里Claude Code这一侧,被反复形容为「给的比你要的多,花的也比你想的多」。
OpenClaw — 依然是所有人衡量个人agent的参照实现,也依然是普通用户装不起来的那个。
Hermes — 自持agent路线上稳定的第二选择,而且值得注意:OpenClaw拒绝的那个翻译任务,它没拒绝。
Muse / Instinct / Grok Bot — 托管型个人agent这一波,被评判的主要不是能力,而是安装成本和信任。
Cursor — 对于不想挑harness的人,依然是多模型的默认选项。
MCP — 已经被当成默认基础设施,今天出现在广告抓取、n8n工作流编写、视频分析和市场准入里。
OpenCode — 预算泄压阀,反复跟便宜的contributor档模型一起被点名。
Higgsfield — 创意侧首选连接器,在品牌campaign和网站构建两个案例里都出现了。
Devin / Traycer / OpenHands — 编排层,各自解决「同时跑很多agent」的不同一块。
Codex — 全天被提及最多的替代品,也是人流的方向。被反复提到的点:后台computer use、更好的桌面App和远程控制、更强的compaction,以及一条命令把整套Claude Code配置导入过来。
GPT-6 Astra — 本周大部分迁移背后的模型,因computer use被夸,因吃token被骂。多位用户的做法是升级到它,而不是默认用它。
Fable 5.1 / Opus 5 — 同一批对比里Claude Code这一侧,被反复形容为「给的比你要的多,花的也比你想的多」。
OpenClaw — 依然是所有人衡量个人agent的参照实现,也依然是普通用户装不起来的那个。
Hermes — 自持agent路线上稳定的第二选择,而且值得注意:OpenClaw拒绝的那个翻译任务,它没拒绝。
Muse / Instinct / Grok Bot — 托管型个人agent这一波,被评判的主要不是能力,而是安装成本和信任。
Cursor — 对于不想挑harness的人,依然是多模型的默认选项。
MCP — 已经被当成默认基础设施,今天出现在广告抓取、n8n工作流编写、视频分析和市场准入里。
OpenCode — 预算泄压阀,反复跟便宜的contributor档模型一起被点名。
Higgsfield — 创意侧首选连接器,在品牌campaign和网站构建两个案例里都出现了。
Devin / Traycer / OpenHands — 编排层,各自解决「同时跑很多agent」的不同一块。
评论