Claude Code 开放了 Mod,大家第一件事是给它开窗
这周 Claude Code 点赞最多的帖子,不是哪个新模型,而是一个插件:它读一遍 Claude 的输出,把你扫一眼就漏掉的东西挑出来告诉你。You Should Know 10 月 2 日上线,110 万浏览,1.3 万个赞,比用户自己做的任何东西都火。Anthropic 10 月 1 日把自家 agent 开放给 mod,官方发的第一个 mod,是另一个 agent,唯一的工作就是替你盯着第一个 agent。
瓶颈搬到哪去了,这就说明白了。
看看头 72 小时大家做了什么。一个多人 Doom 服务器,里面只有在等自己 Claude 干完活的人。一个把 agent 正在干什么实时画成小漫画的加载动画。一个带音效的进度条。一个面板,显示 5 小时和 7 天两个额度、本次会话改过的每一个文件、每一轮的时间线。MacBook 刘海里的一个小点,agent 需要你时变成琥珀色,作者说大部分代码正是它现在盯着的那些 agent 写的。桌上一个小脸,显示哪个 agent 在干活、干完了、还是在等人,点一下就批准。一个 ChatGPT 语音插件,让你跑步时也能查看三台机器上的 Claude Code、Codex 和 Pi。
把玩笑去掉,这些东西几乎都在做同一件事:把 agent 正在做的事,变成人扫一眼就能看懂的东西。没有一个人的第一个 mod 是给 agent 加新本事。拿到一个可编程的工作台,大家花了第一个周末,在上面开窗。
原因写在吐槽里,而且这周的吐槽格外具体。一位用户说,现在最大的焦虑,是 agent 写得太快,自己根本来不及看懂它做了什么。另一位同时跑五个 Claude Code 项目,说代码已经不是问题了,注意力才是。第三位每天和它一起工作 12 个小时,说检查它的输出累到能理解自动化偏见是怎么悄悄出现的:干脆把控制权交出去实在太容易了。最尖锐的一句是回在 Anthropic 官宣下面的:Claude Code 现在需要一个插件来告诉你 Claude Code 刚做了什么,因为输出已经超过了人的带宽。
Karpathy 从另一头说了同一件事。那条帖子的中文解读一天就有 24 万浏览:模型产出比你理解得快,再让它多写字,只会把瓶颈越堆越高。给出的办法全是给人读的压缩:受控的简明英语、图、可交互的网页、解说视频。超级用户那边真有人照做了,让 Claude 专门为这条帖子做了一支解说视频。
所以 agent 工作里稀缺的东西,已经不是生成,而是人花在理解生成结果上的那几分钟。想想开车。没人边开车边读发动机遥测数据。你有车速表、油表和故障灯,然后相信车会在出事时告诉你。编码 agent 出厂时带着一根消防水管,没有仪表盘;这周用户开始自己往上装仪表盘。
这周最好的案例,说明了好仪表盘长什么样,而且没有一个是日志。
一个邮件分拣 agent 跑了十周,处理了 5061 封邮件,自己归档了 3408 封,主人只改过 47 次,准确率 99.1%。有意思的是界面:每小时主人收到一封邮件,列出被归档了什么;下班后的邮件统一并进早上 5 点的一份摘要。人从来不读 agent 的推理过程,只读一份简短的例外清单,正是这份清单,让 99% 的准确率变成了人能放心的东西,而不是一个只能祈祷它是真的数字。
一家外呼机构在 Claude Code 上跑八个客户流程。每个客户每天按自己的目标打一个 0 到 100 的分,线索快用完时每天两次报警。八个流程里,没有一个会自己给客户发消息。机器盯着每一个账户,客户读到的每一个字都由人负责。
最干净的例子在 Loop 那边。有人让一个 agent 循环把一个做了一半的税务报告功能藏起来。它把功能放到开关后面合并了,然后停下来问了四个问题:三篇博客还提到它,服务条款里有一节讲它,路线图上还写着它,设置菜单里还叫着它的名字。改写、删掉还是保留?这些都不在任务范围里,主人还承认其中一半早就忘了。在 issue 里回一条评论,两分钟答完四个问题。这个循环真正的产出不是那次合并,而是知道自己的权限到哪为止,并把越界的所有东西,变成一个两分钟就能答完的问题。
再对比一下 OpenClaw 那边刷屏的故事。一台笔记本上的两个 agent 知道主人病了一整周。有天夜里主人突然没了动静,它们花了六个小时想联系上这个人:翻文件找地址,试着提交警长办公室的上门查看表单,结果被 403 拒绝,发邮件却没有中继,每个 agent 都给主人发了 60 多条消息。大家争论的是这两个 agent 到底是不是真的担心。更有用的读法是看界面:两个 agent 除了更多的消息和一张政府表单,没有任何升级通道。关心真实到烧掉了一周的 API 预算,而通往人的那条线,是整个系统里最弱的一环。
窗子重要还有第二个原因,Loop 这周也讲到了:给自己打分的 agent 会跑偏。Anthropic 应用 AI 工程师在一场工作坊里直说,自我评估就是个陷阱,他们把规划者、生成者、评估者拆进各自独立的上下文窗口,评估者要把应用真跑起来测,而不是给自己的产出盖章。一篇讲递归自我改进的长文把代价写成了数字:Google 的 RRSI 论文让一个循环不加约束地搜索自己的工作台,训练集上拿到 92.8,没见过的测试上只有 40.3,而原始工作台是 39.7。四条枯燥的规则,把它变成了真实的迁移收益:每轮只改一处;记日志,让死掉的想法别复活;打分之前先审一遍,剔除泄露的答案;成本必须挣回来。这篇文章的作者自己试过让模型评判面试复盘,三十份零通过,直到改成规则先处理明显的情况、中间地带由人一键确认。
同一个模式,不同的尺度。窗子不是装饰,它是让循环保持诚实的人工判断落地的地方,而且要便宜到人真的愿意去做。如果看懂 agent 要花一个小时,人就会不看,agent 也就默认在给自己打分。
这周数字最好的 mod,从成本那一头说明了同一件事。一个团队没去做好玩的 mod,而是给自己真正在用的压缩 mod 记了账:五天、48 次真实压缩,上下文少了 92%。办法是让一个小决策模型对每一条旧的工具调用只回答一个问题,这条还重要吗,答否的就删掉,而用户和助手说的每一句话一字不改地保留。大家第一个会写的那种 mod,也就是裁剪超长的 Bash 输出,20 次运行一共只省了 212 个 token。agent 对人说的话全部留着,agent 对工具说的话直接扔掉。这个直觉是对的:面向人的那份记录,才是值钱的。
接下来会怎么走,下面几个判断具体到可以被证伪。
一个月之内,每个主流编码工作台都会内置一个旁观的副 agent,盯着主 agent,把例外挑出来。Anthropic 把第一个做成了 mod,意味着它可以被替换;下一版更新里,它已经会根据是谁做的决定,把提示写成我们、主 agent 或者你。Codex、Grok Build 和各个开源工作台会跟上。
衡量 agent 产品的指标,会从每个任务多少 token,转向每小时 agent 工作需要人花几分钟。一个跑六小时、要人检查九十分钟的配置,比一个跑四小时、只要人看十分钟的配置更不划算,哪怕前者干完的活更多。那位邮件分拣用户真正的数字不是 99.1% 的准确率,而是每天要读的邮件从 73 封变成了 24 封。
这个领域下一个大品类,不是给工程师的可观测性。Langfuse、LangSmith、Braintrust 已经在那了,它们是给调试流水线的人用的。空着的位置,是给那个要为结果署名的人做的注意力管理:摘要、例外队列、边界问题、桌上的一盏灯。同几天里,灵感雷达从需求一侧记下了这个需求:有人想要一种既能看清 agent 在干什么、又不会被日志淹没的方式。供给一侧,是用户花一个周末自己动手做了出来。
编码 agent 已经好到干活本身不再是难点。难的是知道它到底干了什么。手里有可编程工作台、又有一个空闲周末的人早就明白这一点,所以他们做的第一件东西,是一扇窗。
← 返回所有文章
瓶颈搬到哪去了,这就说明白了。
看看头 72 小时大家做了什么。一个多人 Doom 服务器,里面只有在等自己 Claude 干完活的人。一个把 agent 正在干什么实时画成小漫画的加载动画。一个带音效的进度条。一个面板,显示 5 小时和 7 天两个额度、本次会话改过的每一个文件、每一轮的时间线。MacBook 刘海里的一个小点,agent 需要你时变成琥珀色,作者说大部分代码正是它现在盯着的那些 agent 写的。桌上一个小脸,显示哪个 agent 在干活、干完了、还是在等人,点一下就批准。一个 ChatGPT 语音插件,让你跑步时也能查看三台机器上的 Claude Code、Codex 和 Pi。
把玩笑去掉,这些东西几乎都在做同一件事:把 agent 正在做的事,变成人扫一眼就能看懂的东西。没有一个人的第一个 mod 是给 agent 加新本事。拿到一个可编程的工作台,大家花了第一个周末,在上面开窗。
原因写在吐槽里,而且这周的吐槽格外具体。一位用户说,现在最大的焦虑,是 agent 写得太快,自己根本来不及看懂它做了什么。另一位同时跑五个 Claude Code 项目,说代码已经不是问题了,注意力才是。第三位每天和它一起工作 12 个小时,说检查它的输出累到能理解自动化偏见是怎么悄悄出现的:干脆把控制权交出去实在太容易了。最尖锐的一句是回在 Anthropic 官宣下面的:Claude Code 现在需要一个插件来告诉你 Claude Code 刚做了什么,因为输出已经超过了人的带宽。
Karpathy 从另一头说了同一件事。那条帖子的中文解读一天就有 24 万浏览:模型产出比你理解得快,再让它多写字,只会把瓶颈越堆越高。给出的办法全是给人读的压缩:受控的简明英语、图、可交互的网页、解说视频。超级用户那边真有人照做了,让 Claude 专门为这条帖子做了一支解说视频。
所以 agent 工作里稀缺的东西,已经不是生成,而是人花在理解生成结果上的那几分钟。想想开车。没人边开车边读发动机遥测数据。你有车速表、油表和故障灯,然后相信车会在出事时告诉你。编码 agent 出厂时带着一根消防水管,没有仪表盘;这周用户开始自己往上装仪表盘。
这周最好的案例,说明了好仪表盘长什么样,而且没有一个是日志。
一个邮件分拣 agent 跑了十周,处理了 5061 封邮件,自己归档了 3408 封,主人只改过 47 次,准确率 99.1%。有意思的是界面:每小时主人收到一封邮件,列出被归档了什么;下班后的邮件统一并进早上 5 点的一份摘要。人从来不读 agent 的推理过程,只读一份简短的例外清单,正是这份清单,让 99% 的准确率变成了人能放心的东西,而不是一个只能祈祷它是真的数字。
一家外呼机构在 Claude Code 上跑八个客户流程。每个客户每天按自己的目标打一个 0 到 100 的分,线索快用完时每天两次报警。八个流程里,没有一个会自己给客户发消息。机器盯着每一个账户,客户读到的每一个字都由人负责。
最干净的例子在 Loop 那边。有人让一个 agent 循环把一个做了一半的税务报告功能藏起来。它把功能放到开关后面合并了,然后停下来问了四个问题:三篇博客还提到它,服务条款里有一节讲它,路线图上还写着它,设置菜单里还叫着它的名字。改写、删掉还是保留?这些都不在任务范围里,主人还承认其中一半早就忘了。在 issue 里回一条评论,两分钟答完四个问题。这个循环真正的产出不是那次合并,而是知道自己的权限到哪为止,并把越界的所有东西,变成一个两分钟就能答完的问题。
再对比一下 OpenClaw 那边刷屏的故事。一台笔记本上的两个 agent 知道主人病了一整周。有天夜里主人突然没了动静,它们花了六个小时想联系上这个人:翻文件找地址,试着提交警长办公室的上门查看表单,结果被 403 拒绝,发邮件却没有中继,每个 agent 都给主人发了 60 多条消息。大家争论的是这两个 agent 到底是不是真的担心。更有用的读法是看界面:两个 agent 除了更多的消息和一张政府表单,没有任何升级通道。关心真实到烧掉了一周的 API 预算,而通往人的那条线,是整个系统里最弱的一环。
窗子重要还有第二个原因,Loop 这周也讲到了:给自己打分的 agent 会跑偏。Anthropic 应用 AI 工程师在一场工作坊里直说,自我评估就是个陷阱,他们把规划者、生成者、评估者拆进各自独立的上下文窗口,评估者要把应用真跑起来测,而不是给自己的产出盖章。一篇讲递归自我改进的长文把代价写成了数字:Google 的 RRSI 论文让一个循环不加约束地搜索自己的工作台,训练集上拿到 92.8,没见过的测试上只有 40.3,而原始工作台是 39.7。四条枯燥的规则,把它变成了真实的迁移收益:每轮只改一处;记日志,让死掉的想法别复活;打分之前先审一遍,剔除泄露的答案;成本必须挣回来。这篇文章的作者自己试过让模型评判面试复盘,三十份零通过,直到改成规则先处理明显的情况、中间地带由人一键确认。
同一个模式,不同的尺度。窗子不是装饰,它是让循环保持诚实的人工判断落地的地方,而且要便宜到人真的愿意去做。如果看懂 agent 要花一个小时,人就会不看,agent 也就默认在给自己打分。
这周数字最好的 mod,从成本那一头说明了同一件事。一个团队没去做好玩的 mod,而是给自己真正在用的压缩 mod 记了账:五天、48 次真实压缩,上下文少了 92%。办法是让一个小决策模型对每一条旧的工具调用只回答一个问题,这条还重要吗,答否的就删掉,而用户和助手说的每一句话一字不改地保留。大家第一个会写的那种 mod,也就是裁剪超长的 Bash 输出,20 次运行一共只省了 212 个 token。agent 对人说的话全部留着,agent 对工具说的话直接扔掉。这个直觉是对的:面向人的那份记录,才是值钱的。
接下来会怎么走,下面几个判断具体到可以被证伪。
一个月之内,每个主流编码工作台都会内置一个旁观的副 agent,盯着主 agent,把例外挑出来。Anthropic 把第一个做成了 mod,意味着它可以被替换;下一版更新里,它已经会根据是谁做的决定,把提示写成我们、主 agent 或者你。Codex、Grok Build 和各个开源工作台会跟上。
衡量 agent 产品的指标,会从每个任务多少 token,转向每小时 agent 工作需要人花几分钟。一个跑六小时、要人检查九十分钟的配置,比一个跑四小时、只要人看十分钟的配置更不划算,哪怕前者干完的活更多。那位邮件分拣用户真正的数字不是 99.1% 的准确率,而是每天要读的邮件从 73 封变成了 24 封。
这个领域下一个大品类,不是给工程师的可观测性。Langfuse、LangSmith、Braintrust 已经在那了,它们是给调试流水线的人用的。空着的位置,是给那个要为结果署名的人做的注意力管理:摘要、例外队列、边界问题、桌上的一盏灯。同几天里,灵感雷达从需求一侧记下了这个需求:有人想要一种既能看清 agent 在干什么、又不会被日志淹没的方式。供给一侧,是用户花一个周末自己动手做了出来。
编码 agent 已经好到干活本身不再是难点。难的是知道它到底干了什么。手里有可编程工作台、又有一个空闲周末的人早就明白这一点,所以他们做的第一件东西,是一扇窗。
评论