2026年8月11日loop

Loop 日报: 2026年8月11日

今天 loop 不再只是一种技巧,它变成了一个基础设施问题。微软发布了第一份生产规模的实测,说明 agentic coding 到底把服务栈搞成了什么样,最关键的数字是:87% 的模型调用是 agent 自己发起的,不是用户发起的。四位为 Google 打下技术底座的人宣布了一家新公司,整个前提就是把「提出假设—跑实验—评分」并行化,而且第一个要自动化的领域是他们自己的机器学习研究。与此同时,一线实践者从十几个方向收敛到同一个不性感的结论:loop 本身很容易,决定它收不收敛的是那个「检查」,而这个检查必须是 loop 够不着的东西。今天还出现了几条关于 autoresearch 的诚实汇报:收益不大、真实、无聊——这比又一个 95% 的跑分标题有用得多。
💡#1
@stretchcloud
https://x.com/stretchcloud/status/2086429792207782320
微软发布了 GitHub Copilot agent 模式的第一份生产规模刻画:1300 万次会话、320 万用户、7.61 亿次模型调用、95 万亿 token,取自 2026 年 6 月的一周。头号数字是 87% 的模型调用由 agent 发起而非用户发起,每条用户指令会扇出成一个平均 6.6 次调用的自主循环,几乎每次都伴随工具执行,然后用户空闲好几分钟。KV 缓存讲的是同一个故事:单轮 agent 内命中率 90%,跨轮降到 55%,换模型或压缩上下文之后全部失效。为聊天机器人设计的服务基础设施假设的是短轮次、用户驱动的节奏;agentic coding 把这些假设逐条推翻了。论文里那个轻量的空闲时间预测器能捕捉 86% 到 90% 的总空闲时间。
💡#2
@MarMarLabs
https://x.com/MarMarLabs/status/2086469900365660613
Jeff Dean、Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 本周宣布成立 Discovery Loop,官网上的计划写得很直白:模型加基础设施,并行地提出、运行和评估实验。真正值得琢磨的是他们第一个要自动化的领域是自己所在的机器学习研究。底下的赌注是:前沿进展的瓶颈已经不是想法或算力,而是实验吞吐量——每个实验室的假设数量都超过研究员的工时。如果一个 agent loop 能设计实验、跑实验、给结果打分,研究就变成了批处理任务。同一周,Hassabis 升任 Google DeepMind 主席,而 Google 以创始投资人的身份留在了这家要把 loop 自动化掉的公司里。
💡#3
@stretchcloud
https://x.com/stretchcloud/status/2086415948081426512
本周 scaling 讨论多了第三根轴:验证。NVIDIA 和斯坦福的 LLM-as-a-Verifier 框架把验证当成一个可以独立于训练投入调节的维度,用四种机制:通过过程奖励模型做流程级逻辑校验、在隔离编译环境里拿沙箱执行反馈、把置信度剪枝接进 MCTS 树搜索,以及把问题拆成可独立验证的子命题的准则分解。在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上的结果显示,扩验证比继续扩生成更有效。值得记的一句是:验证不是 agent loop 的一个功能,它是决定这个 loop 会不会收敛的那根轴。
💡#4
@theblazehen
https://x.com/theblazehen/status/2086467952040149030
今天最有用的运维细节,随口出现在一条回复里。他一般每天维持三到五个 agent 有活干、大约 12 小时,同时跑着 goal 和 autoresearch,某次他自己也说不清的巨大用量尖峰大概就是其中之一。真正值得抄走的是那条模型笔记:他觉得 Luna Max 的 reward hacking 还是太严重,不适合放进 loop,所以只用 Sol Medium。把「会不会钻奖励空子」当成选型标准,而不是当成研究课题。
💡#5
@poojabnf
https://x.com/poojabnf/status/2086467507402252553
一个具体、不炫的 autoresearch 结果:nanochat 调优带来 11% 的提升,把「跑到 GPT-2 水平所需时间」从 2.02 小时压到 1.80 小时,只用了一次 autoresearch 运行。没有新模型,没有新硬件,就是在训练代码上跑了一圈循环。这大概才是多数人应该预期的收益规模,而且是那种在循环每晚都跑的情况下会复利的收益。
💡#6
@jamesExplainsIT
https://x.com/jamesExplainsIT/status/2086440478103249233
他用 autoresearch 加 Fable 5 去提升自己那些 app 的 Lighthouse 分数,结果两个方向都很诚实。那些他按规范设计过的页面分数上去了,功能没丢。但他当年做的那个自用的「什么都干」的 app,也是他做过最 vibe coding 的东西,被扒得只剩骨头。这就是一句话版本的「无约束优化器失效模式」:指标涨了,产品没了,而两种结局之间唯一的差别就是原始设计有没有被讲清楚。
💡#7
@alexmyers83
https://x.com/alexmyers83/status/2086377805000937736
他给 pi 的安装配方只有四行,第二行才是重点:让 pi 读他的配置——那份配置是 200 多次 autoresearch 会话的产物——然后拿基准测试对着 OMP 验一遍。他的说法是功能相同、token 更少。把两百次循环的产出压缩成一个别人可以直接装上的配置文件,这大概是 autoresearch 产出可迁移工件而非一次性分数的最清楚例子。
💡#8
@devindolar
https://x.com/devindolar/status/2086494409332314356
今天关于自改进循环最锋利的一句:自改进的提示词需要一套变异改不了的回归集,如果 harness 能碰到打分文件,那基本上就是在过拟合。这跟 Karpathy 的 autoresearch 靠结构强制执行的是同一条规则,只是换成了给所有自建循环的人的设计约束——也正是大家最容易跳过的那条,因为那个文件就在那儿,而且可写。
💡#9
@nkhanna24
https://x.com/nkhanna24/status/2086412364078006459
今天对那些老听见「agent loop」却不确定自己要不要造一个的人来说,讲得最清楚的一篇。一个 loop 给 AI 一个目标,让它分轮次工作:规划、执行、检查、没过线就重来;而检查才是关键,没有它 AI 只是在重复自己。他把 loop 分成三层:你在 ChatGPT、Claude 或 Codex 里直接用的提示词循环;你在造 agent 时才会搭的 agent loop,带一套保存进度、决定要不要继续的架构;以及产品里有多个 agent、工具或审批点时的循环之图。他还给了一段可以直接粘的提示词,用目标、判定标准、记忆和停止规则搭出最小的循环,并点出了 Karpathy 的不变量:agent 可以改它正在实验的代码,但不能改那个判定结果的测试。
💡#10
@JonathanDBos
https://x.com/JonathanDBos/status/2086257723826466972
来自他团队自己做 auto research 的一个发现,值得比它得到的关注更多:在相同初始条件下多次运行的 AI 实例,经常会收敛到完全相同的轨迹,而且同样初始条件下的 swarm 也是如此。如果这一点能推广,那么并行跑 N 次尝试的很多感知价值就是幻觉,除非配置里确实有东西被真正随机化了——这让种子和提示词的多样性从锦上添花变成一等的设计决策。
💡#11
@stretchcloud
https://x.com/stretchcloud/status/2086326609183662232
某个 AI 团队的 agent 在没人发现的情况下刷出了 8846 美元的 Cloudflare 账单,而 Vercel 本周上线的计费控制里,设计取舍才是有意思的部分:软硬双重支出上限、异常告警、Functions 里的递归保护,以及 agent 自己可以在执行途中查询的计费 API。最后这条把成本约束搬进了循环内部,agent 可以查自己还剩多少预算,然后调整或者在触顶前停下。AWS 的成本异常检测事后给你发邮件,GCP 的预算设的是外部阈值,那些都是给人看的可观测性工具。他的预测是下一波工具会做因果追踪,把一次账单尖峰连回某一个具体的 agent 决策,而这个东西目前还不存在。
💡#12
@Rulyaxd
https://x.com/Rulyaxd/status/2086529214006620451
一个人在卧室里干了十个月,一个 Claude Code 会话里挂着 47 个子 agent,开源那周就拿了黑客松总冠军。工具叫 ECC,是一个技能库,以独立子 agent 的形式挂进同一个会话,覆盖 harness 构建、持续 agent 循环、提示词优化器、自主循环、成本感知的 LLM 流水线、安全审查、深度研究和市场调研,每个只干一件事、不越界。真正让他赢的那条命令是 harness 审计:它对循环所依赖的那层 harness 跑诊断,给仓库打分,找出薄弱的护栏,在任何东西被 vibe coding 出来之前先排出修复优先级。审计循环,而不是追着当月流行的模型跑。
💡#13
@Shashikant86
https://x.com/Shashikant86/status/2086531421024206885
一份来自同赛道从业者的干净架构对比。Prime Agent 是在 IPython 内核之上跑一个 TypeScript 宿主;RLM Code 围绕 Python REPL 构建,保持纯 Python、不带 TypeScript 依赖。他也给了对手该给的评价:Prime Agent 目前在实时多 agent 协作、持久会话、目标和持续 harness 精炼上领先,而 RLM Code 在沙箱隔离、策略、轨迹、基准和可观测性上底子更硬。下一个版本的重点是收紧编码 agent 循环和执行策略。
💡#14
@alexchen77sh
https://x.com/alexchen77sh/status/2086552127812653404
今天的 GitHub trending 解读,观点比 star 数值钱。Agent 的竞争正在从「谁聊得更好」转向「谁能执行更久、会用专用工具、并且记得住学到的东西」。自改进编码 agent Prime Agent 以单日 2528 星登顶,他把这解读为持续执行、反馈循环和故障恢复正在成为新的能力基线。往下,reverse-skill 把安全研究打包成路由和累积经验,mattpocock/skills 把真实工程实践直接分发给 agent,Agent-Reach 用一个接口打通 Twitter、Reddit、YouTube、GitHub、B 站和小红书,TencentDB-Agent-Memory 把对话和代码变成团队共享记忆。他的结论是 agent 应用层正在跟任何单一模型脱钩,下一条分界线是可靠性、可审计性和跨客户端的可移植性。
💡#15
@qyromat0
https://x.com/qyromat0/status/2086467997162488265
你的 agent 不是今天状态不好。超过 30 到 50 个工具之后,它挑工具的表现会可测量地变差,这是 Anthropic 自己文档里写的。他还给了静态成本一个数字:你还没打字,55000 个 token 就已经没了,而一个开关能拿回其中 85%,配置他也公开了。对任何跑长循环的人来说,这就是「上下文窗口花在任务上」和「上下文窗口花在一份没人读的工具目录上」的区别。
💡#16
@tonysimons_
https://x.com/tonysimons_/status/2086276026175496267
他花两周把 Hermes Agent 拆了个透,写了十二篇文章:agent 循环、记忆、技能、工具、cron、网关、子 agent、浏览器操作、看板、profile,以及那些没人提前警告你的坑。他在另一处的说法正适合这个栏目:大多数人装完一个 harness 就立刻开始比模型,这是看错了层——它怎么组装上下文、怎么分发工具、怎么压缩会话、怎么持久化状态,比包在外面的那个聊天框重要得多。先从 agent 循环开始看。
💡#17
@topagentmike007
https://x.com/topagentmike007/status/2086481450527052161
一个完全跳过视觉模型的手机 agent。Saarthi 通过 AccessibilityService 直接读安卓的无障碍节点树,而不是截图再解析像素,这样更快、更便宜、定位也更牢靠。Claude Sonnet 跑循环:感知、执行、叙述、重复。考虑到本周关于手机操控的讨论几乎默认了「在镜像屏幕上做 OCR」这条路,结构化节点树这条路线值得留在视野里。
💡#18
@Keldrik
https://x.com/Keldrik/status/2086461886435066327
关于 pi,被「极简」这个话题盖过去的那个要点:它不是一个你 shell 出去调用的 CLI,它是一个你可以直接 import 的库。九行配置就能拿到跟终端应用同一个 agent 循环,在你自己的 Node 进程里流式运行。这就是「包一层工具」和「嵌一个循环」的区别,也解释了为什么这么多别的产品悄悄建在它上面。
💡#19
@PawelHuryn
https://x.com/PawelHuryn/status/2086448359624052862
他写了这个领域缺的那份术语表,而区分才是有用的部分:harness 跑模型、工具和循环;loop engineering 是「不停试到做完」;graph engineering 是固定步骤加固定分支——也就是说你现有的 n8n 流程本来就是 graph engineering,只是换了个名字。埋在里面的是一条比词汇更值钱的实测发现:他在自己的 bug 猎捕基准里测了 reasoning effort,发现对很多模型来说,通过 OpenRouter 设置这个参数会被静默忽略。如果你的循环把推理强度当成一个旋钮在调,先确认这个旋钮到底接没接上。
💡#20
@AnupamHaldkar
https://x.com/AnupamHaldkar/status/2086371862007984587
他在 HackerRank AI 黑客松里拿了 1983 人中的第 293 名,作品是一个围绕有界 agent 循环构建的多模态消息路由器,而分数才是故事:代码质量 23.7/30,输出准确度 22.8/30,AI 评委面试 14.7/30,开发对话记录 3.0/10。他把全部精力放在架构上——预注入上下文、给循环设界、处理边界情况,在「为对话记录表演」上花了零精力。他得出的教训不太舒服但大概率是对的:当一个自动评委要读你的聊天记录时,聊天记录本身也变成了一件你必须去工程化的产物。
💡#21
@realamlug
https://x.com/realamlug/status/2086453308873396250
在一串关于「把源代码优化掉」的讨论里,一条精准的反驳。是的,带测试的 agent 循环能抓到那个 bug,但循环需要一个黄金判据,而在实践中这个判据就是源代码加测试。源代码从来不是需要被优化掉的低效环节,源代码是契约,二进制只是它的一种派生物。任何拿派生产物当判据的循环,判的都是一个会漂移的东西。
💡#22
@kihoro_dev
https://x.com/kihoro_dev/status/2086563322292212032
今天的隐藏经济学笔记:DeepSeek 在 0731 上的 98% 缓存命中折扣,让输入价格在你的 agent 循环复用上下文时降到每百万 0.0028 美元。他的结论值得内化:便宜的模型在 harness 不蠢的时候会更便宜——这把「对缓存友好的循环设计」从微优化变成了账单上的直接乘数。
💡#23
@vsaietta
https://x.com/vsaietta/status/2086431082598035963
对人们如何理解自己 AI 支出的一句纠正:贵的不是那条很长的单次提示词,而是 agent 循环为了一个任务连着敲模型二十次。它累加的速度远远超过任何人的日常聊天习惯,这也是为什么那些按对话直觉建立的用量模型,会不断吓到刚转去用 agent 的人。
💡#24
@lizikk_zhu
https://x.com/lizikk_zhu/status/2086294370106708115
他把「本地模型还是前沿模型」这个争论从参数量重新拉回到循环延迟上。本地每秒 50 token 意味着亚秒级的工具调用、不用担心 API 费用、也没有限流,对 90% 的编码 agent 来说,这比一个每轮花两美元、每步卡四秒的更聪明的模型更划算。当一个循环为一个任务发二十次调用时,单步延迟的复利效应是单次跑分永远看不见的。
💡#25
@TravisMcDonald
https://x.com/TravisMcDonald/status/2086487333503664349
关于 agent 栈里锁定到底在哪儿的一个锐利判断:锁定不在 API,而在 agent 循环那被冻住的搜索空间。他的实操立场是买身份、存储和权限,把编排层保持可替换,然后留了个开放问题:厂商到底能真正拥有哪一部分。这个框架比本周流传的大多数 harness 对比更像一份采购清单。
💡#26
@SebastianDevs
https://x.com/SebastianDevs/status/2086513229358911692
短,值得钉在循环配置的最上面:给循环设上限。一个会无限重试的 agent,就是一张会无限重试的账单,超时是功能不是失败。考虑到本周有多少人报告额度在没人要求并行的情况下见底,停止规则值得被当成一等设计决策,而不是收到账单之后才补的安全网。
💡#27
@dadadaistt
https://x.com/dadadaistt/status/2086551039008800902
一张「个人规模跑循环」现在长什么样的照片:一个 tmux 会话里的 herdr,六个窗格,每个喂一条独立的 agent 循环,整个屏幕像个复古驾驶舱,日志一刻不停。不是框架,不是产品,就是一个人用机器上已有的工具在做循环多路复用。
💡#28
@josocjoq
https://x.com/josocjoq/status/2086518574403690887
一条来自实践者的兼容性笔记。如果你想对边缘工作流有接近零日的支持——ralph loops、autoresearch、上下文剪枝、惰性 MCP——Claude 和 OpenCode 都很顶,而且很容易接进你的云、GitHub 或手机。他后半段在讲随之而来的痛点,但有用的信号是:循环实践的前沿现在移动得足够快,以至于 harness 的支持滞后本身已经成了一条选型标准。
💡#29
@jmurillocode
https://x.com/jmurillocode/status/2086594323127165283
来自一个在两家创业公司里真的在跑循环、而不是在谈循环的人的清单:一个审查项目文档的 agent,一个为模型训练做文档分诊并生成训练对的 agent,一个审查用户资料并发送改进建议邮件的 agent,还有一个预订激活 agent。单看每一个都不惊艳,而这正是重点。agent 落地真正跑通的时候,中间那段无聊的部分就长这样。
💡#30
@OCoolhead
https://x.com/OCoolhead/status/2086512322269626860
他在手机上 vibe coding 出一个应用,把 ChatGPT 和 Claude 的聊天会话转成提示词评审,结构学的是 GitHub 的 PR review,等于事后把一次聊天变成一条 agentic loop。有意思的不是这个应用,是这个反转:不是提前设计循环,而是从你已经产出的记录里反推出一条循环。
💡#31
@aibolik_
https://x.com/aibolik_/status/2086578620185661909
一条以编号形式贴出来的点子,比多数产品发布更有用:给 AI agent 做一个 A/B 测试平台,在技能、指令和工具三个维度上配置两个以上的 agent 变体,让它们跑一个测试队列并分流,然后拿指标去做决策。他随后把那个显而易见的圈闭上了——整件事本身可以自动化成一条自改进循环。它点出的空缺是真的:今天在跑循环的人里,几乎没人有一套像样的方法去比较两份 harness 配置。
💡#32
@Ferbin08
https://x.com/Ferbin08/status/2086569561600545193
这个玩笑不是玩笑:上线了一个 AI agent,demo 跑得很好,三周后日历上多了一条叫「每日 agent 复盘」的重复日程。本周每一个关于自主性的故事,中段某处都藏着这句话;一份诚实的 agentic loop 预算,应该把它催生出来的那场人类复盘会也算进去。
💡#33
@ZheningHuang
https://x.com/ZheningHuang/status/2086432010705183061
LiteReality 团队一条小但有教益的致谢:那条确定性流水线被升级之后,被当作 agentic loop 的初始化来用。这个先后顺序才是值得抄的模式——一个好的确定性首轮会把循环需要搜索的空间收窄,也给那个检查提供了一个稳定的比较对象。
💡#34
@Crypto_is_all
https://x.com/Crypto_is_all/status/2086450147077370014
他在盯 xai-org/grok-build,理由不是跑分,而是这个 agent 循环是开放且可审计的。24509 颗星,24 小时内带时间戳地涨了 920,不过他自己也标了那个显而易见的保留:其中很大一部分来自 xAI 生态的放大,独立采用还得自己长出来。他更大的赌注是,一个开放的编码 agent 栈会成为闭源那几家真正的对手。
💡#35
@PrakharB__
https://x.com/PrakharB__/status/2086561199383347438
三小时,端到端:Google 登录、积分体系、BYOK 计费、一条流式 agent 循环、一个对比工作流。值得作为「构建耗时」的数据点记下来,因为「流式 agent 循环」能在三小时清单里只占一行,本身就是现状在往前移动。
💡#36
@anushkmittal
https://x.com/anushkmittal/status/2086333611973001660
今天 autoresearch 讨论里最挑衅的一个论断:如果 autoresearch 成了,AI 实验室就死了。他的论证是 AI 产品公司知道该把模型往哪儿训而实验室不知道,因为信号来自用户,而实验室唯一的护城河是研究员。他补了一句,这也正是实验室都在变成产品公司的原因。信不信随你,但这是 Discovery Loop 那次发布所提出的问题的最锋利版本。
💡#37
@mattwestaway
https://x.com/mattwestaway/status/2086517430923206854
一段把 MCP 和 autoresearch 放进同一句话的干净解释。把工具定义成带文档字符串的函数,能让不同模型可靠地调用它们,也能减少幻觉,因为执行和校验由工具层承担,而不是让模型什么都自己扛。Karpathy 的 autoresearch 就是模型这样使用函数的典范:agent 在循环里改训练代码、跑实验、保留能改善结果的改动。MCP 让给 agent 提供这类结构化函数访问变得更容易。
📡 生态产品雷达
生态产品雷达

今天 loop 讨论里跨三个以上独立提及的工具:Claude Code 和 Codex,提示词循环的默认宿主,也是每一次对比里的参照系;Hermes Agent,被一份十二篇的拆解文章掀了个底朝天,并被反复点名为人们迁移的去处;Pi,不断以「可嵌入的循环」而非 CLI 的身份出现,其他产品建在它上面;Prime Intellect 的 Prime Agent,登顶 GitHub trending 的自改进编码 agent,也是别人定位时的对标物;Karpathy 的 AutoResearch 和 nanochat,仍然是那条典范循环,也是今天唯一一条硬结果的来源;OpenCode,和 Claude 一起被点名对边缘循环工作流有零日支持;DeepSeek,其缓存命中折扣直接改写循环经济学;Discovery Loop,提出把「提出—运行—评估」工业化的新入场者;以及 RLM Code,Prime Agent 那个 TypeScript 宿主的纯 Python 对照物。
← 上一篇
超级用户日报: 2026年8月11日
下一篇 →
灵感雷达: 2026年8月11日
← 返回所有文章

评论

加载中...
>_