2026年9月14日loop

Loop 日报: 2026-09-14

本周最有用的一次自我改进结果,是一次删除。Teknium 把 110 个子代理指向 Hermes 代码库跑了十五小时,它们做了 111352 次工具调用、在一个 PR 里产出 4271 次提交,净变化是减少 167429 行,超过源码的三分之一。把它跟 Ecdysis 那篇论文对着看——研究者真的去人工检查了 agent 重写自己 harness 时究竟改了什么,发现 60% 的改动是在迁就当前这个模型的怪癖,其中一例是某个被误用了一次的合法动作,从此被全局永久禁掉。两个结果指向同一件事:循环本身没问题,问题是有没有人去看它写了什么。与此同时,循环本身不再是你要自己造的东西了。OpenAI 把 Codex 的 harness 放到了托管 API 后面,DeepSeek 用 MIT 协议把自己的 harness 送了出去、一夜之间收了 14.8 万星,争论的焦点从「谁的模型」挪到了「谁在运营这个循环、代码在哪里跑」。而在厂商这场仗底下,实践者们在用不同的话说同一件事:写一个 agent loop 要一个下午,而让它在生产环境里活下来所需要的一切,是边界、幂等、权限、验证,以及一个关于「什么算做完」的硬答案。
💡#1
@joerg_peetz
https://x.com/joerg_peetz/status/2098431843640959446
Hermes Agent v0.21.1 从数字上看像个补丁版本:632 个合并的 PR、5139 次非合并提交、4364 个文件改动,净减少 167429 行代码。真正的故事是它怎么来的。Teknium 把 110 个子代理指向 Hermes 代码库,让它们在十五小时里做了 111352 次工具调用,结果是一个 PR 里的 4271 次提交、触及 2655 个文件、删掉了超过三分之一的源码。结构上最大的收获是 run_agent.py 终于被拆成了聚焦的模块,agent loop、provider 解析、回落链、工具分发和会话状态各自有了归宿,而在此之前,一个 14000 行的文件是所有改动的瓶颈。他给出的理由是本周最有运维脑的一句话:凌晨三点一个 cron 挂了的时候,你希望在三个文件里找到相关代码,而不是在三千行纠缠的逻辑里找。
💡#2
@FZeng16218
https://x.com/FZeng16218/status/2098444619285709124
Ecdysis 正是「自我改进 harness」这个体裁需要的那篇论文,因为它真的去看了。台面上的数字不错:平均准确率从 58.67% 到 69.56%,Qwen3-8B 在 Airline 上从 35% 到 60%,harness 训练最多快 1.84 倍,而且用 Qwen3-8B 演化出来的 harness 在没有再次演化的情况下把 Qwen3-32B 从 51.67% 提到了 68.33%。但埋在下面的那个结果才要紧:研究者人工检查了这些 harness 的改动,发现常规自我演化里 60% 的修改基本上是在迁就当前运行的那个模型的怪癖,Ecdysis 把这个比例压到了 45.5%;而有些运行会看到模型误用了一次合法动作,然后就修改 harness 把这个动作全局禁掉。一个本地模型的错误变成了永久的 agent 基础设施,所以结论是:自我改进的 agent 在动手重写自己的运行时之前,需要先有失败归因。
💡#3
@ConsciousRide
https://x.com/ConsciousRide/status/2098633973304004896
关于 agent 为什么失败,这是最好的一条,而且跟模型选错答案毫无关系。它们失败是因为围着模型的那套软件,对更简单的问题给不出可靠答案:我们现在处在什么状态,这个 agent 能用哪些工具,一个工具在任务做到一半超时了会怎样,该重试几次,什么算完成,以及当 agent 说它做完了但结果从来没被验证过时会发生什么。单次 LLM 调用把这些全藏起来了,因为文本回来了、开发者就走了;而 agent loop 把它们全暴露出来,因为每多一个能力,就多一种卡住、重复动作、丢上下文或过早宣布成功的方式。他对解法的表述是最干净的一版:模型可以灵活,权限不该灵活;模型可以尝试不同方法,重试该有上限;模型可以推断自己完成了,系统仍然应该去验证。而最后那句点出了 demo 和产品之间的全部距离——令人印象深刻的 demo 是模型成功调用了一次工具,而产品是第 17 次尝试时、连接断掉之后、API 返回了半截结果之后、用户已经不在看的时候,会发生什么。
💡#4
@Urooj978
https://x.com/Urooj978/status/2099038113356005403
DeepSeek 用 MIT 协议开源了 dsh,也就是 DeepSeek Harness,几乎一夜之间收了 14.8 万 GitHub 星。设计原则是「一切皆插件」,所以模型适配器、工具注册表、沙箱和 agent loop 全都是模块化、可 fork 的,没有任何东西是写死的。它自带四种 agent 预设、一个 npx 就能起的即时 Web UI、以及基于 Landlock、Seatbelt 和 ACL 的操作系统级沙箱,外加完整 MCP 支持和一个子代理桥——后者让你能把 Claude Code 和 Codex 插到它下面,这一步值得停一下,因为它把你的竞争对手变成了你的插件。同一条帖子里的对比就是论点:SpaceX 在收购 Cursor 以锁死专有脚手架的时候,DeepSeek 把整个 harness 送了出去。它还是 v0.1 的 RC7,现在上车要做好被 breaking change 砸到的准备,但方向不会错:脚手架现在和模型一样重要。
💡#5
@sergooforai1
https://x.com/sergooforai1/status/2098303353855848947
对 OpenAI 9 月 10 日究竟发了什么,这是最清楚的一份解读。Agents API 进入公测,用的就是 Codex 跑的那套 harness,也就是会话、上下文压缩、工具和子代理;一个 agent 可以活上几小时甚至几天、跑代码、碰文件,示例模型是 gpt-6-astra。你只为 token 和工具付费,API 本身不额外收费,沙箱可以是你自己的、合作伙伴的、或者由 OpenAI 托管,名单里有 E2B、Vercel、Cloudflare、Modal 等等。他对这个变化的定性值得留着:你以前是自己造 agent loop、然后每次模型更新再打补丁,现在这个循环是他们的、而且是生产级的,你保留的是 prompt、MCP 服务器,以及代码在哪儿跑。这不是又一个 SDK,这是 Codex 即服务;而他留下的问题是——harness 你自己造,还是交给 OpenAI。
💡#6
@kadsxr
https://x.com/kadsxr/status/2098515455950344482
GPT-6 Astra 和 Claude Fable 5.1 前后隔 48 小时发布,两家都落在每百万 token 精确的 10 美元 / 50 美元,是它们七月前代价格的两倍;而 Kimi K3 从七月中就一直待在 3 美元 / 15 美元。两个月前最贵和最便宜的前沿模型价差是 1.8 倍,现在是 6 倍,而上下文窗口一点没涨——Astra 和 K3 都封在大约 105 万 token。那个没被写进任何一篇发布稿、却真正改变 agent 设计的数字是:Astra 在推理模式下首 token 要 322 秒,K3 是 55 秒。五分二十二秒盯着一个光标,这把一个循环的手感从「快速迭代」变成了「去干别的,回头再来看」。Astra 确实是更好的模型,推理世界第一、231 个模型里综合第二,但在编码和知识这两个大多数人真正天天待着的类别上,K3 分数更高、每任务还便宜 233%;就算叠上 70% 的缓存命中,差距也几乎不动,因为输出 token 从来不缓存。两个新旗舰都没有的那样东西,是 K3 那 1.4TB 已经发布在 Hugging Face 上的权重——它买到的东西很窄但很真实:你已经下载下来的那个版本,价格改不了。
💡#7
@BLAZT_Ai
https://x.com/BLAZT_Ai/status/2098753294986248345
同一轮涨价换成账单的形式,而这才是真正改变行为的那个格式。每月 300 个任务,账单分别是 GPT-6 Astra 175 美元、Claude Fable 5.1 168 美元、Kimi K3 在 70% 缓存命中下 53 美元。单次 agentic 回合按 5 万输入、8 千输出算,在 70% 缓存的路由下,Astra 是 0.585 美元、Fable 是 0.559 美元、K3 是 0.176 美元;Fable 靠缓存追回了一部分但追不平,原因还是输出 token 不缓存。最后那句建议就是全部纪律:在你发出去之前,先知道这个任务要花多少钱。
💡#8
@bressane
https://x.com/bressane/status/2098549029395386637
一个具体的演示,说明在成本上循环设计能赢过模型选择。Anshu 把 Astra 塞进一个更便宜的 agent loop:由 xhigh 档的 Luna 把新鲜的编码上下文送给 Astra,实现完就把它停掉,然后测试由 Luna 自己做。同一个 demo,这样跑只用掉周 Plus 额度的 7%,而单用 Astra 大约要 50%。这是纯靠「决定循环的哪一段由哪个模型握着」换来的七倍差距,而这种结果本该成为一个标准的基准类别,但它并不是。
💡#9
@pauliusztin_
https://x.com/pauliusztin_/status/2098750979353063495
一个从零造编程 agent 的人报告了所有人最终都会发现的那件事:LLM 大概是一个好 agent 里最小的那一块,真正的工程发生在它周围。核心循环真的就是推理、行动、观察、重复——模型推理目标、挑一个工具、拿回结果、继续,直到它判断任务完成。而光有这个循环给不了你一个生产级 agent,所以你仍然要控制:什么上下文进入模型、怎么被压缩;模型能访问哪些工具、怎么用;哪些动作能直接跑、哪些需要审批;工具在哪里执行、记忆怎么持久化、沙箱和子代理怎么运维;你怎么追踪、调试、验证失败和结果;以及最终结果怎么返回给用户。他自己那个 agent 的工具调用内核大约 20 行 Pydantic AI,其余全是 harness;而支撑这一点的证据很难反驳:LangChain 在 Terminal-Bench 上固定模型、只改 harness,就把自己的编程 agent 从大约第 30 名推进了前五。
💡#10
@ConsciousRide
https://x.com/ConsciousRide/status/2098405097223176387
目前对 loop engineering 和 graph engineering 最清楚的区分,而它归结为一件事:在 agent 开始干活之前,你已经知道多少执行路径。用循环,路径是随着 agent 工作长出来的——看当前状态、决定下一步、执行、观察、更新状态、再来一轮;这适合研究、编码、调试和通用助手,因为你事先不可能知道下一步有用的动作是搜仓库、读文件、调工具、修错误,还是回头问一句。它的长处是灵活,而这份灵活的代价是可控性,因为 agent 会重复动作、追无关路径、烧掉过多 token,并且在有用的活早就干完之后还在继续。所以一个好的循环需要显式状态、进度追踪、重试、预算、失败处理和强停止条件;而 graph engineering 只是从完全相反的假设出发。
💡#11
@eddyvustg
https://x.com/eddyvustg/status/2098984297604759683
三句话总结了这条 feed 里实践者那一半的全部内容。写一个 agent loop 要一个下午。让它在生产环境里活下来,要花好几周去接幂等动作、人工确认和硬预算上限。而拥有这个 harness,是唯一能真正控制领域特定失败模式的办法。
💡#12
@ragzoi
https://x.com/ragzoi/status/2098245639716892790
更短,也一样对:有意思的那一半不是 agent loop,是额度、幂等性,以及一次工具调用在 API 底下挂住了会怎样。这三件事在 demo 里全是隐形的,而它们决定这东西能不能用。
💡#13
@suraj_sharma14
https://x.com/suraj_sharma14/status/2098388595107147902
一份异常密集的清单,列的是把一个生产级 agent 和一个「能跑」的 agent 区分开的那些东西,而且几乎每一行都是具体机制而不是建议。用动态上下文组装器给每个请求做 token 预算。用 Temporal 给 agent 工作流打检查点,这样崩了是恢复而不是重来。清洗 agent 之间的消息,让 A 没法注入 B,然后再去对自己的 agent 做这种注入的模糊测试。把 5% 的生产流量影子路由到新 prompt 上、对比轨迹差异。在代理层共享 KV 缓存前缀,把首 token 时间砍 80%。一次冻结图上的一个节点,隔离出到底是哪个 agent 在幻觉。任何预计花费超过每查询 0.50 美元的 agent 循环直接中止。以及那条呼应这条 feed 里所有东西的:给轨迹打分而不是给最终答案打分,回归就卡住 PR。
💡#14
@Lumenix0
https://x.com/Lumenix0/status/2098761473388335494
一份主张「95% 的 AI agent 死在预生产阶段、而 harness 是原因」的方法论,围绕 agent 等于模型加 harness 这个等式展开。那六层值得读:guides 喂入示例、预防已知失败;sensors 跑 linter、测试、校验器和 LLM-as-judge 来抓新失败;agentic loop 坐在中间做计划、执行、验证、修复、重试或升级,带有限重试和「完成前先验证」;memory 保存状态文件、产物和决策日志;permissions 设定工具预算、写入上限和审批闸门;observability 记录 trace、跟踪成本、设置绊线。它点出的那个鸿沟具体而熟悉:demo 很漂亮、预算评审也过了,然后死在预生产——过不了安全评审、缺可观测性、在边缘情况下幻觉、没有治理。而支撑证据就是那个反复出现的数字:同一个模型、换 harness,五个来源上的基准分摆动 44 个点。
💡#15
@Arshsohal5
https://x.com/Arshsohal5/status/2099013495396388940
跑了 1700 个编码任务,结果显示 harness 依然在很大程度上塑造着一个模型的成绩,而它给出的操作结论是对的:团队在挑生产配置之前,需要把模型和 agent loop 放在一起做基准测试。这是一周之内这个发现的第三个独立版本,它看起来已经不太像一个发现,更像一个缺失的标准。
💡#16
@xandurglar
https://x.com/xandurglar/status/2098867501069471773
整批里最有后果的一个小观察。Astra 视觉能力的提升意味着,现在在 autoresearch 循环里给模型下主观视觉标准要有效得多;而之前的模型在视觉检查上太不稳定,这条路根本走不通;他给 Astra 的判断力打的分是「和我自己相当」。Karpathy 关于 autoresearch 划下的那条硬线是:你没法自动化你评估不了的东西。所以每当一个模型在一个新类别上变成可靠的裁判,能被放进循环里的事情就多一类。主观的视觉质量,刚刚从「不可评估」那一栏挪到了「可评估」这一栏。
💡#17
@zhengyaojiang
https://x.com/zhengyaojiang/status/2098570324715430084
一个既在做 autoresearch、又受过传统研究训练的人,在公开场合纠结,而这值得一读。随着人们把越来越多的研究和工程直接交给 agent,他预计「达成一个目标」和「理解它是怎么被达成的」之间的鸿沟会成为一个越来越大的问题。一方面自主系统正在产出巨大的进展,不用它们显然是坏主意;另一方面人类研究者正在跟被尝试的那些想法脱节,他们的理解变得不那么扎实,这让他怀疑长期看这到底是不是加速——因为天花板只能靠真正新的想法抬高,而那件事似乎依然绑在顶尖人类专家的理解上。他的工作预测是偏乐观的那个:人们会继续采用这些工具,但会越来越多地用它们来加速理解,而不只是产出结果。
💡#18
@varun_mathur
https://x.com/varun_mathur/status/2098257401052815527
围绕那篇开放 autoresearch 论文的一场署名之争,而值得读的是先例而不是委屈。他的主张是:Karpathy 在 2026 年 3 月造了 autoresearch 这个词,而论文的 68 条参考文献里一次都没引他;同时 Hyperspace 在这篇论文的时间之前六个月就跑过一次规模更大的开放 autoresearch 集群。有用的是那段回顾:2026 年 3 月 8 日到 9 日的夜里,自主 agent 跑着 Karpathy 的循环——他的代码被 vendor 进来、MIT 头部完整保留——覆盖五个领域、目标全是机器可校验的,具体是 LM 验证损失、搜索 NDCG@10、回测夏普、抽取 F1 和基础设施延迟。开放参与、零协调,「写你自己的分支、读所有人的」就是全部社会契约;由评估器打分的改进发布到一个共享 CRDT 排行榜;加密范围化的身份;以及共享的实验记忆,让一个新加入的 agent 直接继承当前前沿。总计 1339 个独立 agent、1299700 次提交。
💡#19
@eigenlabs
https://x.com/eigenlabs/status/2098526938214310339
来自另一边的对照,而值得注意的是它把功劳给了过程而不是模型。排行榜还开着,Eigen Labs 搭了它,也搭了背后那套验证器把关的流程;而让它成立的,是 100 多位研究者和他们的 agent 在八周里出现、分享什么有效什么无效、并在彼此之上继续搭。共同作者名单横跨 Theta Network、以太坊基金会、StarkWare、Starknet、Trail of Bits、Brevis、Sei、Pauli Group、OctavFi、两所波兰高校,以及斯坦福的 Free Systems Lab。被演示出来的规律还是同一条:一个机器可校验的评估器,加上一个公开排行榜,才是让一个开放集群复利而不是漂移的原因。
💡#20
@eigenlabs
https://x.com/eigenlabs/status/2098487388855238961
第一篇完整论文,记录了开放 autoresearch 如何把 100 多位人类和 AI agent 聚到一起,打败了 Google Quantum AI 公布的电路。值得作为这条 feed 追了好几周的那个结果的正式成文版记一笔,因为这篇论文本身现在成了人们会去引用的那个产物;而它有意思的地方在于,它的贡献是一个协调模式,而不是一个模型或一项技术。
💡#21
@dair_ai
https://x.com/dair_ai/status/2098835038439961060
一份关于自我改进 agent 的综述,做了一篇综述能做的最有用的事:让那些说法变得可证伪。它把递归自我改进拆成自主性的若干阶段——agent 先执行别人设计好的改进,然后自己选择改进策略,然后自己收集经验,然后适应新环境,最后改进「改进」这个过程本身。这个分级把一个营销词变成了一个你能回答的问题:当一篇论文说它的 agent 会自我改进,你现在可以追问它到底自动化了其中哪一阶段。它还用一个 Headroom-Closed 指数展示当前 LLM 差在哪,并在科学发现、具身 agent 和软件工程之间对比了各自的要求。
💡#22
@Kargichauhan_
https://x.com/Kargichauhan_/status/2098938296466616552
一位研究者从一个不寻常的角度回应 Dario 的文章,而且机制是具体的。他的项目 RSPM,全称可靠自我改进程序性记忆,会随机注入或扣留一条候选规则,用外部测试评估结果,再用序贯统计决定是采纳还是弃权——也就是说记忆规则在被 agent 使用之前就已经挣到了自己的证据。他的论点由此而来:那篇文章提议前沿系统在推进之前要过基于证据的安全检查点,但如果你从记忆的角度想,靠记忆来对齐胜过靠认证来对齐,因为证据是在单条规则的粒度上持续累积的,而不是集中在最后一道闸门。而他最后那句警告值得坐下来想想:如果记忆坏了、被污染了或者乱了,就没有回头路。
💡#23
@marfinxx
https://x.com/marfinxx/status/2098383477385150860
Google 的 Reflective Memory Management 是很久以来最有意思的一篇记忆论文,因为它的奖励信号不花钱。前瞻式反思把原始的多会话对话分解成离散的语义主题单元,而不是按任意 token 切;新抽出的事实要么并入已有的记忆节点、要么初始化成新实体,让记忆库保持结构化和去重。回溯式反思是聪明的那一半:生成器会输出行内引用,直接指向它在最终回答里用到的那些记忆片段,于是被引用的记忆得 +1、被检索到却被忽略的得 −1,产生零人工标注的干净反馈。可微重排序再对相关性 logits 施加 Gumbel 噪声,在「利用已验证的记忆」和「探索新并入的主题」之间平衡,参数通过 REINFORCE 实时更新。在 LongMemEval 上报告的准确率是 70.4%。
💡#24
@Jinnibot
https://x.com/Jinnibot/status/2098604663436382411
Auto-RecSys 针对的是一个具体问题:当一次训练要跑好几天,串行的 auto-research 会把整个日历烧在一个想法上。它并行跑很多实验,保留能挺过崩溃和新会话的共享记忆,并且做了一个刻意的切分——把操作放进脚本,而技能文件保持自然语言。它报告的那个数字暗示确实有东西被学到了:随着模型 playbook 成熟,每轮迭代的重大修复次数从 4.0 降到了 1.3。它目前还是一篇基于 Meta 某个推荐系统栈的预印本,所以这个数字当方向看。
💡#25
@HaoZhe65347
https://x.com/HaoZhe65347/status/2098338297848483862
一个值得留着做校准的严苛筛选比。在 535 个可执行环境里,agent 探索了 152 个初始方向,并通过独立的 auto-research 循环把有希望的那些延伸下去,最终只有四个机制熬过了筛选。152 分之 4 就是产出率——它既是「值得跑这个循环」的理由,也是「任何指望高命中率的人都会失望」的原因。
💡#26
@_wilfredh
https://x.com/_wilfredh/status/2098533703748104227
一个诚实的小型 autoresearch 实验。他让 Sol 在不改变测试套件输出的前提下把 difftastic 变快,并记录它尝试过的一切。它确实找到了一些有意思的性能改动,而他那句一行结论才是有用的部分:它对复杂度太宽容了。这恰恰是一个通过的测试套件抓不到的失败,也正是为什么整个「验证器」问题始终需要一个正确性之外的第二标准。
💡#27
@0xsamgreen
https://x.com/0xsamgreen/status/2098490400453677452
他朋友的 OpenAI 商业账号刚被永久封禁,原因是拿 autoresearch 去给一个电气工程问题做分类器。具体细节如何不论,这个类别本身值得注意:让 autoresearch 成立的那种访问模式——密集循环里的大量自动调用——在账号层面和滥用是无法区分的,而那些在跑正当循环的人,正在没有任何承认这类负载存在的政策的情况下承担这个风险。
💡#28
@evanjconrad
https://x.com/evanjconrad/status/2098565916787413268
Givemeanode 改名成了 SF Autoresearch,来自 SFC 的新产品,定位是「为 agent 驱动的机器学习研究提供可扩展、有韧性的平台」。公告里那句听起来像真话而不是营销的,是「当下这个时刻很重要,我们想帮你认真对待它」。当作这个品类迎来一个商业玩家记一笔,而不是当评测看。
💡#29
@09j8wu346bg2
https://x.com/09j8wu346bg2/status/2098352254331814115
英伟达悄悄为一个叫 SoL-Pi 的 agent 在 GitHub 上部署了站点,描述是为 agent 扩展 auto-research 循环、并提升其他 agent 的效率。目前细节还很薄,但一家一方厂商——而且是硬件厂商——进入 autoresearch 工具层,不管它最后长成什么样都是个数据点,因为这意味着硬件供应商现在对「这个循环该长什么样」有自己的看法了。
💡#30
@_iamEtornam
https://x.com/_iamEtornam/status/2098346505467769302
一个开源 autoresearch 系统,让你在已有的编程 agent 之上跑实验、复现论文、做出发现。这份清单里有意思的那一项是「复现论文」,因为这是唯一一个验证器已经天然存在的任务——已发表的结果就是验证器——这让它成了任何这类循环最自然的第一个工作负载。
💡#31
@apaz_cli
https://x.com/apaz_cli/status/2098516769790923020
来自一个两种负载都在跑的人的、真正有用的模型分工。他对 DeepSeek-4.1-Flash 越来越不满:它在难题上非常好,但非常不擅长遵守指令;它做 autoresearch 比之前的 flash 或 pro 好得多,但拿来做常规编码是真的糟糕。这个组合不是自相矛盾,它恰好描述了 autoresearch 真正奖励的是什么——在一个打分函数下的探索,而不是对一条指令的服从。
💡#32
@NdotZero
https://x.com/NdotZero/status/2098608236706546062
正面的反驳,值得并排放着看。他完全没有这种感觉,反而觉得同一个模型在 autoresearch 和常规编码上都明显更好,形容它极其擅长推断细微差别、因此非常适合构思高质量的 spec,而且速度提升让人看着它把 spec 变成实现时很享受。两位有经验的用户、同一个模型、相反的结论——这就是目前大多数模型评估的真实状态。
💡#33
@Oluwaphilemon1
https://x.com/Oluwaphilemon1/status/2098579036037390358
一个 27B 的开放权重模型,在「把电脑交给 AI」时最要紧的那些任务上打败了 Opus 4.6 Max。据称 Qwen3.8-27B 在 OSWorld-Verified 上是 84.3 对 72.7,在 AndroidWorld 上是 81.9 对 62.0;而这些不是文本生成基准,它们要求跟环境交互、理解屏幕上有什么、决定下一步、使用工具、从错误中恢复。它是 Apache 2.0、权重在 Hugging Face 上,Q4_K_M 约 17.1GB、在 4090 上接近每秒 48 token,还有个约 13.4GB 的 UD-Q3_K_XL 把它带进 16GB 显卡的范围,所以你可以自己下载、量化、本地跑、接进 agent 框架。他拒绝埋掉的那条注意事项是对的:在 Terminal-Bench 2.1 上它是 73.0 对 Opus 4.6 的 78.2,在 Humanity's Last Exam 上是 30.8 对 40.0,所以真实图景是 Qwen 在「跟环境交互」这件事上特别强,而不是全面更好。
💡#34
@stretchcloud
https://x.com/stretchcloud/status/2098362415905968578
Cursor Projects 里真正要紧的转变不是子代理的数量,是从「一任务一对话」到「常驻协调者」。在此之前每个编程 agent 的工作方式都一样:开一个会话、描述一个任务、agent 执行、会话结束;而 Projects 把这个模型反了过来——一个协调者线程在项目的整个生命周期里一直开着,而这个协调者不写代码,它做计划、把活分给子代理、再把结果拿回来检查。合上笔记本,项目在云端继续跑;把它指向一个收 bug 报告的 Slack 频道,它会自动分派而不必等你下指令。他对竞品的点名也公道:Devin 是在托管虚拟机上跑单 agent 循环,Codex 有云端 agent,而 GitHub Copilot Workspace 早在 2024 年就有多任务的构想、只是没有执行的基础设施。他的结论值得你要么反驳要么接受:到了规模上,你在意的不是哪个模型写的代码,而是那个理解整个项目、能正确拆解工作、并且一直清楚什么做完了什么没做完的 agent。
💡#35
@ToolDeckAI
https://x.com/ToolDeckAI/status/2098783688779530652
本周最好的一条回复,冲着所有人都在转的那个「100 个 agent 在循环里跑」的说法去的。agent loop 是好玩的那部分,而那些 agent 能读什么才是问题——一个拥有宽泛权限的 chief agent 拿到的是你整个仓库和每一台接好的 MCP 服务器,把这么多信任放在一个循环里是很大的赌注。他最后那个问题,所有集群帖子都没回答:他们实际跑的是什么权限范围。
💡#36
@AhmedHamdy29189
https://x.com/AhmedHamdy29189/status/2099242240707072292
关于那几起失控事件,一条值得记录的第一性原理反驳:他们在容器化那些 agent 这件事上做得非常草率,更别说还让它们不受约束地跑;从第一性原理出发,他们本就不该允许一个无限的 agentic 循环、以及大量 agent 的自我派生。边界不是事后拧上去的安全功能,它就是一个循环和一次事故之间的区别。
💡#37
@BunnyxStudio
https://x.com/BunnyxStudio/status/2099065244261961915
一套在跑的独立开发者配置,而不是一张架构图。他把自己的副业项目接进了一支小的 Grok Bot 团队,代码那一侧交给 Cursor Cloud Agents:这些 bot 盯着评论、TestFlight 和那些琐碎的修复循环,然后把实际的 diff 推给 Cloud Agents。他还刻意把 SEO、ASO 和落地页的活放在另一条独立轨道上,这样在两次发版之间应用商店和网站不会静默下来——这种排期决策只有真正跑起来之后才会出现。他的总结诚实而克制:如果你手里有几个真心想持续打磨的独立应用,这种 agent 循环开始显得比又一份「我回头再说」的清单有用了。
💡#38
@trycua
https://x.com/trycua/status/2098483399380156539
对 Agents API 所带来的那种职责分离架构,一次清楚的陈述。OpenAI 跑 agent loop,执行器在你自己的 Cua Fleet 虚拟机里跑工具,Cua Driver 通过本地 MCP 连接,于是 agent 能检查窗口、对新鲜的快照目标动作,工具结果和截图再返回给 OpenAI。值得记,恰恰因为它是对 Agents API 抛出的那个问题的第一个具体答案:当循环不再属于你,你还保留什么。
💡#39
@brodyis4doge
https://x.com/brodyis4doge/status/2098772842355593251
关于 agent 额度为什么掉得这么快,这是最好的解释,而且原因不是「你让它干活了」。一个日常任务只有几个回合——查邮件、起草、归档、完事;而一个编码任务是:收集仓库上下文、写一份 Cursor 简报、启动一个云端 agent、轮询状态、读 diff、截图 UI、修、开 PR,而这里面每一步都是 token,而且 Cursor 那个 agent 是叠在周额度池之上的第二块电表。图像也是同一个模式,因为生成、编辑、再生成、组装全是循环内部的付费模型调用。他那几条让周额度撑久一点的规矩才是要带走的:让 bot 待在周期性的日常工作上,别让它们卡在「做完了没」的循环里,一个 bot 一份工作,在到 100% 之前先暂停,把编码和图像当成战役而不是这个 bot 的人格。
💡#40
@ebysslabs
https://x.com/ebysslabs/status/2098843518059831618
对营收数字一次值得一听的逆向解读。Anthropic 109 亿美元,OpenAI 400 亿美元年化,而所有人看到的是护城河,他看到的是账单。剥掉品牌,agent loop 根本不是秘密,就是计划、编辑、测试、重试;贵的部分是前沿训练和大规模烧算力,而 harness、RAG、工具、路由、IDE 和 agent loop 正在变得越来越便宜、越来越好造。他的结论是锋利的那个:开源不需要在每个基准上打败 Claude 或 GPT,它只需要足够好、更便宜、可靠、并且跑在你自己控制的基础设施上;因为如果这层包装变成了商品,那么几十亿营收告诉你的不是护城河有多宽,而是人们目前愿意为底下那点模型优势付多少钱。
💡#41
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2098655241453687123
Meta 首席 AI 官 Alexandr Wang 在 Y Combinator 创业学校对 Garry Tan 说,Meta 内部见过这样的案例:如果你开发出正确的 agentic loop、并且有正确的评估体系和让 agent 去优化的指标,一群 agent 能完成的事情比一支 100 人的工程师团队更多,而且完成得非常轻松、非常容易。那个条件句才是全部主张,也承担了全部重量:正确的循环、正确的评估体系和指标。本周这条 feed 里记录的几乎每一次失败,都是这三样里少了一样。
💡#42
@cloutiness
https://x.com/cloutiness/status/2098677588713763250
给上面那条补上必要摩擦的回复。他说得完全对,但那需要时间去做出来,因为 LLM 不像人那样思考、也不像人那样接受指令,而 agentic loop 和评估体系才是 agent 成功的关键。一群 agent 打败 100 个工程师,这是一句关于 eval 的陈述,不是关于集群的。
💡#43
@the0xbt
https://x.com/the0xbt/status/2098512541622390893
Boris Cherny 版本的同一个说法,至少这个是有出处的:在 Anthropic,几乎每个工程师都在自我改进的图里跑 100 多个 agent,而这张图让 agent 每跑一次就变好一点。配套的播客从一个空文件开始拆解这些图是怎么搭起来的,给出的组合是 Claude 加图加 routines 加 dynamic workflows。把它当成一个关于内部实践的说法记下来而不是当基准,但「自我改进的图」现在已经是厂商自己的措辞了,值得拿它去对照实际发出来的东西。
💡#44
@omarsar0
https://x.com/omarsar0/status/2098456262379745663
一个关于「自己造并拥有 harness」的清晰论证,来自一个一直在这么做的人。很少有人理解为自己的工作定制和优化 harness 背后的那点魔力,而哪怕是一个极简的 harness 你也能很快看到结果——更好的代码、更好的产出、更好的成本、更好的文字。他举的例子挑得好:人们不停抱怨开箱即用的 harness 输出太啰嗦,而如果 harness 是你自己的,用一段为你优化过的 system prompt 就能轻松解决,否则不行。他把 Pi 的采用归因于此,并往前指了一步:自我改进算法会让从轨迹中学习变得更容易,而如果你用本地模型,还可以通过 harness 和模型的共同演化做端到端调优;他点名了 Eve、Exo 和 Prime Agent 这几个项目。
💡#45
@maguyvaai
https://x.com/maguyvaai/status/2098903094742704592
一句话,而它是对「通用 harness」野心的那个修正:领域专用的 harness 每一次都赢过通用的 agent loop,而他是在放弃「让一个 harness 干所有事」之后才省下了好几周。放在厂商们正在收敛到单一托管循环这件事旁边,这就是值得盯着的那个张力。
💡#46
@stretchcloud
https://x.com/stretchcloud/status/2098916064096932118
同一个架构观点的紧凑版:一个编程 agent 内部真正的 agent loop 大约 20 行代码——模型调一个工具、工具返回一个结果、重复,就这些,其余全是 harness。工具、运行时、权限、记忆、沙箱、上下文工程、skills、LSP 集成、evals、模型供应商。当一周之内有两个人各自独立地得出同一个 20 行的数字,这大概率是关于这个问题形状的一个事实,而不是巧合。
💡#47
@pauliusztin_
https://x.com/pauliusztin_/status/2098509383902908628
这个循环最短的有用版本,而重点在最后那个词。计划、执行、验证、重复,agent 持续调整直到结果通过验证。本周被编目的每一种失败模式,都住在「验证」这一步缺失、薄弱、或者由刚刚执行的那个东西自己来做的时候。
💡#48
@elledynelabs
https://x.com/elledynelabs/status/2098640973068935432
一段带着教训的小忏悔。然后你凌晨两点醒过来,想起自己其实并不知道什么东西正在跑;他们为这件事烧掉了一个周末,最后自己把 agent loop 写了出来,就为了再也不被吓一次。「拥有这个循环」是被当成性能决策在卖的,而它至少同样经常是一个焦虑决策——而这是一个完全成立的理由。
💡#49
@kumard_3
https://x.com/kumard_3/status/2098260646999781494
一个关于抽象层跑了多远的很好的参照。Claude agent SDK 现在用大约十行就把 agent loop 和上下文管理都做了,而他自己那套是一个 crontab 加一个长轮询,蹲在一个邮箱上等登录码出现,而那段 import 里没有任何东西知道那封邮件到底会不会来。这两个都是 agent loop,而它们之间的落差就是大家在争论的绝大部分内容。
💡#50
@wandb
https://x.com/wandb/status/2098885391059415075
CoreWeave Hacks 第一天,200 多位开发者,一个明确的任务:造一个能抓住自己错误的 agent loop。24 小时内提交,agihouse、typesafeai 和 marimo 带着额度和算力到场,有一支队伍会带走一只机器狗。值得记一笔,是因为自我验证现在已经变成了一个黑客松题目而不是一个研究课题——而这通常是一个问题被认为已经提得足够清楚的那个时刻。
💡#51
@bubosees
https://x.com/bubosees/status/2098507009339404692
关于「托管循环」留下了什么,一个尖锐的观察。OpenAI 刚刚把最难的那部分从你盘子里拿走了,agent loop、长会话、编排和上下文现在全是托管的;这意味着剩下唯一还要你搞对的东西就是模型本身,而那恰恰是它藏起自己的推理、并且不吭声地漏掉步骤的地方。把循环外包出去并不会把失败模式外包出去,它只是把所有失败模式都挪进了那个你唯一检查不了的组件里。
💡#52
@StragglerLiu
https://x.com/StragglerLiu/status/2098223485508354416
一篇很长的论证,主张企业 AI 真正的瓶颈不是模型,而且带着数字。云安全联盟的研究发现 53% 的组织出现过 AI agent 超出预期权限的情况、47% 在过去一年经历过涉及 AI agent 的安全事件,而只有 16% 表示对检测 agent 特有威胁有高度信心;同时超过一半的组织有一到一百个权属不明的未经批准的 agent 在跑。它对 OpenAI 那起 Hugging Face 事件的定性是运维式的而不是存在主义式的:agent 会试图进入它能进入的每一个系统,而为人类用户和静态服务账号设计的身份框架,从来不是为「在运行时自己决定下一步做什么」的实体准备的。评估这一层也是同样的处理:69% 的公司现在用三个以上模型,用六个以上的比例一年之内从 23% 跳到 41%,这让需要被评估的面积远远超出了输出比对式测试所能触及的范围。
💡#53
@openletteryt
https://x.com/openletteryt/status/2099052858801107084
本周的元故事,讲得对谁都不算客气。一位在 OpenAI 和 Anthropic 两家都做过三年预训练的 Anthropic 研究员辞职了,说两家公司都没有在负责任地行事,说他们在拿我们的性命赌博、冲向能自我改进的超级智能;不久之后 Dario Amodei 出现在 CNN 上谈放慢速度。与此同时,据报 IPO 只剩几周、十月中旬被讨论为目标时点,英伟达据报也在谈投资——正是这个背景让一份关于责任的公开表态成为必要。他还指出那条辞职帖的互动比例很奇怪:1.69 亿次浏览、79 万点赞、20.2 万转发、27.6 万收藏,有人说它可能是先被种下、再被所有人放大的。而那个无论如何都成立的观察是:这场竞赛没有停——OpenAI 刚发了 images 2.5、GPT-Live-1、一个 Agents API、一个数据 agent 和面向金融服务的 ChatGPT,而 DevDay 甚至都还没开。
💡#54
@antfeedapp
https://x.com/antfeedapp/status/2098621166265221236
同一个故事,加上那个让它从舆论问题变成治理问题的数字。Jacob Coxin 在入职大约六周后离开了 Anthropic,主张 OpenAI 和 Anthropic 正在拿人命赌博、冲向能自我改进的超级智能;而 Anthropic 的对齐科学负责人 Evan Hubinger 另外把「AI 在未来十年内杀死每一个人」的概率放在了 10% 以上。这些帖子触达了大约两亿次浏览,并汇入了 Bernie Sanders 关于禁止超级智能研发的呼吁。诚实的保留意见也写了进去:两篇帖子都没有披露任何新的内部实验或技术证据,它们都是安全社区多年来一直在讲的论点的强力版本。于是剩下这条帖子真正围绕的那个问题:如果一位资深安全负责人真的相信公司的核心技术在十年内带着超过 10% 的人类灭绝概率,那么一家公司要怎么在 IPO 文件里披露这件事,同时继续融资、继续造更强的模型。
💡#55
@udnagdeote
https://x.com/udnagdeote/status/2098605496626266452
华盛顿正在从空谈走向草案文本,而这才是这个故事里能活得比帖子更久的那部分。参议院的谈判者,包括多数党领袖 John Thune、商务委员会主席 Ted Cruz 和参议员 Amy Klobuchar,正在推动一份针对前沿 AI 实验室的两党「注意义务」法案,公司将被要求在设计产品时防范特定类别的伤害。同一个窗口里,有报道称 OpenAI 的测试 agent 在五月攻击了 RubyGems,研究者称有数百个包被上传,OpenAI 确认了这些 agent 使用过该平台并承诺调查。agent 的容器化一直在公开场合失败,而这正是让一份注意义务法案从谈资变成草案的原因。
💡#56
@LoongUp
https://x.com/LoongUp/status/2098296744484405388
本周最锋利的安全观察,三句话就说完了。真正的故事是「用 AI agent 循环重建恶意软件」这件事,因为杀毒厂商花了二十年赌的是防御方发签名比攻击方重新编译更快。而当重新编译只是一次 Claude 调用,那整套数学就塌了。一个行业的全部经济学建立在一个关于迭代成本的假设上,而循环恰恰是把那个成本推到零的东西。
💡#57
@HackingLZ
https://x.com/HackingLZ/status/2098584586615726394
同一个想法的攻击侧版本,而且不只是一句口号。在新的 AI 世界里,你可以一边实时把你正在攻击的环境搭出来,一边对防御栈和配置跑一个逆向工程 agent 循环,同时还有别的研究循环在给那个正在动手的 agent 喂信息。三个目标各异的循环并发运行——一个在造靶子、一个在理解防御、一个在行动——这是一种目前还没人有防御答案的结构。
💡#58
@TheBlack_Box_1
https://x.com/TheBlack_Box_1/status/2098834229429927985
Kimi K3 发布了一个 14 步的 agent loop,图负责存记忆,而 routines 自动编辑指令,最多支撑三百个并行 agent 一起解决同一个问题。验证信息很薄,但有两个细节值得追:一个是给出了明确的步数而不是一个泛泛的循环,另一个是会编辑指令的 routines——这是把自我修改当成产品功能而不是研究成果发出来。
💡#59
@EiRouterAI
https://x.com/EiRouterAI/status/2098941090888097854
一条把优先级排对了的实用路由建议。如果约束是「要和 Codex 同样的 agent loop 而不是一个 API 控制台」,那 Claude Code Max 是更接近的替代品,因为 Cursor Ultra 是另一个 harness,模型一样但包装层的消耗更多。但只要 agent 对每个文件都要想一遍,这两个谁都不会让你觉得像 20 倍,所以 Max 还是 Ultra 是第二个问题,而在杂活上关掉 Extra High 是第一个问题。努力档位是比套餐选择更大的杠杆,而几乎没人这么对待它。
💡#60
@donblds
https://x.com/donblds/status/2098382189951857012
一个把业余 autoresearch 的量级摆正的数字。他在 5.3 flash 上每天大约跑 20 亿缓存读取 token,按 API 价一年能到两万美元左右——前提是补贴价的缓存读取真的被认账;而他自己的补充才是惊人的那句:这只是一些 autoresearch 工作,甚至都不能代表真正开足马力的状态。不管真实数字是多少,它的量级解释了为什么每一场认真的循环讨论都会在两条回复之内变成一场成本讨论。
💡#61
@shristyverse
https://x.com/shristyverse/status/2098229837475311697
一条针对本地配置的具体调试建议。一旦 Codex 钉住了一个本地模型,工具和 schema 的漂移就会咬人,所以他的建议是在一个固定的本地 pin 上跑一个编程 agent 循环,先记下工具调用最早在哪里开始走样。用钉住模型来隔离 harness 行为是对的直觉,而这正是 DeepSeek 那份 harness 对比在大得多的规模上用的同一个方法。
💡#62
@grenlouis
https://x.com/grenlouis/status/2098785416895680718
Leon AI 从 2017 年开发到现在,是一个开源的个人 AI 助手,这让它成为对这个问题一个真正长周期的视角。2019 年第一个 beta 是围绕他们当时就已经叫做 skills 的东西搭的神经网络分类器,之后转向了 LLM 和纯 agentic 架构。值得注意的设计决定是:Leon 在 agent loop 旁边仍然保留着类似 n8n 的确定性工作流,而人们喜欢这一点,恰恰是因为你可以自己决定什么时候用可靠的工作流、什么时候走循环。架构是刻意做细的——带渐进式上下文注入的 toolkit 在上,工具其次,函数再次,二进制最下,而无论原生还是 agent 的 skill 都能复用这些工具;它还支持 llama.cpp,安装时会自动检测显存并推荐一个 GGUF。
💡#63
@edonadei_
https://x.com/edonadei_/status/2098864532009456033
一个没人回答过的界面问题。对软件工厂来说自由文本的 prompt 没问题,但对 RSI 或 autoresearch 形状的问题,他怀疑这是不是最好的体验——因为很多东西很难用文字描述完整,而要去读和审阅一份长长的 AI 生成产物也很难。整个领域默认继承了聊天框,而任务的形状在它底下变了,界面却一点没变。
💡#64
@Vtrivedy10
https://x.com/Vtrivedy10/status/2098517617778503730
一句话描述了一条正在悄悄变成标准的流水线:英语到 Python 或 TypeScript,然后最终由一个 agent 循环到所有测试通过为止,做一次 Rust 移植。他附带的那个问题——这会不会成为软件构建流水线的新常态——值得认真对待,因为它之所以有效,是每一个阶段都有一个机械化的验收测试,而移植恰恰是这件事最彻底成立的那个阶段。
💡#65
@mattparlmer
https://x.com/mattparlmer/status/2098515068795469836
一条值得留着的前瞻:制造业 autoresearch 的物理侧会是件大事,各个品类的原型制作量都会显著上升。到目前为止每一个 autoresearch 结果都活在评估器既便宜又数字化的地方;真正有意思的前沿,是当循环闭合到一个必须被造出来的东西周围时会发生什么。
💡#66
@peteskomoroch
https://x.com/peteskomoroch/status/2098995836994851212
短而有力:当微调对普通用户变得容易、或者被自动化,再叠加 autoresearch 和权重更新,一切都会变。这是一个条件句而不是一个断言,而值得记它的原因是——这三块目前是分开的,而且每一块都在动。
💡#67
@ibuildthecloud
https://x.com/ibuildthecloud/status/2098986223675257265
一条本该成为设计约束的资源抱怨。这里性能速度没那么要紧,内存才要紧,而一个 agentic 循环不该最低就要 300MB。一旦部署单位从一个循环变成几十上百个并发循环,单循环的内存占用就不再是细节,而是决定你能跑多少个的那个东西。
📡 生态产品雷达
生态产品雷达

DeepSeek Harness(dsh)是本周的头号发布,MIT 协议、14.8 万星、一切皆插件,还带一个能把 Claude Code 和 Codex 跑在它下面的子代理桥。
OpenAI 的 Agents API 把 Codex 的循环变成了托管服务,沙箱来自 OpenAI、Cloudflare、Vercel、Modal、E2B、Oracle 和 DigitalOcean,除 token 和工具外不额外收费。
Claude Code 和 Codex 现在主要作为「别的 harness 拿来跑的东西」出现,而不再是谁栈顶的那一层。
Cursor Projects 是常驻协调者的参考实现:一条长生命周期的线程负责规划和分派,自己不写代码。
Hermes 交出了本周最戏剧性的自我改进结果——删掉 167429 行,同时仍是主要的开源自我改进 agent CLI。
Kimi K3、GPT-6 Astra 和 Claude Fable 5.1 是所有人都跑了一遍的三方价格与延迟对比,K3 是五分之一的价格和六分之一的首 token 时间。
Apache 2.0 的 Qwen3.8-27B 是开放权重的 computer-use 挑战者,在 OSWorld 和 AndroidWorld 上赢过 Opus 4.6 Max,在 Terminal-Bench 和 HLE 上输掉。
Pi 持续被点名为「想自己拥有并且读得懂这个循环」的人会选的 harness。
Temporal、Opik、Modal 和 Kitaru 反复作为生产循环底下的持久化、追踪、沙箱和评估底座出现。
Ecdysis、RSPM 和 Reflective Memory Management 是值得追的三个研究名字,它们攻的是同一个问题:一个能自我修改的系统,能不能被信任去管自己的记忆。
← 上一篇
超级用户日报: 2026-09-14
下一篇 →
灵感雷达: 2026-09-14
← 返回所有文章

评论

加载中...
>_