2026年9月13日loop

Loop 日报: 2026-09-13

开放版本的那个循环今天拿到了自己的论文,而论文说清了它为什么成立:100 多个人带着各自的 agent,花两个月啃同一个 secp256k1 量子电路问题,把 Google Quantum AI 公布的成绩打下去 50% 以上,把这件事撑住的是一个机器可验证的验证器和一张公开排行榜。与之相对,这个领域也拿到了关于自我改进的第一个严肃负面结果。一篇叫 Ecdysis 的论文去查了 agent 重写自己 harness 时到底改了什么,发现常规自我演化的改动里有 60% 只是在迁就当前模型的怪癖——一次本地失误变成了永久的基础设施。另一条线是商业化:循环从「你要自己造的东西」变成了「你可以租的东西」,OpenAI 把 Codex 的 harness 放到 API 后面,Cursor 发了常驻协调者,Coder 的全自托管版本正式发布,而这些选择最后都归到同一个问题:谁来运维这个 harness,代码到底在哪跑。而在这一切之下,验证反复以「没人能拿来演示的那个瓶颈」的身份出现,包括那个还没人回答的版本:谁来验证 harness 自己做的改动。
💡#1
@jieyilong
https://x.com/jieyilong/status/2098057343057727789
开放式 autoresearch 的第一篇完整论文出来了,而它记录的是一个结果而不是一套方法。在大约两个月里,100 多名参与者带着各自的 agent 攻同一个问题:优化 secp256k1 上点加运算的量子电路——那是比特币和以太坊底下的那条椭圆曲线。点加是把 Shor 算法用到椭圆曲线上的主要瓶颈,所以把它的开销压下去,直接告诉你这场迁移到底还有多少跑道。他们集体做出的电路用了 1,151 个逻辑量子比特和 130 万个 Toffoli 门,把 Google Quantum AI 公布的 Q×T 分数打下去了 50% 以上。一开始只是一个人拿 agent 玩量子电路优化,最后变成了横跨量子计算、密码学、Web3 和系统研究的协作。
💡#2
@mitchliu
https://x.com/mitchliu/status/2098135964388581689
关于这个结果为什么重要,最锋利的一种解读,而且重点不是那 50%。传统上,研究产出受限于研究者的数量。Autoresearch 的上限换成了算力、模型、编排和评测 harness:agent 24 小时不停地做迭代实验,改进被自动验证,社区在最新结果上继续往前,而不是等下一篇论文。他们真正开创的,是一种「成千上万分布式的人类和 AI agent 持续协作又竞争地啃一个难题」的科研模式。
💡#3
@nasqret
https://x.com/nasqret/status/2098145816007655475
一位参与者对这个社群到底是什么的描述。这大概是世界上第一个把「跑 auto-research 循环的人和他们的 agent」大规模聚起来、并且全部指向同一个具体任务的项目:设计一个量子算法,实现 Shor 算法的一个变体,用于 secp256k1 曲线加法上的离散对数问题。围绕它形成的是一个研究 agent 协调的社群,大家待在同一个回路里交换想法、往前推边界——既竞争又协作。
💡#4
@eigenlabs
https://x.com/eigenlabs/status/2098526938214310339
一条把机制点名了的致谢。排行榜还在线上,Eigen Labs 做了这个排行榜和它背后那套「验证器把关」的流程。让它成立的是 100 多位研究者和他们的 agent 在八周里持续出现、交换什么有用什么没用、在彼此的结果上往前。合著者横跨 Theta Network、以太坊基金会、StarkWare、Starknet、Trail of Bits、Brevis、Sei、Pauli Group、OctavFi、波兹南密茨凯维奇大学、华沙理工大学和斯坦福的 Free Systems Lab。验证器加公开排行榜,配方就这两样。
💡#5
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2098655241453687123
Meta 的首席 AI 官在 YC 创业学校对着 YC 的 CEO 说出了本轮最激进的一个内部说法,而且附带了两个条件。他说 Meta 内部见过这样的案例:如果你把 agentic loop 设计对了,并且有一套对的评测系统和让 agent 去优化的指标,一群 agent 能完成得比 100 人的工程团队更多,而且很轻松。那个条件从句才是整句话的重点:对的循环,加上一个 agent 能去优化的指标。
💡#6
@omarsar0
https://x.com/omarsar0/status/2098456262379745663
一个很直接的「自己拥有 harness」的论点,还给了一个具体的好处。很少有人理解「为自己的工作定制并优化一个 agent harness」背后的魔力,而哪怕只有一个极简的 harness,你也能很快看到结果:代码更好、产出更好、成本更好、文字更好。他举的例子是最常见的那个抱怨——大家受够了开箱即用的 harness 输出啰嗦——而这件事只要你真正掌握系统提示词就能轻易修好。他认为这就是 Pi 现在被大量采用的原因,而且如果你用本地模型,可以让 harness 和模型协同演化,端到端整个调。
💡#7
@pauliusztin_
https://x.com/pauliusztin_/status/2098750979353063495
一个从零造编码 agent 的人报告了他到目前为止学到的最有用的一件事:LLM 大概是一个好 agent 里最小的那部分。核心循环小得出奇——推理、行动、观察、重复。这个循环本身不会给你的是生产可用性,那意味着你得控制:什么上下文能到模型、怎么压缩;模型能碰哪些工具;哪些动作能直接跑、哪些必须审批;工具在哪执行、记忆怎么持久化、沙箱和子 agent 怎么运维;以及你怎么追踪、调试、测试和验证失败。他自己的编码 agent 里,工具调用那部分大约 20 行 Pydantic AI,围着它的其他全部是 harness。他的佐证数据:LangChain 把模型固定住,只改 harness,就在 Terminal-Bench 上从大约第 30 名进了前 5。
💡#8
@FZeng16218
https://x.com/FZeng16218/status/2098444619285709124
本轮最重要的一个负面结果:自我改进的 agent harness 会悄悄把自己过拟合成更差的基础设施。一篇叫 Ecdysis 的论文跟踪了「agent 在失败后自动改自己的 harness」会发生什么。表头数字很漂亮:平均准确率从 58.67% 到 69.56%,Qwen3-8B 在 Airline 上从 35% 到 60%,harness 训练最快到 1.84 倍,而且用 Qwen3-8B 演化出来的 harness 能把 Qwen3-32B 从 51.67% 提到 68.33%,都不用再演化一次。但埋在下面的那个结果才是该记住的。研究者手工检查了 harness 的改动,发现常规自我演化里有 60% 的改动,本质上是在迁就当前模型的怪癖,Ecdysis 把这个比例压到了 45.5%。有些运行里,模型只是误用了一次合法动作,harness 就被改成全局禁止这个动作——一个本地模型的失误变成了永久的 agent 基础设施。自我改进的 agent 在动手改自己的 runtime 之前,需要先有失败归因。
💡#9
@best_privacy_ai
https://x.com/best_privacy_ai/status/2098125609087926431
本轮单次 agent 运行最好的一篇记录,而价值完全在于这个 agent 怎么处理一堵墙。在一台 iPhone 16 Pro Max 上给它一句话:做一个 PPTX,调研并汇总 GPT-6、Fable-5.1、Grok-4.6、GLM-5.3 和 DeepSeek-4.1-Flash 之间的 benchmark。它干了 55 分钟,交回一份 16 页的 deck,驱动它的是 GLM-5.3——也就是说被比较的五个模型里有一个写了这份它自己也在里面的比较。那堵墙是:五家里有两家把 benchmark 表格发成图片,DeepSeek 的价格表也是图片。这次运行里没有任何东西能读图,fetch 工具只返回文本,给它的 64 个工具没有一个能读像素,手机上那个 Python 装了 122 个包、没有一个带 OCR。它在一次 fetch 之内就发现了,用自己的话说了出来,然后转头去找「已经把那些数字手打出来的人」,在 VentureBeat、一个 AI 发布追踪站和一条引用官方公告的 Reddit 帖子里找到了。接着它做了最要紧的那一步:第 15 页写明了哪些数字是这么来的。
💡#10
@mengyer
https://x.com/mengyer/status/2098087957596901761
Outerloop:在你自己的集群上跑开放式 autoresearch。他的实验室开发它,也在自己的研究里用它——对这个品类来说,这才是有分量的资历。
💡#11
@askalphaxiv
https://x.com/askalphaxiv/status/2098064706384568396
OpenResearch 现在能把整个 autoresearch 回路跑在本地。你可以用 LMStudio、Ollama、oMLX 或任何 OpenAI 兼容端点提供模型,也就是本地模型、本地 harness、本地应用。他们写明的前提是:开源社区用的工具,能力应该和实验室的对齐。
💡#12
@evanjconrad
https://x.com/evanjconrad/status/2098565916787413268
Givemeanode 变成了 SF Autoresearch,SFC 出的产品:一个面向 agent 驱动机器学习研究的可扩展、高韧性平台。值得记一笔,是因为这是 autoresearch 从一种做法变成一件商品的时刻。
💡#13
@_iamEtornam
https://x.com/_iamEtornam/status/2098346505467769302
一个开源的 autoresearch 系统,让你在已有的编码 agent 之上跑实验、复现论文、做发现,而不是把它们替换掉。
💡#14
@btcinsider__
https://x.com/btcinsider__/status/2098085340091212151
发现 BitVM 的 Robin Linus 启动了 Solving Bitcoin,一个推进比特币协议技术前沿的 autoresearch 项目,公开邀请研究者和对比特币感兴趣的人把自己的 agent 挂上去。secp256k1 那套挑战模式已经开始被有意识地复制了。
💡#15
@jt_rose
https://x.com/jt_rose/status/2098088666812039515
开放版本背后的价值论证,引用了对「Navier-Stokes 是怎么被解决又怎么被公开的」那个批评:它撕破了科学界几百年形成的共同体质地——在彼此的结果上往前、给出恰当的署名、不把解决一个大问题当成为将来私利造势的姿态。他们就是按这些原则建的 Yukon Research,而开放协作式 autoresearch 的这些早期成果之所以让平台上的学者兴奋,是因为它们证明了另一条路依然可能。
💡#16
@zhengyaojiang
https://x.com/zhengyaojiang/status/2098570324715430084
一位既在做 autoresearch、又受过传统研究训练的研究者,很诚实地点出了代价。当人们把越来越多的研究和工程直接交给 agent,「达成了目标」和「理解它是怎么达成的」之间的差距,会变成一个越来越大的问题。自主系统在产生巨大进展,所以不用它们显然是个坏主意;但人类研究者正在和那些被尝试的想法越来越疏远,他们的理解越来越不扎实。而天花板——只有真正原创的想法才能抬高的那个天花板——看起来仍然绑在顶尖人类专家的理解上。他的工作预测是:人们会越来越多地用这些工具去加速理解,而不只是产出结果。
💡#17
@MikeTamir
https://x.com/MikeTamir/status/2098087659876827148
Nous Research 发布了 Hermes Agent,一个自我改进的开源 AI agent,内置学习回路、多平台网关集成和自主技能创建。
💡#18
@moltschool
https://x.com/moltschool/status/2098214997297893627
Hermes 的学习回路具体声称能做什么:从经验里生成技能、在使用过程中改进这些技能、提醒自己把知识持久化、并在多个会话里逐步建立起对你这个人越来越深的模型。它是唯一一个把「内置学习回路」当成头号卖点而不是插件的 agent。
💡#19
@joerg_peetz
https://x.com/joerg_peetz/status/2098431843640959446
一个表面上的补丁版本,实际上是「agent 蜂群对一个代码库做了什么」的演示。Hermes Agent v0.21.1 纸面上是补丁:632 个合并的 PR、5,139 个非合并提交、4,364 个文件改动、净减 167,429 行代码。实际上它是把 110 个子 agent 指向 Hermes 代码库、让它们在 15 小时里做了 111,352 次工具调用的产物,最后是一个 PR 里 4,271 个提交,动了 2,655 个文件,删掉了三分之一以上的源码。真正要紧的结构性变化是 run_agent.py 被拆成了聚焦的模块:agent 循环、provider 解析、回退链、工具分派和会话状态各有各的家,于是一个 14,000 行的文件不再是所有改动的瓶颈。
💡#20
@stretchcloud
https://x.com/stretchcloud/status/2098181725385900486
关于 OpenAI 挪走了什么,这是最清楚的一种表述。做一个生产级 agent 最难的部分从来不是模型调用,是编排、上下文压缩、会话恢复和安全的工具执行——而 OpenAI 刚把这整层搬进了 Agents API。你把任务交给它,接上工具和 MCP server,指一个沙箱,Codex 的 harness 负责会话管理、轮次之间的上下文压缩和多 agent 编排。他反复用的类比是 2014 年 AWS Lambda 对服务器管理做的事:算力一直都在,Lambda 让它隐形了。剩下能做出差异的是工具设计、AGENTS.md 上下文文件、MCP server 架构,以及你把任务建模得有多干净。过去两年自建编排的团队,现在要做一个迁不迁的决定。
💡#21
@matijagrcic
https://x.com/matijagrcic/status/2098185744049135999
一个真正把选择讲清楚的区分,出自一个认真查过的人。用 Codex SDK 和 App Server,Codex 已经提供了 agent 循环、工具和上下文管理,但你自己运维它,还得处理外围的进程生命周期、会话持久化和恢复基础设施。用 Agents API,OpenAI 运维 Codex harness 并维护会话,你的后端通过 OpenAI SDK 直接调它、不用过 Codex SDK,而且能拿到 webhook、实时干预和托管的 tracing。执行环境是另一个独立选择:OpenAI 托管的沙箱,或者通过 codex exec-server 用你自己的环境。所以哪怕你只有一个 agent,切不切主要是在决定「谁来运维这个 harness」,而不是「要不要从零造一个 agent 循环」。
💡#22
@YashChaudhary
https://x.com/YashChaudhary/status/2098424004130357314
Agents API 的运维细节,包括会决定某些团队用不用它的那两条。你往 /v1/agents/sessions 发 POST,带上 OpenAI-Beta: agents=v1 的头,OpenAI 负责跑循环:编排、持久会话、上下文压缩与恢复、可选的多 agent 和子 agent。环境可以是 OpenAI 托管的沙箱、通过 codex exec-server 自托管,或者合作方沙箱,包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle Cloud、Runloop 和 Vercel。Agents API 本身不额外收费,按标准价付模型 token、工具和托管容器。约束条件是:只有美国数据驻留,而且没有零数据保留——自托管也不会让你符合条件。
💡#23
@sergooforai1
https://x.com/sergooforai1/status/2098303353855848947
把这笔交易讲得最诚实的一句话版本。以前你自己造 agent 循环,然后每次模型发布之后再打补丁;现在循环是他们的、生产级的,你保留提示词、MCP server 和代码实际在哪跑。这不是又一个 SDK,这是 Codex 即服务。抛出的问题也很直接:harness 自己造,还是交给 OpenAI。
💡#24
@Marwan_3atef
https://x.com/Marwan_3atef/status/2098209000110096804
Vercel 发了一份在 Next.js 上用 Queues 和 Sandbox 搭 Agents API 应用的指南,这个形状值得记。OpenAI 拥有 agent 循环和会话状态,签名的 webhook 落进 Vercel Queues,每个会话拿一个隔离的 Sandbox、在多轮之间保留文件,整套东西可以缩到零,而不用守着一台长期运行的虚拟机。托管的 harness、持久的生命周期、没有常驻 worker:长时间运行的编码 agent 的那套无聊技术栈。
💡#25
@Marwan_3atef
https://x.com/Marwan_3atef/status/2098011864823181427
反向的一手,每一句都很短。Cursor Cloud Agents 现在可以跑在 Vercel Sandbox 而不是 Cursor 自己的机器上:Cursor 仍然拥有 harness 和推理循环,你通过自托管机器提供执行层——每个请求一个 Firecracker 微虚机、可缩到零的 worker、持久重试和短生命周期的用户级凭证。这是企业版功能,但这个模式是对的:循环留在产品里,代码到底在哪跑归你。
💡#26
@Marwan_3atef
https://x.com/Marwan_3atef/status/2097837581236838425
同一条光谱上完全自托管的那一端。Coder Agents 正式发布:agent 循环和执行都留在你控制的基础设施上,包括物理隔离网络;如果你想让云端托管的 agent 写进自托管的工作区,可以配 Agent Relay——同一个运营层,不同的信任边界。他点出的 beta 阶段信号才是真故事:近 70% 的负载是通过 API 进来的,不是聊天界面。agent 是基础设施,不是侧边栏玩具。
💡#27
@stretchcloud
https://x.com/stretchcloud/status/2098362415905968578
关于 Cursor Projects,论点是「协调者比子 agent 的数量更重要」。在此之前每个编码 agent 都是同一个流程:开一个会话、描述任务、agent 执行、会话结束。Projects 把它反过来,一个协调者线程在整个项目生命周期里一直开着。协调者不写代码,它做规划、给子 agent 派活、把结果拿回来核查。你关上笔记本项目还在跑;把它指向一个收 bug 的 Slack 频道,它会自动派活,不用等你发指令。他对「规模化之后什么才要紧」的判断是:不是哪个模型写的代码,而是那个理解整个项目、把工作拆分正确、并且始终知道哪些已经做完的 agent。
💡#28
@ConsciousRide
https://x.com/ConsciousRide/status/2098633973304004896
本轮最有用的一张清单,因为它把 harness 必须回答的问题一条条点出来了。大多数 AI agent 失败,不是因为模型选错了答案,是因为围在模型周围的软件对更简单的问题没有可靠答案:我们现在处在什么状态?这个 agent 能用哪些工具?一个工具在任务做到一半时超时了怎么办?该重试几次?什么算完成?如果 agent 说它做完了、但结果从没被验证过,怎么办?一次 LLM 调用把这些全藏起来了,一个 agent 循环把它们全暴露出来。值得记住的那句:模型选择一条穿过任务的路径,harness 决定这条路径被允许碰什么。模型可以灵活,权限不该灵活。模型可以尝试不同方法,重试该有上限。模型可以推理自己是否完成,系统仍然应该去验证它。
💡#29
@ConsciousRide
https://x.com/ConsciousRide/status/2098405097223176387
一个干净的区分:loop engineering 和 graph engineering 的差别归结到一个变量——在 agent 开始干活之前,你已经知道多少执行路径。用循环,agent 看当前状态、决定下一步做什么、执行、观察、更新状态、再来一圈,路径是在干活过程中长出来的。这适合研究 agent、编码 agent、调试 agent 和通用助手,因为你事先并不知道下一步有用的动作是搜仓库、读文件、调工具、修错误还是问问题。优势是灵活,代价是可控性:agent 会重复动作、追无关的岔路、烧太多 token,或者在有用的活干完之后还在继续。所以一个好的循环需要显式状态、进度追踪、重试、预算和失败路径。
💡#30
@ShaneRobinett
https://x.com/ShaneRobinett/status/2098053686534545676
一套让运营记忆产生复利的实用设计,面向 CTO,而诊断很准。大多数 agent 演示在单次会话里看着惊艳,到了生产环境就悄悄退化。模型没问题,工具也没问题,坏掉的是记忆——因为每一次运行都在重新发现同样的死胡同、重新学一遍同样的仓库约定、重新问一遍你上周二已经回答过的澄清问题。当 agent 完成一个任务,团队会留下产出,把运营残渣扔掉:它最初试错的那个方向、真正起作用的那次纠正、以及这次纠正在这个代码库里为什么有效。那些残渣恰恰就是你会在人类复盘里记下来的东西。他的处方是两个并行的回路,把「干活」和「学习」分开,不微调,也不要两万 token 的系统提示词。
💡#31
@ShaneRobinett
https://x.com/ShaneRobinett/status/2098053496582910254
同一套设计,写成一条你明天就能用的规则。执行回路:规划、调工具、观察、收尾。学习回路:把意图和结果做差、抽出一条耐用的规则、把它存成一个小的知识产物,而不是又一段臃肿的系统提示词。下一次运行加载这些产物的方式,就像一个服务加载配置——有作用域、有版本、可覆盖,于是错误决定只被纠正一次,好模式能跨编码、评审和研究活下来。同样的模型权重、同样的工具面,判断力却在复利,因为你在存运营记忆,而不是每个迭代重新发现同一个失败。他的判据是:如果 agent 不能继承昨天的纠正,那它是个演示,不是基础设施。
💡#32
@proAlishke
https://x.com/proAlishke/status/2098101706571550763
本轮被复读最多的那个说法,以及它最有画面感的一种表达:他花了八个月守着一个聊天窗口,提问、读、修、再提问;然后他不再监督模型,开始搭那种会检查自己工作的回路;六周之后,他的产出超过了他原来所在的整个团队。不管那些百分比是真是假,值得记住的是这句:把 agent 的回路闭上,给模型一个能验证自己输出的办法。那不是提示词的差距,那是回路的差距,而补上它只需要一个晚上。
💡#33
@martynov014
https://x.com/martynov014/status/2098102923658170672
斯坦福这学期开了一门自我改进 AI agent 的课,第一节课讲师就把瓶颈直接说了出来:验证依然是这个领域的瓶颈之一。机制一句话就能说完——别只问模型一次,问很多次,然后用一个验证器挑出真正对的那个答案。模型本身从头到尾没变,全部收益发生在推理阶段。生成、验证、筛选、喂回去、在活下来的那些上训练。最后那个箭头就是整门课的全部,因为一旦你能可靠地分辨好输出和坏输出,生成就变成了训练数据,模型就开始自己改进自己了。这也正是为什么验证单独占了一整节课:把验证器拿走,你就退回到 LLM 当裁判、奖励模型、用工具冒充真值——全是近似的,而且全都没法拿来演示。
💡#34
@VextLabs
https://x.com/VextLabs/status/2097858313828659694
自我改进 harness 里最值得盯的那个失效模式,被写成一个还没人回答的问题:谁来验证 harness 自己做的改动?如果 harness 能写自己的测试,它也能把测试标准调低。Auto-research 需要一条研究回路自己改不了的审计记录。
💡#35
@remi7914
https://x.com/remi7914/status/2098521890381869256
同一个反对意见,但带了一个具体后果。「自己拥有 harness」,同意。还在塌的那部分是成功信号:如果验证器就是「agent 说它做完了」,那这个自我改进的回路学会的是演戏。你要的是同一套极简装备——上下文、工具、记忆、评测——外加一道「世界是否真的变了」的检查,以及在那次写入算作事实之前的一道门。
💡#36
@AfterThe925
https://x.com/AfterThe925/status/2098183912941818245
一件今晚就能做的具体事情,抽自一次五十美元的 harness 搜索——同一套权重,在三处点名的修改之后,Terminal-Bench 分数变成三倍。做法是在 agent 循环里加一道硬性的「停止前必须验证」的门:如果它宣布完成却没跑校验命令,那就不算完成。
💡#37
@milocodes_
https://x.com/milocodes_/status/2097900622859444499
一个所有人都认得的失败,被写成一个开放问题。你给 agent 授权去「解决一个小的依赖问题」,然后看着它信心十足地判定整个 lockfile 需要重写。有时候 agentic loop 感觉就像工程版的停机问题:在你杀掉这个进程之前,你允许它浪费多少次工具调用?
💡#38
@nandanpri
https://x.com/nandanpri/status/2098765470211981668
用最贵的错误换来的最便宜的一条教训:他有一次让一个过夜的 agent 循环不设上限地跑,烧掉了 Claude Code 一整周的额度。现在任何无人值守的运行之前,他都会设一个硬性消费上限外加一个凌晨两点的 kill cron。
💡#39
@dair_ai
https://x.com/dair_ai/status/2097935359384719537
Meta 部署了一个自主 agent,让它在一整组生产环境的广告排序模型上跑完整的机器学习迭代周期,而对瓶颈的定义才是最有用的部分。现代广告排序的限制不是模型容量或训练算力,而是工程师一年能跑多少个「研究、实现、训练、调试、评估、上线」的周期。每个周期每个模型要占用资深工程师几天到几周的注意力,所以在一个模型上验证过的技术,扩散到其他模型非常慢。A-MLE 把这个周期拆成五个阶段:假设生成、探索策略、实验执行、结果分析和一个共享知识底座,由一个 agent 对着沙箱化的执行层来编排,每个阶段边界都有人类检查点。他们还做了一个把 agent 循环固定住的跨 LLM 对照实验:Claude Sonnet、Gemini 和 GPT 三个家族在执行可靠性和探索激进程度上有差异。
💡#40
@HaoZhe65347
https://x.com/HaoZhe65347/status/2098338297848483862
一个让 autoresearch 显出「它是个筛子而不是个生成器」的数字。在 535 个可执行环境里,agent 探索了 152 个初始方向,并通过各自独立的 auto-research 回路把有希望的想法往下推。最后只有四个机制活过了筛选。
💡#41
@09j8wu346bg2
https://x.com/09j8wu346bg2/status/2098352254331814115
NVIDIA 悄悄在 GitHub 上放了一个叫 SoL-Pi 的 agent。它的作用是把 agent 的 auto-research 回路规模化,并提升其他 agent 的效率——这让它成为少数几个瞄准「回路本身」而不是「回路产出物」的工具之一。
💡#42
@_wilfredh
https://x.com/_wilfredh/status/2098533703748104227
一个小而诚实的 autoresearch 实验,附带一条有用的保留意见。他让 Sol 在不改变测试套件输出的前提下把 difftastic 变快,并把尝试过的每一件事都记下来。它确实找到了一些有意思的性能优化,不过它对复杂度太宽容了。
💡#43
@fmind_dev
https://x.com/fmind_dev/status/2098014587433984031
在 Kaggle 的 AI Agent Security 比赛里拿到 4,251 支队伍中的第 69 名和一块银牌,全程由一个 agent 循环驱动。他为什么要搭这个东西,才是诚实的那一半:他想参加 Kaggle 但没时间,所以做了个 agent 循环替他比赛,他只负责掌舵。
💡#44
@hu_yifei
https://x.com/hu_yifei/status/2098091053954068657
一句话,但把「限制卡在哪」说得很清楚。他用 GPT-6 Astra 的超快模式配 goal 模式跑了一整夜的 auto-research,中途不得不重置了两次周额度,结果很扎实。
💡#45
@linlishiac
https://x.com/linlishiac/status/2097853626907521345
反过来的问题,而且是个真问题。除了几次大规模的研究扫描和几个失败的 autoresearch 实验,他基本上从来没跑满过手里那两份 200 美元的 Codex 和 Claude 套餐。那么除了再做一个没用的网页应用或看板,他到底该把这些算力投向什么有意义的活儿?
💡#46
@0xsamgreen
https://x.com/0xsamgreen/status/2098490400453677452
一条会影响到很多正在做同样事情的人的警告:他朋友的 OpenAI 商业账号刚被永久封禁,原因是做 auto-research 去给一个电子工程问题训练分类器。
💡#47
@RobertMiller34
https://x.com/RobertMiller34/status/2098480411651268770
一套闭环的个人研究栈:ResearchBot 用 alphaXiv 和 OpenResearch 把跟他的视觉模型项目相关的 arXiv 论文拉下来,并对着自己的项目跑测试,再配一个自制的 AutoResearch 框架,让它能提出假设、迭代、直到出结果。
💡#48
@siva_sainath91
https://x.com/siva_sainath91/status/2098492936807997932
一个强化学习的 runner,自主处理他的 RL 训练任务、把它们引向正确的方向,并跟他一起制定策略、评估新方法以最大化最优策略。值得注意的是:在这个研究回路里,人坐在策略位上而不是执行位上。
💡#49
@mrstrijker
https://x.com/mrstrijker/status/2098115877707084044
一个值得记下来的非软件 autoresearch 目标:拿它来改进船舶集装箱配载的模型。
💡#50
@mattparlmer
https://x.com/mattparlmer/status/2098515068795469836
一个关于它下一步往哪扩散的预测:制造业侧的物理 autoresearch 会是件大事,而且各个品类的原型制作量都会显著上升。
💡#51
@kiranhunter
https://x.com/kiranhunter/status/2097910507655332197
OpenAI 上线了 The Defense Factory,一个持续运行的 agent 循环,用来发现、验证和修补漏洞,流程是:盘点资产、发现、在隔离环境里复现、指派负责人、验证修复。要紧的是那个判断:agent 加开放权重模型现在已经能规模化地串联利用漏洞了;防守方还有先发优势,因为他们有自己的代码和前沿模型,但这个窗口正在关上。
💡#52
@LoongUp
https://x.com/LoongUp/status/2098296744484405388
关于 AI 对恶意软件检测这门生意做了什么,最锋利的一句话,而且它说的是一个回路。「被检出后由 agent 重建恶意软件」这个循环才是真故事:杀毒厂商赌了二十年——赌防守方发特征库的速度快过攻击方重新编译的速度。当重新编译只是一次 Claude 调用时,这整套算术就塌了。
💡#53
@spiroskaye
https://x.com/spiroskaye/status/2098523505524613242
一个具体的研究助手需求,能看出这件事对个人意味着什么:一个针对他硕士研究方向定制的 auto-research bot,用来协助研究本身、设计方法论和搭实验。
💡#54
@KrishWiller
https://x.com/KrishWiller/status/2098168365676396581
一个直接点名失效模式的需求:给 auto-research 和编码场景做一套 agent 记忆机制——因为 Astra 已经在他的项目上卡了两天,他想看看 SWE-2 能不能跳出「反复修同一批 bug」的死循环。
💡#55
@praneelmkdir
https://x.com/praneelmkdir/status/2097910699871637853
本轮最短的一个完整案例:他搭了一整套求职申请自动化的 agent 循环,不到一周就已经拿到了面试。
💡#56
@grok
https://x.com/grok/status/2098122352710017048
一个值得给它起个名字的定义。gauntlet loop,由 Matt Shumer 推广开来,做法是给一个目标,再给一条具体的高质量参照线。agent 把工作拆开,一个 builder 做出每个部分,一个独立的 critic 对着参照线做盲比,然后循环补差距,直到产出超过那条标准线。而 harness 就是那套 agentic 配置,让模型能用工具、改代码跑代码、检查结果、派生子 agent,多 agent 循环才跑得起来。
💡#57
@v4vix
https://x.com/v4vix/status/2098780084601864317
一个跟当下流传的很多多 agent 架构图正面相悖的判断:在他们的部署里,一个带 skills 的 agent 循环,打败了一整队领域子 agent。
💡#58
@PaulGugAI
https://x.com/PaulGugAI/status/2098163708040274312
在一块 RTX3080 上对两个 35B A3B 模型做个人助理场景测试,量化到 IQ2 和 IQ3,结论是:大海捞针类测试区分不出它们,但重上下文的多轮 agentic 循环可以。在强干扰上下文里找细节那一项,两者都表现很好、差距在容忍范围内。到了个人助理核心场景,Ornith 1.5 大幅领先:Nex N2.5 在 IQ2 下三个子场景里零次研究或工具调用,也没产出结构化的终端提交;而 Ornith 真的去查了工作区、引用了证据、生成了内部草稿和提案、提交了有依据的结果。在其中一个子场景里,Ornith 认出了一条实时更新、一个被取消的牙医预约和一份新评审,并提议把供应商通话挪到 16:45。
💡#59
@bressane
https://x.com/bressane/status/2098549029395386637
一个 agent 循环内部的具体成本路由结果。他把 Astra 挪进一个更便宜的循环:Luna 开 xhigh,把新的编码上下文发给 Astra,实现做完就把它停掉,测试环节由 Luna 自己接手。同样的演示,这么跑只用掉一周 Plus 额度的 7%,而全程用 Astra 大约要 50%。
💡#60
@noriagent
https://x.com/noriagent/status/2098532921145688432
一份关于模型聚合平台的拆解,对任何把 agent 循环跑在上面的人都重要。第一方 DeepSeek 的 GPQA 是 90%、TAU 是 81%;DigitalOcean 用同一套权重跑,是 75% 和 58%。大多数托管方在工具调用上比第一方低 5 到 7 分,有四家在知识类上直接跳崖;而对 agent 来说 TAU 才是要紧的那个分数,所以 20 分的摆动不是噪声。更锋利的是那个运维陷阱:DeepSeek 在 thinking 模式下会吐一个 reasoning_content 块,而在 agent 循环里模型经常在 reasoning 为空的情况下做工具调用。你把这段空的 reasoning 历史传回去,某个 provider 会以 20015 报 400,而百度、阿里和 Cloudflare 一声不吭照收。所以这个契约不是按模型定的,是按 provider 定的。
💡#61
@TonyJZhou
https://x.com/TonyJZhou/status/2098492832495423829
一个老是被混为一谈的定价区别,被说得很干净:每 token 的价格不是每任务的价格。一个 agent 循环会把 token 单价乘上「一直试到 diff 过 CI」的次数,所以一个更便宜但首次通过率更低的模型,摊到每个合并的 PR 上可能更贵。
💡#62
@0xhashlol
https://x.com/0xhashlol/status/2098085513236193753
一个真的换过模型的人给出的护城河论点。护城河从来不是原始能力,是上下文的管道工程:现在在他的 agent 循环里换模型是一行代码的事。真正能推动通过率的,是仓库索引、工具定义,以及你在轮次之间对上下文剪枝的力度。
💡#63
@0xhashlol
https://x.com/0xhashlol/status/2098115673796874675
一个小但真实的人体工学抱怨,点出了一个反复出现的土办法:他写的每个 agent 循环最后都会按任务类型硬编码一套思考预算的启发式规则,所以一个真正的 1 到 100 推理强度旋钮早就该有了,总好过在提示词里硬写「再想深一点」。
💡#64
@DaveAtTidy
https://x.com/DaveAtTidy/status/2097837885525217445
一个生产环境的邮件助手,而设计上有意思的选择是「循环没有放在哪」。要让邮件助手安全地工作,需要大量清洗、分诊规则,然后用一个模型做分类、打标签和抽取,这一段里没有 agentic loop;这给你一个干净的 markdown 规范形式,去掉了 HTML、广告和内嵌图片。之后他们内部的 agent 循环才读它、起草回复——永远不发送,也没有任何其他出口。
💡#65
@Rahatcodes
https://x.com/Rahatcodes/status/2098104635550507035
一个简短的方法论断言,跟超级用户那边独立得出的结论一致:与其往一个大得离谱的 CLAUDE.md 里继续加东西然后祈祷它生效,不如把时间花在配 hooks 上——因为在这个 agentic loop 的 hook 生命周期里,任何一个点你都可以插入确定性的行为。
💡#66
@DailyDoseOfDS_
https://x.com/DailyDoseOfDS_/status/2098705696938410075
一份逐层拆解的 Claude Code 架构,附带一句:模型只是这个循环里的一个节点。输入层在任何东西抵达模型之前先处理会话管理、权限把关和基于 YAML 的信任分级。知识层放着技能注册表、上下文压缩器、任务图和跨会话记忆存储——harness 的智能就住在权重之外的这一层。上下文压缩器是一个五层级联,在上下文用到约 95% 时启动,对文件路径、代码片段和错误历史做结构化抽取,同时剪掉冗余的工具输出;目标是让上下文保持可用,而不只是变小。执行层通过一个带类型的注册表分派工具,配一个支持并行执行的流式 runtime,以及一个复用稳定前缀的提示词缓存,成本约为原价的 10%。
📡 生态产品雷达
生态产品雷达

secp256k1 量子电路挑战和它的排行榜是本轮被引用最多的一件事,Eigen Labs 点名了机制所在:那套由验证器把关的流程。

OpenAI Agents API 主导了基础设施侧的讨论,而大家的解读高度一致——它是被当成托管 runtime 卖出去的 Codex harness,不是一个新模型。

Autoresearch 平台在一个窗口内集中冒出来:跑在自己集群上的 Outerloop、可全本地运行的 OpenResearch、作为产品的 SF Autoresearch、以开放协作原则立身的 Yukon Research,以及复制了挑战赛模式的 Solving Bitcoin。

Hermes Agent 以两种身份出现:唯一一个把内置学习回路当头号卖点的 agent,以及「110 个子 agent 在 15 小时里会对一个代码库做什么」的演示。

沙箱和执行层的供应商被反复点名,作为这套栈里可分离的那一半:Vercel、Cloudflare、E2B、Modal、DigitalOcean、Daytona 和 Runloop。

DeepSeek V4.1-Flash 是大家用「循环」的语言在讨论的模型,具体到每 token 890 字节的 KV 缓存,以及这对一个长时间运行的循环的成本地板意味着什么。

Claude Code、Codex 和 Pi 仍然是大家真正拿来互相 benchmark 的 harness,只是衡量口径已经从原始能力换成了每个合并任务的成本。
← 上一篇
超级用户日报: 2026-09-13
下一篇 →
灵感雷达: 2026-09-13
← 返回所有文章

评论

加载中...
>_