Loop 日报: 2026年7月31日
今天 autoresearch 不再是 Karpathy 的一条推文,而是变成了一项竞技运动。最清晰的信号:公开排行榜上,成群的 agent 通宵把一个 poolside 模型在 Apple 芯片上越压越快,一群素不相识的人互相叠加彼此的改进,去打赢 Google 的闭源结果。这套循环也在被工业化——Snap 在跑成队的远程编码 agent,OpenAI 有一个模型在优化自己的基础设施,而最厉害的建造者正殊途同归到同一条经验:赢点不在更聪明的模型,而在一个带验证器、循环无法靠嘴糊弄过去的 harness。
#1
@james_y_zou
https://x.com/james_y_zou/status/2082517932714914113
SqueezeEvolve 已被 COLM 2026 接收,现在跑在 Claude Code 里,做的是无验证器的 autoresearch——用模型置信度引导搜索,把工作在多个模型间路由以压成本,从而支持更开放式的探索。标志性结果:ARC-AGI-2 上 97.5%,成本不到一半。这正是 autoresearch 正在成型的样子——置信度引导搜索加上成本感知的模型路由,打包成一个插件。
https://x.com/james_y_zou/status/2082517932714914113
SqueezeEvolve 已被 COLM 2026 接收,现在跑在 Claude Code 里,做的是无验证器的 autoresearch——用模型置信度引导搜索,把工作在多个模型间路由以压成本,从而支持更开放式的探索。标志性结果:ARC-AGI-2 上 97.5%,成本不到一半。这正是 autoresearch 正在成型的样子——置信度引导搜索加上成本感知的模型路由,打包成一个插件。
#2
@soubhikdeb
https://x.com/soubhikdeb/status/2082556460823978062
两场有真实产出的 autoresearch 竞赛。一场里,一群互不认识的 autoresearcher 协作设计出一个攻击椭圆曲线签名的量子电路,在资源需求上把 Google 最近的闭源结果打赢了 50% 以上。另一场刚开一天,众人在 24 小时内就把 poolside 的 Laguna 模型在 Mac(MLX 下)的原始部署提升了 80% 以上。规律是:一个开放竞赛,陌生人互相叠加贡献。
https://x.com/soubhikdeb/status/2082556460823978062
两场有真实产出的 autoresearch 竞赛。一场里,一群互不认识的 autoresearcher 协作设计出一个攻击椭圆曲线签名的量子电路,在资源需求上把 Google 最近的闭源结果打赢了 50% 以上。另一场刚开一天,众人在 24 小时内就把 poolside 的 Laguna 模型在 Mac(MLX 下)的原始部署提升了 80% 以上。规律是:一个开放竞赛,陌生人互相叠加贡献。
#3
@eigenlabs
https://x.com/eigenlabs/status/2082372727248388464
发起了 MLX.fast,一场让 poolside 的 Laguna XS 2.1 在 Apple 芯片上跑更快的 autoresearch 竞赛。每一个被验证的提速都会成为新的公开基线,于是排行榜不断棘轮式上抬。他们的 agent 第一天就找到 36.8%,发帖时已到 47.9%。这是把 autoresearch 做成一个公开、可验证的基准,而不是一次性的通宵跑。
https://x.com/eigenlabs/status/2082372727248388464
发起了 MLX.fast,一场让 poolside 的 Laguna XS 2.1 在 Apple 芯片上跑更快的 autoresearch 竞赛。每一个被验证的提速都会成为新的公开基线,于是排行榜不断棘轮式上抬。他们的 agent 第一天就找到 36.8%,发帖时已到 47.9%。这是把 autoresearch 做成一个公开、可验证的基准,而不是一次性的通宵跑。
#4
@StarscourgeWill
https://x.com/StarscourgeWill/status/2082507464281596070
让 poolside 的 Laguna S2.1 通宵管理一个 Karpathy 式的 autoresearch 循环,效果很好——他还指出它比 Qwen 更有创造力,尤其在提出新的测试点上。最后这点很关键:autoresearch 循环的瓶颈往往是假设生成,一个能提出更好实验的模型,比只是执行更快的模型值钱得多。
https://x.com/StarscourgeWill/status/2082507464281596070
让 poolside 的 Laguna S2.1 通宵管理一个 Karpathy 式的 autoresearch 循环,效果很好——他还指出它比 Qwen 更有创造力,尤其在提出新的测试点上。最后这点很关键:autoresearch 循环的瓶颈往往是假设生成,一个能提出更好实验的模型,比只是执行更快的模型值钱得多。
#5
@MacrocosmosAI
https://x.com/MacrocosmosAI/status/2082498785633251550
把一条来之不易的教训变成了基础设施:任何大规模生产跑,启动配置对不对都是成败关键,于是他们搭了 autoresearch 循环,在投入算力做完整跑之前,先测试各种配置、找出更强的运行参数。结果是持续优化——每次实验都自动让下一次更锋利。
https://x.com/MacrocosmosAI/status/2082498785633251550
把一条来之不易的教训变成了基础设施:任何大规模生产跑,启动配置对不对都是成败关键,于是他们搭了 autoresearch 循环,在投入算力做完整跑之前,先测试各种配置、找出更强的运行参数。结果是持续优化——每次实验都自动让下一次更锋利。
#6
@FanqingMengAI
https://x.com/FanqingMengAI/status/2082324946999738814
放出了 RSIBench-Data,作为通往 AutoResearch 基础设施(统一服务加插件式 harness)的第一步——先数据,再架构、算法和联合优化。他们公开邀请大家拿自己的 Researcher Agent 来跑这个基准(所谓「外包测试」)。这是 autoresearch 的管道层在公开搭建,论文、代码和网站都放了出来。
https://x.com/FanqingMengAI/status/2082324946999738814
放出了 RSIBench-Data,作为通往 AutoResearch 基础设施(统一服务加插件式 harness)的第一步——先数据,再架构、算法和联合优化。他们公开邀请大家拿自己的 Researcher Agent 来跑这个基准(所谓「外包测试」)。这是 autoresearch 的管道层在公开搭建,论文、代码和网站都放了出来。
#7
@TinoWening
https://x.com/TinoWening/status/2082563982196642202
针对每个 autoresearch 循环都会撞上的问题——怎么避免局部最优——他分享自己写了一个种群引导的进化算法,带明确的搜索策略:避免纯爬山,追踪候选家族,变异有希望的想法,淘汰死胡同,进展停滞时注入新意。这是对多数朴素循环径直踩进去的那个失败模式,给出的一个真解。
https://x.com/TinoWening/status/2082563982196642202
针对每个 autoresearch 循环都会撞上的问题——怎么避免局部最优——他分享自己写了一个种群引导的进化算法,带明确的搜索策略:避免纯爬山,追踪候选家族,变异有希望的想法,淘汰死胡同,进展停滞时注入新意。这是对多数朴素循环径直踩进去的那个失败模式,给出的一个真解。
#8
@KryptoBestiya
https://x.com/KryptoBestiya/status/2082397916287684809
一个独立开发者把一套 40TB 的本地硬盘阵列变成了自我改进的 AI 工作流:一个 Obsidian 库完全本地运行,n8n 自动化导入新产出、通宵基准测试 agent、无需手动就保存表现最好的那些。时间线:第一天 40TB 库,第二周持续通宵测试 agent,第二个月第一个可复用 agent,第四个月三个在跑的产品加每月 4200 美元。本地存储把一堆随机实验变成了一个复利循环。
https://x.com/KryptoBestiya/status/2082397916287684809
一个独立开发者把一套 40TB 的本地硬盘阵列变成了自我改进的 AI 工作流:一个 Obsidian 库完全本地运行,n8n 自动化导入新产出、通宵基准测试 agent、无需手动就保存表现最好的那些。时间线:第一天 40TB 库,第二周持续通宵测试 agent,第二个月第一个可复用 agent,第四个月三个在跑的产品加每月 4200 美元。本地存储把一堆随机实验变成了一个复利循环。
#9
@QCXINT_
https://x.com/QCXINT_/status/2082393366978007354
MetaClaw,一个开源的 OpenClaw 自我改进封装器,是把循环用在个人 agent 上:自动给每段对话打分,从真实使用而非合成数据里搭出技能库,agent 每失败一个任务就生成新技能,并在下一次交互时注入系统提示。来自实时使用的持续适配,不用重训周期。
https://x.com/QCXINT_/status/2082393366978007354
MetaClaw,一个开源的 OpenClaw 自我改进封装器,是把循环用在个人 agent 上:自动给每段对话打分,从真实使用而非合成数据里搭出技能库,agent 每失败一个任务就生成新技能,并在下一次交互时注入系统提示。来自实时使用的持续适配,不用重训周期。
#10
@ParikhRajesh07
https://x.com/ParikhRajesh07/status/2082572378224345519
一个关于循环走向的犀利判断:持续学习的 agent(自我改进的 agent/harness 组合)将成为常态,harness 和 RL 环境塌缩成一个运行时/训练时,模型只是众多可训练参数之一,与指令、技能和原语并列。他们开源了一个低层 wire 协议,让 harness 原语符合 POSIX——押注 harness/环境就是那个操作系统层的基础设施。
https://x.com/ParikhRajesh07/status/2082572378224345519
一个关于循环走向的犀利判断:持续学习的 agent(自我改进的 agent/harness 组合)将成为常态,harness 和 RL 环境塌缩成一个运行时/训练时,模型只是众多可训练参数之一,与指令、技能和原语并列。他们开源了一个低层 wire 协议,让 harness 原语符合 POSIX——押注 harness/环境就是那个操作系统层的基础设施。
#11
@saraljain88
https://x.com/saraljain88/status/2082297631989174354
Snap 推出了 Casper,一队自主的远程编码 agent,每周产出数千个可合并的 PR。工程师在 Slack/JIRA 里用大白话描述任务;Casper 起一个隔离沙盒、收集上下文、做最小的安全改动、在构建和测试上迭代到全绿,然后一个单独的 AI 审查器找出问题让 Casper 在人看之前修掉。和 Claude Code 或 Codex 是同一套 agent 循环——不同的是周围的一切:远程、持久、有身份管理、模型无关。
https://x.com/saraljain88/status/2082297631989174354
Snap 推出了 Casper,一队自主的远程编码 agent,每周产出数千个可合并的 PR。工程师在 Slack/JIRA 里用大白话描述任务;Casper 起一个隔离沙盒、收集上下文、做最小的安全改动、在构建和测试上迭代到全绿,然后一个单独的 AI 审查器找出问题让 Casper 在人看之前修掉。和 Claude Code 或 Codex 是同一套 agent 循环——不同的是周围的一切:远程、持久、有身份管理、模型无关。
#12
@wilterrero
https://x.com/wilterrero/status/2082306583124484137
一个在跑的生产循环,不是 demo:每个 agent 从一个按任务大小切分的 GitHub Projects 看板上领取 issue,一个编排 agent 循环全天候运行,保持看板干净、给 agent 派活。简单,但正是这层枯燥的协调,才让多 agent 真正交付。
https://x.com/wilterrero/status/2082306583124484137
一个在跑的生产循环,不是 demo:每个 agent 从一个按任务大小切分的 GitHub Projects 看板上领取 issue,一个编排 agent 循环全天候运行,保持看板干净、给 agent 派活。简单,但正是这层枯燥的协调,才让多 agent 真正交付。
#13
@neonwatty
https://x.com/neonwatty/status/2082458803300094459
/goal 是一个极简的 agent 循环,不断朝一个完成条件工作。关键设计:每一轮后一个单独的评估器检查证据,如果目标没被证明,理由就引导下一轮。这种分离——一个独立评估器给循环把关,而不是 agent 给自己打分——恰恰是今天其他建造者反复落到的那个点。
https://x.com/neonwatty/status/2082458803300094459
/goal 是一个极简的 agent 循环,不断朝一个完成条件工作。关键设计:每一轮后一个单独的评估器检查证据,如果目标没被证明,理由就引导下一轮。这种分离——一个独立评估器给循环把关,而不是 agent 给自己打分——恰恰是今天其他建造者反复落到的那个点。
#14
@pauliusztin_
https://x.com/pauliusztin_/status/2082443523211833636
在拆解了 Claude Code、Codex、OpenCode、Pi 这些编码 agent 几个月后,他给出架构:agent 循环只是一小部分,真正的工程在它周围的一切。一个 headless harness 承载记忆、技能、权限、沙盒、上下文工程、LSP 集成和人在环工作流。把 provider 抽象掉,换模型就是改配置而不是重写;靠快速的 LSP 反馈循环;每次调用都 trace 和 eval,这样一次 prompt 改动不会悄悄让 agent 退化。
https://x.com/pauliusztin_/status/2082443523211833636
在拆解了 Claude Code、Codex、OpenCode、Pi 这些编码 agent 几个月后,他给出架构:agent 循环只是一小部分,真正的工程在它周围的一切。一个 headless harness 承载记忆、技能、权限、沙盒、上下文工程、LSP 集成和人在环工作流。把 provider 抽象掉,换模型就是改配置而不是重写;靠快速的 LSP 反馈循环;每次调用都 trace 和 eval,这样一次 prompt 改动不会悄悄让 agent 退化。
#15
@wandermist
https://x.com/wandermist/status/2082424596691587292
把图工程模式讲成一个能跑的循环:router → planner → specialists → verifier,每个节点只干一件事。五个研究目标一起跑而不是排队,砍掉那些让工作流意外串行的假边,而最要害的一条——绝不让模型给自己的活打分,一个单独的验证器检查准确性、时效性和逻辑。他的结论:更多 agent 很少意味着更好的系统,真正的转变是搞清楚工作到底该在哪里拆分。
https://x.com/wandermist/status/2082424596691587292
把图工程模式讲成一个能跑的循环:router → planner → specialists → verifier,每个节点只干一件事。五个研究目标一起跑而不是排队,砍掉那些让工作流意外串行的假边,而最要害的一条——绝不让模型给自己的活打分,一个单独的验证器检查准确性、时效性和逻辑。他的结论:更多 agent 很少意味着更好的系统,真正的转变是搞清楚工作到底该在哪里拆分。
#16
@gorshunov
https://x.com/gorshunov/status/2082363791971365016
对这套运行模式的干净表述:三个嵌套循环,三种不同节奏。agent 循环以分钟为单位一轮(写、测、读失败、调整、重复),人的判断以小时为单位一个决定,生产信号以天为单位。人们跳过的那一环——建造者不给自己的活打分,一个模型族搭建,另一个检查,一个 critic 给每一轮打分,然后才轮到人批准。多数交付的痛,是一个循环在等另一个循环。
https://x.com/gorshunov/status/2082363791971365016
对这套运行模式的干净表述:三个嵌套循环,三种不同节奏。agent 循环以分钟为单位一轮(写、测、读失败、调整、重复),人的判断以小时为单位一个决定,生产信号以天为单位。人们跳过的那一环——建造者不给自己的活打分,一个模型族搭建,另一个检查,一个 critic 给每一轮打分,然后才轮到人批准。多数交付的痛,是一个循环在等另一个循环。
#17
@fluidstack
https://x.com/fluidstack/status/2082542859748557130
他们自己写了 agent 循环,而不是把一个通用编码 agent 对准自己的网络——还给了个数字:对一个流行 agent 循环的独立分析显示,约 1.6% 的代码是 AI 决策逻辑,约 98.4% 是权限门、上下文管理、工具路由和恢复。他们的点是:通用编码 agent 把安全当成系统提示里的一句客气请求,而他们的安全住在代码里、有测试覆盖。
https://x.com/fluidstack/status/2082542859748557130
他们自己写了 agent 循环,而不是把一个通用编码 agent 对准自己的网络——还给了个数字:对一个流行 agent 循环的独立分析显示,约 1.6% 的代码是 AI 决策逻辑,约 98.4% 是权限门、上下文管理、工具路由和恢复。他们的点是:通用编码 agent 把安全当成系统提示里的一句客气请求,而他们的安全住在代码里、有测试覆盖。
#18
@mfateev
https://x.com/mfateev/status/2082588371302674584
从持久性角度看循环:很多情况下,把 agentic 循环跑在 Temporal 工作流里而不是活动里,是更好的选择。它避免了失败时丢掉 LLM 和工具结果,提供更好的可观测性,并支持长时运行的工具和人在环集成。把循环做成一个持久工作流,而不是一个易失的脚本。
https://x.com/mfateev/status/2082588371302674584
从持久性角度看循环:很多情况下,把 agentic 循环跑在 Temporal 工作流里而不是活动里,是更好的选择。它避免了失败时丢掉 LLM 和工具结果,提供更好的可观测性,并支持长时运行的工具和人在环集成。把循环做成一个持久工作流,而不是一个易失的脚本。
#19
@OpenAIDevs
https://x.com/OpenAIDevs/status/2082580211552457102
递归自我改进的案例被落到实处:他们在 Codex 里用 GPT-5.6 Sol 优化自己的基础设施和性能,这些改进在推理和 agent 循环两头都会复利,用同样的硬件产出更多有用的活。底下的评论才是真正的争论——收益是推理侧的还是碰到了编排层,以及在循环内部削掉延迟会改变一个 agent 每个任务能负担多少次工具调用。
https://x.com/OpenAIDevs/status/2082580211552457102
递归自我改进的案例被落到实处:他们在 Codex 里用 GPT-5.6 Sol 优化自己的基础设施和性能,这些改进在推理和 agent 循环两头都会复利,用同样的硬件产出更多有用的活。底下的评论才是真正的争论——收益是推理侧的还是碰到了编排层,以及在循环内部削掉延迟会改变一个 agent 每个任务能负担多少次工具调用。
#20
@sudoingX
https://x.com/sudoingX/status/2082516711484633514
一场以循环收尾的严谨对决:在把 poolside 的 Laguna S 2.1 封为单台 DGX Spark 之王后,他坚持要一个真对手(NVFP4 下的 Qwen 3.5 122b,同一重量级、同一 vLLM、两边都开 MTP 投机解码),确保没有任何一边被做局,然后把它装进 agent 循环拿真实数字。这种纪律——让模型去打一个跟它同体量、且真能上场的对手——正是把基准和感觉区分开来的东西。
https://x.com/sudoingX/status/2082516711484633514
一场以循环收尾的严谨对决:在把 poolside 的 Laguna S 2.1 封为单台 DGX Spark 之王后,他坚持要一个真对手(NVFP4 下的 Qwen 3.5 122b,同一重量级、同一 vLLM、两边都开 MTP 投机解码),确保没有任何一边被做局,然后把它装进 agent 循环拿真实数字。这种纪律——让模型去打一个跟它同体量、且真能上场的对手——正是把基准和感觉区分开来的东西。
#21
@firesidealpha
https://x.com/firesidealpha/status/2082594057927434304
Meta 的 Alexandr Wang 谈为什么循环才是前沿:内部他们见过这样的情况——有了对的 agentic 循环加上对的 eval 或指标让 agent 去优化,一群 agent 完成的活比 100 人的工程团队还多,「非常非常轻松」。他把搞清楚这些 agent 协调问题,称为当下这个领域最有意思的问题之一。杠杆是循环加一个好 eval,而不是模型单打独斗。
https://x.com/firesidealpha/status/2082594057927434304
Meta 的 Alexandr Wang 谈为什么循环才是前沿:内部他们见过这样的情况——有了对的 agentic 循环加上对的 eval 或指标让 agent 去优化,一群 agent 完成的活比 100 人的工程团队还多,「非常非常轻松」。他把搞清楚这些 agent 协调问题,称为当下这个领域最有意思的问题之一。杠杆是循环加一个好 eval,而不是模型单打独斗。
📡 生态产品雷达
生态产品雷达
Karpathy autoresearch —— 几乎每个 autoresearch 循环都引用并 fork 的参照范式。
poolside Laguna —— 本轮大家在公开竞赛里抢着优化的那个模型。
Claude Code —— autoresearch 插件(SqueezeEvolve)和自我改进循环反复瞄准的 harness。
Codex —— 同样这些循环(包括 OpenAI 自己的自我优化)在跑的另一个 harness。
Hermes (Nous Research) —— 自我改进和持续学习 agent 方案里反复出现的 harness。
Karpathy autoresearch —— 几乎每个 autoresearch 循环都引用并 fork 的参照范式。
poolside Laguna —— 本轮大家在公开竞赛里抢着优化的那个模型。
Claude Code —— autoresearch 插件(SqueezeEvolve)和自我改进循环反复瞄准的 harness。
Codex —— 同样这些循环(包括 OpenAI 自己的自我优化)在跑的另一个 harness。
Hermes (Nous Research) —— 自我改进和持续学习 agent 方案里反复出现的 harness。
评论