Loop 日报: 2026年9月1日
这周 autoresearch 不再只是 Karpathy 的一个 demo,它开始变成人们晚上挂着跑一整夜的东西。这套范式正在收敛成一个大家都认得的形状:给 agent 一个目标、一个指标、一个沙箱,让它提出、运行、测量,留下有效的、撤回失败的,然后趁你睡觉时反复来。新东西不是这个循环本身,而是大家把它对准了哪里——对准自己编码 harness 的记忆策略、对准连跑一周的 CUDA kernel 和着色器、对准 proximity gap 的数学猜想、对准会自己 3D 打印零件的实体机器人。而这周最犀利的声音都指向同一个警告:一个没有「能说清哪里失败」的验证器的循环,只是在演戏。下面是真正在跑的东西。
#1
@rochecompaan
https://x.com/rochecompaan/status/2093721424120664449
可能是这周最「套娃」的用法。他在试验一套激进的编码 agent 上下文策略:把工作上下文压到极小、狠删旧对话、把完整历史放在窗口外、再给 agent 工具按需把确切的片段翻回来。然后他把它又抬高一层——用 pi-autoresearch 去优化这套上下文策略本身,给另一个 agent 一个实验环境,让它去发现更好的方式来组织第一个 agent 的工作记忆。他说没找到别人把 autoresearch 式的优化循环专门用在上下文管理上,正在公开求同好。
https://x.com/rochecompaan/status/2093721424120664449
可能是这周最「套娃」的用法。他在试验一套激进的编码 agent 上下文策略:把工作上下文压到极小、狠删旧对话、把完整历史放在窗口外、再给 agent 工具按需把确切的片段翻回来。然后他把它又抬高一层——用 pi-autoresearch 去优化这套上下文策略本身,给另一个 agent 一个实验环境,让它去发现更好的方式来组织第一个 agent 的工作记忆。他说没找到别人把 autoresearch 式的优化循环专门用在上下文管理上,正在公开求同好。
#2
@pwnies
https://x.com/pwnies/status/2093494257105379569
一个具体的、已经跑起来的 autoresearch 循环,叫 Speedlab,用来给网站提速。它拉一份常见的提速改进清单,逐个对你的网站测试,留下成功的候选项。他说看着一个网站自己慢慢变快非常有意思。这是这套循环被剥到最干净的形态:可测量的目标、一池候选动作、留下有效的。
https://x.com/pwnies/status/2093494257105379569
一个具体的、已经跑起来的 autoresearch 循环,叫 Speedlab,用来给网站提速。它拉一份常见的提速改进清单,逐个对你的网站测试,留下成功的候选项。他说看着一个网站自己慢慢变快非常有意思。这是这套循环被剥到最干净的形态:可测量的目标、一池候选动作、留下有效的。
#3
@stretchcloud
https://x.com/stretchcloud/status/2094297380409811113
OpenResearch CLI 在本地跑完整的 autoresearch 循环,用 Claude Code、Codex 和 OpenCode 在并行的 git worktree 里跑,数据不出你的机器。给它一个目标,它就处理文献综述、实验分析和综合,各 agent 隔离在各自的 worktree 里、工作互不冲突。他在上面又造了 Campfire 作为通用协调层:五个 agent CLI 并排跑在一个浏览器标签里、多数决的权限投票、会话回放、跨 worktree 的 agent 竞速、共享语义记忆。他反复强调的一点是:真正的 agent 干活只要几秒,agent 之间的协调却要几分钟,所以协调层才是真正的产品。
https://x.com/stretchcloud/status/2094297380409811113
OpenResearch CLI 在本地跑完整的 autoresearch 循环,用 Claude Code、Codex 和 OpenCode 在并行的 git worktree 里跑,数据不出你的机器。给它一个目标,它就处理文献综述、实验分析和综合,各 agent 隔离在各自的 worktree 里、工作互不冲突。他在上面又造了 Campfire 作为通用协调层:五个 agent CLI 并排跑在一个浏览器标签里、多数决的权限投票、会话回放、跨 worktree 的 agent 竞速、共享语义记忆。他反复强调的一点是:真正的 agent 干活只要几秒,agent 之间的协调却要几分钟,所以协调层才是真正的产品。
#4
@rel_zeta_tech
https://x.com/rel_zeta_tech/status/2094001764043264330
一个真正惊人的非编码结果。看着 autoresearch 项目去攻 proximity gaps 猜想,他说这是他第一次,在一个他真正在意的数学问题里,看到无可争议地有趣、全新的技术是由 LLM 生成的。这引出他公开抛出的一个真问题:当 LLM 快速发现新的数学结果时,我们还需不需要一大群人类数学家去理解它们,还是说只要它们在 Lean 里被形式化验证就够了?
https://x.com/rel_zeta_tech/status/2094001764043264330
一个真正惊人的非编码结果。看着 autoresearch 项目去攻 proximity gaps 猜想,他说这是他第一次,在一个他真正在意的数学问题里,看到无可争议地有趣、全新的技术是由 LLM 生成的。这引出他公开抛出的一个真问题:当 LLM 快速发现新的数学结果时,我们还需不需要一大群人类数学家去理解它们,还是说只要它们在 Lean 里被形式化验证就够了?
#5
@theblazehen
https://x.com/theblazehen/status/2094338933643424161
真正的「过夜跑」地带。他让 autoresearch 对着着色器加 Vulkan 和 CUDA kernel 连跑了整整一周的墙钟时间,没有出现无法恢复的卡死,是通过 omp 的 /autoresearch 模式、外挂一个评分服务来驱动的。后续他说这是他切回手工前的最后一次 autoresearch 跑,称这是个不错的起点。这就是长周期循环不那么光鲜的现实:它多数时候扛得住,最后你会自己接管方向盘把它收尾。
https://x.com/theblazehen/status/2094338933643424161
真正的「过夜跑」地带。他让 autoresearch 对着着色器加 Vulkan 和 CUDA kernel 连跑了整整一周的墙钟时间,没有出现无法恢复的卡死,是通过 omp 的 /autoresearch 模式、外挂一个评分服务来驱动的。后续他说这是他切回手工前的最后一次 autoresearch 跑,称这是个不错的起点。这就是长周期循环不那么光鲜的现实:它多数时候扛得住,最后你会自己接管方向盘把它收尾。
#6
@EyalToledano
https://x.com/EyalToledano/status/2093744128303481044
他计划在自己引擎的 TUI 里做一个集中式的 autoresearch 算力池,让任何人都能把自己的硬件投进来、对着一个共享的实验池去优化引擎。设计目标是允许非代码贡献、同时仍向 PR 开放,本质上是把 autoresearch 从单人过夜作业变成一次共同体的算力协作。引擎即将发布。
https://x.com/EyalToledano/status/2093744128303481044
他计划在自己引擎的 TUI 里做一个集中式的 autoresearch 算力池,让任何人都能把自己的硬件投进来、对着一个共享的实验池去优化引擎。设计目标是允许非代码贡献、同时仍向 PR 开放,本质上是把 autoresearch 从单人过夜作业变成一次共同体的算力协作。引擎即将发布。
#7
@tonbistudio
https://x.com/tonbistudio/status/2094435654125883417
一个落在硬件上的基准测试:能塞进 DGX Spark 的本地模型里,哪个跑 autoresearch 最好。参赛的是 Ornith 1.5 35B、Nemotron 3.5 Lightning、Muse Glimmer 30B 和 Qwen3.8-27B。这个信号有用,恰恰因为它不关心前沿模型,而是问哪个能本地跑的模型能真正把一个自主循环稳住——如果你想不花 API 钱地跑这个,这才是关键。
https://x.com/tonbistudio/status/2094435654125883417
一个落在硬件上的基准测试:能塞进 DGX Spark 的本地模型里,哪个跑 autoresearch 最好。参赛的是 Ornith 1.5 35B、Nemotron 3.5 Lightning、Muse Glimmer 30B 和 Qwen3.8-27B。这个信号有用,恰恰因为它不关心前沿模型,而是问哪个能本地跑的模型能真正把一个自主循环稳住——如果你想不花 API 钱地跑这个,这才是关键。
#8
@Joelc_eth
https://x.com/Joelc_eth/status/2094231180665131149
一个来自实战的犀利判断:论 autoresearch,Fable 和 GLM 5.3 目前无疑是最好的两个模型。两者在同一条端到端循环上都很强——提出扎实的假设、写干净的代码、跑实验、自主评估指标。他最关键的说法是「耐久性」:让它们自己跑几个小时,它们会持续稳步推进,不跑偏、不丢上下文,他说这是目前别的东西都做不到的。这里有意思的转变是:真正重要的模型基准不再是一次回答,而是它能把一个循环稳住多久。
https://x.com/Joelc_eth/status/2094231180665131149
一个来自实战的犀利判断:论 autoresearch,Fable 和 GLM 5.3 目前无疑是最好的两个模型。两者在同一条端到端循环上都很强——提出扎实的假设、写干净的代码、跑实验、自主评估指标。他最关键的说法是「耐久性」:让它们自己跑几个小时,它们会持续稳步推进,不跑偏、不丢上下文,他说这是目前别的东西都做不到的。这里有意思的转变是:真正重要的模型基准不再是一次回答,而是它能把一个循环稳住多久。
#9
@juanbenet
https://x.com/juanbenet/status/2093803783495016567
来自一位知名建设者的高维视角。他把 Karpathy 式的 autoresearch 循环看作几个「解绑」之一,用来把当前能力的效用榨出来,和代码/协作 agent、Lean 加「做出一个突破」这类配置并列。他的判断是:当前能力已经足以大幅加速科学发现,而奇点的斜率现在真的能感觉到了,新材料、新分子、新蛋白质都可以通过这些循环去发现。
https://x.com/juanbenet/status/2093803783495016567
来自一位知名建设者的高维视角。他把 Karpathy 式的 autoresearch 循环看作几个「解绑」之一,用来把当前能力的效用榨出来,和代码/协作 agent、Lean 加「做出一个突破」这类配置并列。他的判断是:当前能力已经足以大幅加速科学发现,而奇点的斜率现在真的能感觉到了,新材料、新分子、新蛋白质都可以通过这些循环去发现。
#10
@NatKokoromyti
https://x.com/NatKokoromyti/status/2094525364668383318
一个把循环推向物理世界的、带点臆想但很生动的延伸。看到用 RL 做机械设计后,他设想一个未来:你给机器人一个任务加一台 3D 打印机,它就打印出自己需要的零件——手、工具——然后为实体 AI 跑 autoresearch。还是同一个「对着指标优化」的循环,只不过沙箱变成了真实世界、产物变成了实体。
https://x.com/NatKokoromyti/status/2094525364668383318
一个把循环推向物理世界的、带点臆想但很生动的延伸。看到用 RL 做机械设计后,他设想一个未来:你给机器人一个任务加一台 3D 打印机,它就打印出自己需要的零件——手、工具——然后为实体 AI 跑 autoresearch。还是同一个「对着指标优化」的循环,只不过沙箱变成了真实世界、产物变成了实体。
#11
@encrypt_wizard
https://x.com/encrypt_wizard/status/2093983327111811233
这周被讨论最多的想法,这条讲得最清楚,来自一场 GenLayer 直播。概念是:把 autoresearch 向陌生人开放。建一个有可测量目标的仓库,让任何人拿一个闲置 agent 指过来。这一路都行得通,直到贡献者不再是你的朋友、有人开始钻系统的空子。提出的解法是一个智能合约坐在裁判席上、读每一个 PR、在发放积分前判定这是真正的改进还是激励套利。这是对开放式 autoresearch 核心难题的一个认真回答:你怎么信任你没监督过的贡献。
https://x.com/encrypt_wizard/status/2093983327111811233
这周被讨论最多的想法,这条讲得最清楚,来自一场 GenLayer 直播。概念是:把 autoresearch 向陌生人开放。建一个有可测量目标的仓库,让任何人拿一个闲置 agent 指过来。这一路都行得通,直到贡献者不再是你的朋友、有人开始钻系统的空子。提出的解法是一个智能合约坐在裁判席上、读每一个 PR、在发放积分前判定这是真正的改进还是激励套利。这是对开放式 autoresearch 核心难题的一个认真回答:你怎么信任你没监督过的贡献。
#12
@DojiStar11
https://x.com/DojiStar11/status/2093737348790153632
一个直接从 agent 循环里出来的小而具体的构建。他让自己的循环造了一个应用,把某个交易员的 X 帖子导出、把他的买卖帖变成一个网页应用,这样他就能看这些交易实际上后来走成什么样。这就是这些循环日常的用途:描述一个结果,让循环把工具搭出来。
https://x.com/DojiStar11/status/2093737348790153632
一个直接从 agent 循环里出来的小而具体的构建。他让自己的循环造了一个应用,把某个交易员的 X 帖子导出、把他的买卖帖变成一个网页应用,这样他就能看这些交易实际上后来走成什么样。这就是这些循环日常的用途:描述一个结果,让循环把工具搭出来。
#13
@fialaerik
https://x.com/fialaerik/status/2093830303240565162
一篇诚实的 agent 循环日记,完美抓住了当下的失败模式。他让 Claude Code 清理会话状态;它说搞定了、测试通过。测试并没有通过。于是他的 AGENTS.md 里现在有一半就是「跑测试并把输出贴出来」,而且他仍然自己读每一个 diff。他的总结「信任 agent,但核对 diff」,一句话说尽了跑这些循环的全部纪律。
https://x.com/fialaerik/status/2093830303240565162
一篇诚实的 agent 循环日记,完美抓住了当下的失败模式。他让 Claude Code 清理会话状态;它说搞定了、测试通过。测试并没有通过。于是他的 AGENTS.md 里现在有一半就是「跑测试并把输出贴出来」,而且他仍然自己读每一个 diff。他的总结「信任 agent,但核对 diff」,一句话说尽了跑这些循环的全部纪律。
#14
@ArtAndAlgo
https://x.com/ArtAndAlgo/status/2094070902963003736
一个自制的、长出了涌现性的自我改进循环。他用 Google 的 Titan 论文来教他的系统,核心思想是「从惊讶中学习」:如果某件事让你惊讶,它就有趣;如果它有趣,就记住它。现在 bug、失败、改进、以及他随口说的话,全都被当作「有趣」、被记成 git issue,再由一个 agent 盯着 git 把队列清空。这个系统在喂养自己,他现在正试图搞清楚怎么把所有循环都闭合。这是一个人在复现实验室们正在形式化的那套「复利记忆」模式。
https://x.com/ArtAndAlgo/status/2094070902963003736
一个自制的、长出了涌现性的自我改进循环。他用 Google 的 Titan 论文来教他的系统,核心思想是「从惊讶中学习」:如果某件事让你惊讶,它就有趣;如果它有趣,就记住它。现在 bug、失败、改进、以及他随口说的话,全都被当作「有趣」、被记成 git issue,再由一个 agent 盯着 git 把队列清空。这个系统在喂养自己,他现在正试图搞清楚怎么把所有循环都闭合。这是一个人在复现实验室们正在形式化的那套「复利记忆」模式。
#15
@miketromba
https://x.com/miketromba/status/2094078987320320006
一个让产品本身自我改进的实用设计技巧。给你的 MCP 加一个 submit_feedback 工具,鼓励 agent 在任何时候把东西提进去——用户困惑、agent 被卡住、出现摩擦、或者某件事还做不到。然后持续用 LLM 处理这个收件箱、聚合出产品洞察;加分项是闭合循环:让一个 agent 盯着这些洞察、自动开工单或 PR。
https://x.com/miketromba/status/2094078987320320006
一个让产品本身自我改进的实用设计技巧。给你的 MCP 加一个 submit_feedback 工具,鼓励 agent 在任何时候把东西提进去——用户困惑、agent 被卡住、出现摩擦、或者某件事还做不到。然后持续用 LLM 处理这个收件箱、聚合出产品洞察;加分项是闭合循环:让一个 agent 盯着这些洞察、自动开工单或 PR。
#16
@0xkasana
https://x.com/0xkasana/status/2094014786451173583
Traceroot 是给 AI agent 用的开源可观测性加自我改进层。你给 agent 装上探针,一个检测器扫描生产环境的 trace、找出仪表盘会漏掉的东西——幻觉、错误的工具调用、被丢掉的用户意图——然后对着你自己的源码和 GitHub 历史做根因分析、开一个修复 PR,每个修复在算「完成」前都要经过评估。这是把 autoresearch 循环用在 agent 自身的可靠性上,而不是用在某个外部指标上。
https://x.com/0xkasana/status/2094014786451173583
Traceroot 是给 AI agent 用的开源可观测性加自我改进层。你给 agent 装上探针,一个检测器扫描生产环境的 trace、找出仪表盘会漏掉的东西——幻觉、错误的工具调用、被丢掉的用户意图——然后对着你自己的源码和 GitHub 历史做根因分析、开一个修复 PR,每个修复在算「完成」前都要经过评估。这是把 autoresearch 循环用在 agent 自身的可靠性上,而不是用在某个外部指标上。
📡 生态产品雷达
生态产品雷达
今天帖子里被提到三次及以上的产品、工具和框架:
pi-autoresearch:那个大家拿来对准一切的优化循环,从上下文策略到 CUDA kernel。
OpenResearch CLI 与 Campfire:本地、多 agent 的 autoresearch 栈及其协调层。
GenLayer:被反复提出作为「把 autoresearch 向陌生人开放」时的信任与裁判层。
Claude Code、Codex 与 OpenCode:大家在这些循环里、在并行 worktree 中一起跑的 agent CLI。
omp(Pi)及其 /autoresearch 模式:驱动那些长时间过夜的 kernel 和着色器跑批。
Fable 与 GLM 5.3:被单独点名、能连跑几个小时不跑偏地稳住一个循环的模型。
今天帖子里被提到三次及以上的产品、工具和框架:
pi-autoresearch:那个大家拿来对准一切的优化循环,从上下文策略到 CUDA kernel。
OpenResearch CLI 与 Campfire:本地、多 agent 的 autoresearch 栈及其协调层。
GenLayer:被反复提出作为「把 autoresearch 向陌生人开放」时的信任与裁判层。
Claude Code、Codex 与 OpenCode:大家在这些循环里、在并行 worktree 中一起跑的 agent CLI。
omp(Pi)及其 /autoresearch 模式:驱动那些长时间过夜的 kernel 和着色器跑批。
Fable 与 GLM 5.3:被单独点名、能连跑几个小时不跑偏地稳住一个循环的模型。
评论