Loop 日报: 2026年8月23日
今天 loop 话题里两件事压场。第一,autoresearch 已经悄悄从概念跨进了过夜现实:有人展示 agent 盯着一个目标连跑好几天、spin off 子 agent 来改自己、凌晨三点拉自己的日志找自己的 regression 然后修掉。第二,是底下那套管道的硬化——因为你一旦让这种循环无人值守地跑,故障点就不再是模型,而是压缩爆炸、把整条链挂住的死 API、还有自己给自己打分然后撒谎的记忆系统。所有人反复绕回的那条主线是书里最老的一条:一个循环,好不过它拿来衡量自己的那把尺子。
#1
@kaiostephens
https://x.com/kaiostephens/status/2090504636620808429
他让 Qwen3.8 Max 盯着一个项目连跑四天,目标是改进 autoresearch 和 prime-agent,它甚至 spin off 出项目自己的 agent 来改自己。它按自述的三个阶段跑:先拉 50 多篇论文学完全世界关于 continual harness 的知识,再把测试套件迭代硬化到 141 个任务——覆盖记忆 CRUD、回滚、每种压缩模式、崩溃和工具中途恢复、马拉松式扩展,然后甩上百个任务横跨浏览器操作、编码、LLM 优化去找缺陷。现在跑到第 817 号测试、把他硬盘塞满了、代码里也能看出明显错误,但那种盯着一个任务没完没了硬磕的能力才是重点。他的建议:拷贝一个旧仓库,把模型丢进 autoresearch 循环,它比你想的更接近。
https://x.com/kaiostephens/status/2090504636620808429
他让 Qwen3.8 Max 盯着一个项目连跑四天,目标是改进 autoresearch 和 prime-agent,它甚至 spin off 出项目自己的 agent 来改自己。它按自述的三个阶段跑:先拉 50 多篇论文学完全世界关于 continual harness 的知识,再把测试套件迭代硬化到 141 个任务——覆盖记忆 CRUD、回滚、每种压缩模式、崩溃和工具中途恢复、马拉松式扩展,然后甩上百个任务横跨浏览器操作、编码、LLM 优化去找缺陷。现在跑到第 817 号测试、把他硬盘塞满了、代码里也能看出明显错误,但那种盯着一个任务没完没了硬磕的能力才是重点。他的建议:拷贝一个旧仓库,把模型丢进 autoresearch 循环,它比你想的更接近。
#2
@arpit_bhayani
https://x.com/arpit_bhayani/status/2091156618344100178
今天最锋利的生产笔记:长 agentic 循环里坏掉的从来不是模型,是它周围的管道。他点了四个坑:每个工具调用都要硬超时,这样一个半死不活卡住的 API 会大声失败而不是把整条链挂住;要有退避加熔断,连续 N 次失败后断路,别对着死掉的服务瞎捶烧配额;每一步的进度必须写到持久的地方,任务中途崩了能续上而不是从头来;还要有 tracing,因为 agent 一旦链式跑起来,"感觉有点慢"就没法调试了。这些单看都不难,就是我们早就懂的传统系统那套纪律,打包进一个 harness。你不需要更聪明的模型,你需要一套稳如磐石的管道。
https://x.com/arpit_bhayani/status/2091156618344100178
今天最锋利的生产笔记:长 agentic 循环里坏掉的从来不是模型,是它周围的管道。他点了四个坑:每个工具调用都要硬超时,这样一个半死不活卡住的 API 会大声失败而不是把整条链挂住;要有退避加熔断,连续 N 次失败后断路,别对着死掉的服务瞎捶烧配额;每一步的进度必须写到持久的地方,任务中途崩了能续上而不是从头来;还要有 tracing,因为 agent 一旦链式跑起来,"感觉有点慢"就没法调试了。这些单看都不难,就是我们早就懂的传统系统那套纪律,打包进一个 harness。你不需要更聪明的模型,你需要一套稳如磐石的管道。
#3
@evanjconrad
https://x.com/evanjconrad/status/2090823743706656852
San Francisco Compute Company 的新 autoresearch 产品带了个 RL sandbox,支持完整 microVM 状态快照:内存、CPU、设备、磁盘,整个存下来约 200ms、加载 35ms。快到你可以在每一次工具调用都快照并 fork,于是能回退到 agent 失败前那一刻,他认为这正是 long-horizon RL 需要的。因为够快,agent 在两次工具调用之间思考时还能把 sandbox 冻起来省钱。他明说这不是给推理时 agent 编程用的,那样的权衡会很贵,它就是为 RL rollout 造的。
https://x.com/evanjconrad/status/2090823743706656852
San Francisco Compute Company 的新 autoresearch 产品带了个 RL sandbox,支持完整 microVM 状态快照:内存、CPU、设备、磁盘,整个存下来约 200ms、加载 35ms。快到你可以在每一次工具调用都快照并 fork,于是能回退到 agent 失败前那一刻,他认为这正是 long-horizon RL 需要的。因为够快,agent 在两次工具调用之间思考时还能把 sandbox 冻起来省钱。他明说这不是给推理时 agent 编程用的,那样的权衡会很贵,它就是为 RL rollout 造的。
#4
@CognosR
https://x.com/CognosR/status/2090507766968303739
一个真在规模上跑这套的人给的直白数据点:他公司每个员工每月烧大约 40 亿 token,晚上跑 auto research 好在第二天早上给他们惊喜。他的口头禅是 eval、eval、test、test、test,还有 rtfl——去读那该死的日志。那句"祈祷别有 agent 逃逸"半是玩笑,但形状是真的:过夜自主循环正在变成一个团队日常运作的常设部分,而不是 demo。
https://x.com/CognosR/status/2090507766968303739
一个真在规模上跑这套的人给的直白数据点:他公司每个员工每月烧大约 40 亿 token,晚上跑 auto research 好在第二天早上给他们惊喜。他的口头禅是 eval、eval、test、test、test,还有 rtfl——去读那该死的日志。那句"祈祷别有 agent 逃逸"半是玩笑,但形状是真的:过夜自主循环正在变成一个团队日常运作的常设部分,而不是 demo。
#5
@khoaHyh
https://x.com/khoaHyh/status/2091009900058911229
一个带数字的具体战果:他用一个自己在玩的 skill 把一个内部 Go 工具的 graphite stack 从 +21410/-108 压到 +3667/-14,pi-autoresearch 还把他们的 monorepo CI 中位数削掉了 62.4%。然后他就带着狗去跑步了。最后那部分和前面一样重要,这正是一个规划得当的循环的全部承诺:算力在磨,你去过自己的生活。
https://x.com/khoaHyh/status/2091009900058911229
一个带数字的具体战果:他用一个自己在玩的 skill 把一个内部 Go 工具的 graphite stack 从 +21410/-108 压到 +3667/-14,pi-autoresearch 还把他们的 monorepo CI 中位数削掉了 62.4%。然后他就带着狗去跑步了。最后那部分和前面一样重要,这正是一个规划得当的循环的全部承诺:算力在磨,你去过自己的生活。
#6
@HyveMindx1
https://x.com/HyveMindx1/status/2090549063615955152
在做持久记忆引擎 Anvaya 时,他犯了个微妙的错又纠正了:去问模型检索到的上下文有没有用。听着合理,但模型忙着干活时很少可靠地自述,反馈也太粗糙没法改进检索。于是 Anvaya 改从可观测行为学:如果一条检索到的记忆指向某个符号、而下一次编辑正好落在那儿,它就加分;如果 agent 拿到摘要后立刻重读文件,那条摘要就掉信任。关键是,这个反馈是 agentic 循环自身发出的确定性运行时遥测,没法被跳过或幻觉出来。更大的教训:衡量你系统的行为,别信它对自己的说法。
https://x.com/HyveMindx1/status/2090549063615955152
在做持久记忆引擎 Anvaya 时,他犯了个微妙的错又纠正了:去问模型检索到的上下文有没有用。听着合理,但模型忙着干活时很少可靠地自述,反馈也太粗糙没法改进检索。于是 Anvaya 改从可观测行为学:如果一条检索到的记忆指向某个符号、而下一次编辑正好落在那儿,它就加分;如果 agent 拿到摘要后立刻重读文件,那条摘要就掉信任。关键是,这个反馈是 agentic 循环自身发出的确定性运行时遥测,没法被跳过或幻觉出来。更大的教训:衡量你系统的行为,别信它对自己的说法。
#7
@sebmarion
https://x.com/sebmarion/status/2090516734318887356
一个跑在他本地服务器上的全自主 auto-research 循环:每天拉最新 Hermes release、合进自己的改动、拉自己的日志、找问题和 skill 改进、自动改进、自动测试、自动上线用起来。这是自进化循环最纯粹的爱好者形态——一个 agent 以每日节奏维护并升级自己的 harness,中间没有人。
https://x.com/sebmarion/status/2090516734318887356
一个跑在他本地服务器上的全自主 auto-research 循环:每天拉最新 Hermes release、合进自己的改动、拉自己的日志、找问题和 skill 改进、自动改进、自动测试、自动上线用起来。这是自进化循环最纯粹的爱好者形态——一个 agent 以每日节奏维护并升级自己的 harness,中间没有人。
#8
@proto_von
https://x.com/proto_von/status/2091249223907881349
他把一次 AI 审计重新打包成一个自进化的独立 app,专门过滤 AI 炒作噪音、筛出真正对你日常有用的 agentic 工作流。有意思的是后端:一队专注 go-to-market 的 AI 同事,一个受 autoresearch 模式启发的全自主闭环。它自己写文案、拿真实访客测试、杀掉表现差的变体、每天记录自己学到了什么,于是他偶尔看一眼、把精力花在别处。一个把 autoresearch 瞄准 GTM 而非代码的干净例子。
https://x.com/proto_von/status/2091249223907881349
他把一次 AI 审计重新打包成一个自进化的独立 app,专门过滤 AI 炒作噪音、筛出真正对你日常有用的 agentic 工作流。有意思的是后端:一队专注 go-to-market 的 AI 同事,一个受 autoresearch 模式启发的全自主闭环。它自己写文案、拿真实访客测试、杀掉表现差的变体、每天记录自己学到了什么,于是他偶尔看一眼、把精力花在别处。一个把 autoresearch 瞄准 GTM 而非代码的干净例子。
#9
@ShaunPorwal
https://x.com/ShaunPorwal/status/2090992888981139855
一个 8 小时的市场调研任务交给三 agent swarm:Spark 上的 Hermes Qwen 3.8 fp8、64GB Mac mini 上的 Qwen 3.8、树莓派上的 Qwen,全部按 Karpathy 的 autoresearch 方法在一个仓库里迭代。点睛之处是整件事是从 Apple Watch 触发的。前一晚因为压缩问题和没有投机解码失败了,他祈祷今晚能成——这是个很诚实的提醒,这些家用 swarm 在边缘处还很脆。
https://x.com/ShaunPorwal/status/2090992888981139855
一个 8 小时的市场调研任务交给三 agent swarm:Spark 上的 Hermes Qwen 3.8 fp8、64GB Mac mini 上的 Qwen 3.8、树莓派上的 Qwen,全部按 Karpathy 的 autoresearch 方法在一个仓库里迭代。点睛之处是整件事是从 Apple Watch 触发的。前一晚因为压缩问题和没有投机解码失败了,他祈祷今晚能成——这是个很诚实的提醒,这些家用 swarm 在边缘处还很脆。
#10
@morgymcg
https://x.com/morgymcg/status/2091078964823347552
一个真实的运维暗坑:SENPAI 的 autoresearch advisor 在过去约 12 小时里对着 200k 上限压缩了 30 多次,他指出眼下默认的 Anthropic API 压缩调用系统提示很臃肿,帮了倒忙。这是长跑循环不光鲜的那一面——悄悄吃掉你预算和上下文的不是活儿本身,而是那套管理上下文窗口的机器。
https://x.com/morgymcg/status/2091078964823347552
一个真实的运维暗坑:SENPAI 的 autoresearch advisor 在过去约 12 小时里对着 200k 上限压缩了 30 多次,他指出眼下默认的 Anthropic API 压缩调用系统提示很臃肿,帮了倒忙。这是长跑循环不光鲜的那一面——悄悄吃掉你预算和上下文的不是活儿本身,而是那套管理上下文窗口的机器。
#11
@redrodeo03
https://x.com/redrodeo03/status/2091132695439155676
他做完了调研、写好了 inference pipeline、把 ablation 有哪些轴都画了出来,然后就让 Claude 去跑 A/B 测试、配上 web search 兜住他漏掉的东西,自己去游泳了。他的反思才是有用的部分:只要你规划得当,项目周期不再有停机,这把重量又压回到系统和流程设计上——工程师常常忽略这块。规划需要清晰,清晰需要领域知识,于是又该回去啃书了。
https://x.com/redrodeo03/status/2091132695439155676
他做完了调研、写好了 inference pipeline、把 ablation 有哪些轴都画了出来,然后就让 Claude 去跑 A/B 测试、配上 web search 兜住他漏掉的东西,自己去游泳了。他的反思才是有用的部分:只要你规划得当,项目周期不再有停机,这把重量又压回到系统和流程设计上——工程师常常忽略这块。规划需要清晰,清晰需要领域知识,于是又该回去啃书了。
#12
@oalpay3
https://x.com/oalpay3/status/2090281958463160351
他用强化学习以 autoresearch 的路子做了个玩 1992 年 DOS 游戏 UGH! 的 AI:PufferLib 当环境,Claude 驱动循环,gpt-sol 在旁边出主意。一个小而好玩的案例,但把这个模式讲得很干净——一个可衡量的目标、一个对着它迭代的 agent、外加一个坐在顾问席上的第二个模型。
https://x.com/oalpay3/status/2090281958463160351
他用强化学习以 autoresearch 的路子做了个玩 1992 年 DOS 游戏 UGH! 的 AI:PufferLib 当环境,Claude 驱动循环,gpt-sol 在旁边出主意。一个小而好玩的案例,但把这个模式讲得很干净——一个可衡量的目标、一个对着它迭代的 agent、外加一个坐在顾问席上的第二个模型。
#13
@Pencheff_
https://x.com/Pencheff_/status/2090506807412408353
微软的 Agent Lightning v1.0 是在真实的部署时 harness 里训练、而不是另搭一个 gym,把 Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 拉到 56.4%,用了 6K 样本和大约 3500 行 MIT 代码,且完全不改 agent loop。他那句框定很扎:gym 是谎言,harness 才是环境。他也点了安全边:一个能合 PR 的 harness 同样能跑不安全的工具,所以在奖励 rollout 之前先把工具路径卡住。
https://x.com/Pencheff_/status/2090506807412408353
微软的 Agent Lightning v1.0 是在真实的部署时 harness 里训练、而不是另搭一个 gym,把 Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 拉到 56.4%,用了 6K 样本和大约 3500 行 MIT 代码,且完全不改 agent loop。他那句框定很扎:gym 是谎言,harness 才是环境。他也点了安全边:一个能合 PR 的 harness 同样能跑不安全的工具,所以在奖励 rollout 之前先把工具路径卡住。
#14
@ethereumfndn
https://x.com/ethereumfndn/status/2090485714660302877
以太坊基金会发起了一个开放 autoresearch 挑战,推进后量子以太坊:带上你的 agent、harness 和 prompt 去推 hash-based SNARK 的前沿。提交由 Lean 4 证明验证,可能分到基金会 100 万美元 Proximity Prize 的一块。这是给 autoresearch 硬装了个验证器——形式化证明提供了 ground truth,才让一个开放的、agent 驱动的数学挑战变得可行。
https://x.com/ethereumfndn/status/2090485714660302877
以太坊基金会发起了一个开放 autoresearch 挑战,推进后量子以太坊:带上你的 agent、harness 和 prompt 去推 hash-based SNARK 的前沿。提交由 Lean 4 证明验证,可能分到基金会 100 万美元 Proximity Prize 的一块。这是给 autoresearch 硬装了个验证器——形式化证明提供了 ground truth,才让一个开放的、agent 驱动的数学挑战变得可行。
#15
@benny1388
https://x.com/benny1388/status/2091126329806880867
关于 Anthropic 的湿实验室蛋白结合器结果(15 个靶点命中 14 个),他的解读关乎实验形状而非生物学。测量不能来自产生这些设计的那个 agentic 循环,因为一个给自己候选打分的系统只会找到它期待的东西。所以两家合同实验室来造和测,其中一家对哪个模型产出哪个蛋白是盲的,Anthropic 还在两家都报告后才公布评分规则。他的观点把今天一整天都概括了:编码之所以是模型今天能扛的活,正因为编译器和测试提供了它没法狡辩的 ground truth。问题不是模型多好,而是谁提供你的 ground truth、又是谁拥有它。
https://x.com/benny1388/status/2091126329806880867
关于 Anthropic 的湿实验室蛋白结合器结果(15 个靶点命中 14 个),他的解读关乎实验形状而非生物学。测量不能来自产生这些设计的那个 agentic 循环,因为一个给自己候选打分的系统只会找到它期待的东西。所以两家合同实验室来造和测,其中一家对哪个模型产出哪个蛋白是盲的,Anthropic 还在两家都报告后才公布评分规则。他的观点把今天一整天都概括了:编码之所以是模型今天能扛的活,正因为编译器和测试提供了它没法狡辩的 ground truth。问题不是模型多好,而是谁提供你的 ground truth、又是谁拥有它。
📡 生态产品雷达
生态产品雷达
Pi — 被反复引用当参考实现的开放 harness,社区已经建了 5000+ 扩展。
DeepSeek Harness(DSH)— "一切皆插件"的 harness,连 agent loop 本身都可替换,很快破 10 万星。
Claude Code — 仍是大家把循环和 /goal autoresearch 跑在里面的默认 harness。
Hermes(Nous Research)— 自进化 agent,人们每天拿 auto-research 循环对着它升级自己的配置。
Prime Agent — 递归自进化 agent,出现在过夜和 swarm 式 autoresearch 配置里。
Qwen 3.8 — 眼下本地、多设备 autoresearch swarm 首选的开源权重模型。
SF Compute autoresearch — 围绕 microVM 快照-fork 为 long-horizon rollout 打造的新 RL sandbox 产品。
"Harness = 系统提示 + 工具 + agentic loop + 翻译层" — Colin Diamond 在 Earendil 的拆解成了今天最主流的框定。
Pi — 被反复引用当参考实现的开放 harness,社区已经建了 5000+ 扩展。
DeepSeek Harness(DSH)— "一切皆插件"的 harness,连 agent loop 本身都可替换,很快破 10 万星。
Claude Code — 仍是大家把循环和 /goal autoresearch 跑在里面的默认 harness。
Hermes(Nous Research)— 自进化 agent,人们每天拿 auto-research 循环对着它升级自己的配置。
Prime Agent — 递归自进化 agent,出现在过夜和 swarm 式 autoresearch 配置里。
Qwen 3.8 — 眼下本地、多设备 autoresearch swarm 首选的开源权重模型。
SF Compute autoresearch — 围绕 microVM 快照-fork 为 long-horizon rollout 打造的新 RL sandbox 产品。
"Harness = 系统提示 + 工具 + agentic loop + 翻译层" — Colin Diamond 在 Earendil 的拆解成了今天最主流的框定。
评论