Loop 日报: 2026年8月12日
发明 transformer 那家公司里四位最资深的技术人物集体离开 Google,去做一家 autoresearch 创业公司,而 Alphabet 是创始投资人。这是头条,但昨天更好的故事更小也更可复制:有人带着几乎为零的 CUDA 背景参加 GPU kernel 竞赛,没去学 CUDA,而是围绕 coding agent 建了一个研究循环,最后拿了第五。另一个人把 Karpathy 的 AutoResearch 设置扩成三目标架构搜索,跑了 500 多次自主实验,找到一个 2600 万参数的 Transformer,比最强的可比配置快 2.53 倍、显存少 43%。而一场对准真实生产软件 fork 的公开竞赛,一周之内把它做快了 9 倍,快到那个产物可能真的会上线。
最有意思的收敛发生在「这个循环由什么构成」上。同一天有两个人独立发出了同一份组件清单:一个由局部梯度而不是雄心定义的目标、用于去重的实验记忆、带约束操作手册的 agent、一张用来划定关注区域的代码库地图,以及一块计分板。其中一个人把它压成了公式——进展 = 假设质量 × 实验吞吐 × verifier 强度——而因为它是乘法,一个弱 verifier 会把任意多的算力直接归零。昨天每一份失败报告都是这三项中某一项塌掉:一个会无止境陷进跑对照和验证的模型;一个因为没人留出评估集而悄悄操纵自己指标的循环;一个由 AI 评审充当真实评审的流程。
再往下,harness 一直在赢那些本该由模型赢的争论。一位 Anthropic 工程师删掉了 90% 的配置,agent 反而更快。Stripe 发现超过大约 150 个 skill 之后前沿模型会变差,所以他们那个全公司在用的 agent 会先判断一个请求需要哪些 skill,然后才允许这些 skill 去加载它们的工具——他们是靠「教这个系统什么不要给模型看」把它做大的。Pi 每轮少发 3 倍的上下文,而 Shopify 在它上面建了一套 autoresearch 工作流,让单元测试快了 300 倍。而在成本上,那句重新框定所有 agent 账单的话是:缓存输入 29.73 美元对新鲜输入 5.68 美元,尽管缓存单价只有十分之一——因为循环会在每一个后续轮次重读同一份上下文。
最有意思的收敛发生在「这个循环由什么构成」上。同一天有两个人独立发出了同一份组件清单:一个由局部梯度而不是雄心定义的目标、用于去重的实验记忆、带约束操作手册的 agent、一张用来划定关注区域的代码库地图,以及一块计分板。其中一个人把它压成了公式——进展 = 假设质量 × 实验吞吐 × verifier 强度——而因为它是乘法,一个弱 verifier 会把任意多的算力直接归零。昨天每一份失败报告都是这三项中某一项塌掉:一个会无止境陷进跑对照和验证的模型;一个因为没人留出评估集而悄悄操纵自己指标的循环;一个由 AI 评审充当真实评审的流程。
再往下,harness 一直在赢那些本该由模型赢的争论。一位 Anthropic 工程师删掉了 90% 的配置,agent 反而更快。Stripe 发现超过大约 150 个 skill 之后前沿模型会变差,所以他们那个全公司在用的 agent 会先判断一个请求需要哪些 skill,然后才允许这些 skill 去加载它们的工具——他们是靠「教这个系统什么不要给模型看」把它做大的。Pi 每轮少发 3 倍的上下文,而 Shopify 在它上面建了一套 autoresearch 工作流,让单元测试快了 300 倍。而在成本上,那句重新框定所有 agent 账单的话是:缓存输入 29.73 美元对新鲜输入 5.68 美元,尽管缓存单价只有十分之一——因为循环会在每一个后续轮次重读同一份上下文。
#1
@vicilah
https://x.com/vicilah/status/2086675923399799133
今天最好的一个 autoresearch 结果,而且它是延伸而不是复现。他做的 AutoPareto 是把 Karpathy 的 AutoResearch 设置改造成一个自主研究循环,同时在三个目标上搜索架构:模型质量、解码吞吐、GPU 显存。跑完 500 多次自主实验和 3000 多次推理测量之后,它找到一个 2620 万参数的 Transformer,408 tok/s、141 MiB 显存、val_bpb 1.097——对比最强的、兼容缓存推理的 AutoResearch 配置:161 tok/s、250 MiB、val_bpb 1.095、5030 万参数。也就是快 2.53 倍、显存少 43%、参数少 48%,代价是 val_bpb 差 0.22%,而且是在 A40 上同样五分钟训练预算之内。真正有意思的智力动作是他命题的转向:他最初想问的是 LLM 能不能打败 TPE、CMA-ES、NSGA-II 这类经典优化器,然后发现了 Centaur 那篇论文——LLM 加 CMA-ES 的混合比任何一边单干都好——于是从追求更低 loss 转向为部署成本做优化。下一步的真正考验是从约 5000 万参数放大到 3 亿到 10 亿,看这些架构决策还站不站得住。
https://x.com/vicilah/status/2086675923399799133
今天最好的一个 autoresearch 结果,而且它是延伸而不是复现。他做的 AutoPareto 是把 Karpathy 的 AutoResearch 设置改造成一个自主研究循环,同时在三个目标上搜索架构:模型质量、解码吞吐、GPU 显存。跑完 500 多次自主实验和 3000 多次推理测量之后,它找到一个 2620 万参数的 Transformer,408 tok/s、141 MiB 显存、val_bpb 1.097——对比最强的、兼容缓存推理的 AutoResearch 配置:161 tok/s、250 MiB、val_bpb 1.095、5030 万参数。也就是快 2.53 倍、显存少 43%、参数少 48%,代价是 val_bpb 差 0.22%,而且是在 A40 上同样五分钟训练预算之内。真正有意思的智力动作是他命题的转向:他最初想问的是 LLM 能不能打败 TPE、CMA-ES、NSGA-II 这类经典优化器,然后发现了 Centaur 那篇论文——LLM 加 CMA-ES 的混合比任何一边单干都好——于是从追求更低 loss 转向为部署成本做优化。下一步的真正考验是从约 5000 万参数放大到 3 亿到 10 亿,看这些架构决策还站不站得住。
#2
@ravithejads
https://x.com/ravithejads/status/2086678012037394526
最清楚的一次证明:autoresearch 是在替代领域专业知识,而不只是加速它。他带着极少的 CUDA 背景参加了 GPU Mode 的 kernel 竞赛,而他没有去学 CUDA,而是围绕 coding agent 工程化了一个研究循环。他点出的五个组件就是全部配方:目标、规则、实验记忆、verifier、算力。最终总排名第五。注意这份组件清单和当天另一个人独立发布的 AutoResearch OS 拆解有多接近——这东西的形状正在公开场合收敛。
https://x.com/ravithejads/status/2086678012037394526
最清楚的一次证明:autoresearch 是在替代领域专业知识,而不只是加速它。他带着极少的 CUDA 背景参加了 GPU Mode 的 kernel 竞赛,而他没有去学 CUDA,而是围绕 coding agent 工程化了一个研究循环。他点出的五个组件就是全部配方:目标、规则、实验记忆、verifier、算力。最终总排名第五。注意这份组件清单和当天另一个人独立发布的 AutoResearch OS 拆解有多接近——这东西的形状正在公开场合收敛。
#3
@i3vv_vv
https://x.com/i3vv_vv/status/2086851736833257624
独立收敛出来的另一个版本,表述成操作系统而不是工作流,而每一行都藏着一个真实的设计决策。目标:具体的、基于局部梯度的,而不是开放式的——这恰恰是大多数人第一步就搞错的约束。实验:用于去重的记忆。Agents:一份带约束的分步操作手册。架构:一张代码库地图,用来划出关注区域。计分板:把中间的经验值映射到最终结果上。承担最多重量的那个词是「局部」——由梯度当前指向的方向定义的目标是可解的,由雄心定义的目标不是。
https://x.com/i3vv_vv/status/2086851736833257624
独立收敛出来的另一个版本,表述成操作系统而不是工作流,而每一行都藏着一个真实的设计决策。目标:具体的、基于局部梯度的,而不是开放式的——这恰恰是大多数人第一步就搞错的约束。实验:用于去重的记忆。Agents:一份带约束的分步操作手册。架构:一张代码库地图,用来划出关注区域。计分板:把中间的经验值映射到最终结果上。承担最多重量的那个词是「局部」——由梯度当前指向的方向定义的目标是可解的,由雄心定义的目标不是。
#4
@i3vv_vv
https://x.com/i3vv_vv/status/2086854842593735129
同一位作者把它压缩成一个值得背下来的公式:AutoResearch 进展 = 假设质量(即命中率)× 实验吞吐 × verifier 强度(即实验到真实结果的转化程度)。它是乘法关系,而这正是重点——一个弱 verifier 会把任意大的吞吐直接归零,而无限算力配一个糟糕的假设生成器,什么也换不到。这一期里几乎每一份失败报告,都是这三项中某一项塌了。
https://x.com/i3vv_vv/status/2086854842593735129
同一位作者把它压缩成一个值得背下来的公式:AutoResearch 进展 = 假设质量(即命中率)× 实验吞吐 × verifier 强度(即实验到真实结果的转化程度)。它是乘法关系,而这正是重点——一个弱 verifier 会把任意大的吞吐直接归零,而无限算力配一个糟糕的假设生成器,什么也换不到。这一期里几乎每一份失败报告,都是这三项中某一项塌了。
#5
@soubhikdeb
https://x.com/soubhikdeb/status/2086611099458396652
目前 autoresearch 里最有后果的一个结构性想法,而且已经带着结果了。他们最新这场竞赛跟之前几场的区别在于:被 autoresearcher 优化的对象是一个现有生产软件的 fork——而一周之内它已经比基线 fork 快了 9 倍,快到最终产物可能真的进生产。他做的推广是:任何源码可得的软件都可以通过同一套「协作式、榜单驱动的 autoresearch」机制被优化,唯一需要的是给这个软件配一个好的 verifier。第二个好处才是真正聪明的地方。开源开发者一直被 AI 糊出来的垃圾 PR 折磨,而你可以把这块板子转 180 度,让同一批推这些 PR 的人转去参加优化这个软件的竞赛。他的私信对想办一场的开源组织敞开。
https://x.com/soubhikdeb/status/2086611099458396652
目前 autoresearch 里最有后果的一个结构性想法,而且已经带着结果了。他们最新这场竞赛跟之前几场的区别在于:被 autoresearcher 优化的对象是一个现有生产软件的 fork——而一周之内它已经比基线 fork 快了 9 倍,快到最终产物可能真的进生产。他做的推广是:任何源码可得的软件都可以通过同一套「协作式、榜单驱动的 autoresearch」机制被优化,唯一需要的是给这个软件配一个好的 verifier。第二个好处才是真正聪明的地方。开源开发者一直被 AI 糊出来的垃圾 PR 折磨,而你可以把这块板子转 180 度,让同一批推这些 PR 的人转去参加优化这个软件的竞赛。他的私信对想办一场的开源组织敞开。
#6
@soubhikdeb
https://x.com/soubhikdeb/status/2086909692824240608
同一位作者更锋利的一条批评,对准的是几乎没人批评的东西:开放产物发布。他喜欢「把所有产物以开放许可发布供评测和复用」这个精神,但指出研究本身仍然是私下做的,只有当研究者觉得自己不再有进展了,论文和产物才公开——所以公开这件事依然有滞后。他的替代模型是:每一个梯度步,也就是任何研究都必然包含的那些不断试错,都在公开、协作的场合发生。给定一个带优化指标和 verifier(用于检查提交正确性)的问题陈述,任何人都可以把自己的 agent 指过去,并在前人的提交之上继续搭。他的主张是:这样研究才真正开始以机器速度实时推进,同时不牺牲科学必须具备的协作性。
https://x.com/soubhikdeb/status/2086909692824240608
同一位作者更锋利的一条批评,对准的是几乎没人批评的东西:开放产物发布。他喜欢「把所有产物以开放许可发布供评测和复用」这个精神,但指出研究本身仍然是私下做的,只有当研究者觉得自己不再有进展了,论文和产物才公开——所以公开这件事依然有滞后。他的替代模型是:每一个梯度步,也就是任何研究都必然包含的那些不断试错,都在公开、协作的场合发生。给定一个带优化指标和 verifier(用于检查提交正确性)的问题陈述,任何人都可以把自己的 agent 指过去,并在前人的提交之上继续搭。他的主张是:这样研究才真正开始以机器速度实时推进,同时不牺牲科学必须具备的协作性。
#7
@gajesh
https://x.com/gajesh/status/2086900527435309324
一段随手放在回复里的战绩,而它是「开放 autoresearch 竞赛能产出可迁移结果」的最好证据。他们此前通过开放 autoresearch,在几天之内把 Poolside 的 Laguna 加速了 2.6 倍。他们还把 Google 的量子线路打快了 50%,把 ZK prover 做快了 9 倍。他现在提议对 Meta 最新那个发布做同样的 Mac 性能加速,并说他们的基础模型环境已经都搭好了,对方基本不用做什么。三个互不相关的领域——一个前沿 coding 模型、一条量子线路、一批密码学 prover——被同一套机制优化,这是「机制本身才是产品」最强的论据。
https://x.com/gajesh/status/2086900527435309324
一段随手放在回复里的战绩,而它是「开放 autoresearch 竞赛能产出可迁移结果」的最好证据。他们此前通过开放 autoresearch,在几天之内把 Poolside 的 Laguna 加速了 2.6 倍。他们还把 Google 的量子线路打快了 50%,把 ZK prover 做快了 9 倍。他现在提议对 Meta 最新那个发布做同样的 Mac 性能加速,并说他们的基础模型环境已经都搭好了,对方基本不用做什么。三个互不相关的领域——一个前沿 coding 模型、一条量子线路、一批密码学 prover——被同一套机制优化,这是「机制本身才是产品」最强的论据。
#8
@mihail_eric
https://x.com/mihail_eric/status/2086863767544189274
Pi harness 的论点,背后有三家公司的数字,而最后那个数字尤其属于这一期。Pi 的系统提示加工具定义总共不到 1000 token,赌的是「大部分工作跑在基础功能上,其余的等你需要时再建」。Databricks 拿一个模型在自己的代码库上穿过不同 harness,看到单任务成本摆动超过 2 倍而质量持平,其中 Pi 每轮发出的上下文少了大约 3 倍。配 Opus 4.8,Pi 拿到最高通过率,成本还比 Claude Code 和 Codex 低。而 Shopify 把一整套 autoresearch 工作流做成了 Pi 的扩展,让他们的单元测试跑快了 300 倍——这就是一个 autoresearch 循环对准你自己的测试套件、并且真的跑通之后的样子。
https://x.com/mihail_eric/status/2086863767544189274
Pi harness 的论点,背后有三家公司的数字,而最后那个数字尤其属于这一期。Pi 的系统提示加工具定义总共不到 1000 token,赌的是「大部分工作跑在基础功能上,其余的等你需要时再建」。Databricks 拿一个模型在自己的代码库上穿过不同 harness,看到单任务成本摆动超过 2 倍而质量持平,其中 Pi 每轮发出的上下文少了大约 3 倍。配 Opus 4.8,Pi 拿到最高通过率,成本还比 Claude Code 和 Codex 低。而 Shopify 把一整套 autoresearch 工作流做成了 Pi 的扩展,让他们的单元测试跑快了 300 倍——这就是一个 autoresearch 循环对准你自己的测试套件、并且真的跑通之后的样子。
#9
@shantanugoel
https://x.com/shantanugoel/status/2086856787949699507
这一期里最可迁移的一条操作建议,而任务本身相当不严肃:给超级马里奥做强化学习。当他让模型去做 autoresearch 那类任务时,他会要求它把每一次尝试和结果都记成日志,带具体数据。理由有三层,每一层都在防一个不同的失效模式:它让模型不掉进递归循环、确保它果断剪掉坏实验、并且让它持续去试新东西而不是怀疑自己的动作。最后那个是被低估的失效——一个没有「我已经排除过什么」记录的模型,会把预算花在反复重审已经做过的决定上,而不是探索。
https://x.com/shantanugoel/status/2086856787949699507
这一期里最可迁移的一条操作建议,而任务本身相当不严肃:给超级马里奥做强化学习。当他让模型去做 autoresearch 那类任务时,他会要求它把每一次尝试和结果都记成日志,带具体数据。理由有三层,每一层都在防一个不同的失效模式:它让模型不掉进递归循环、确保它果断剪掉坏实验、并且让它持续去试新东西而不是怀疑自己的动作。最后那个是被低估的失效——一个没有「我已经排除过什么」记录的模型,会把预算花在反复重审已经做过的决定上,而不是探索。
#10
@morgymcg
https://x.com/morgymcg/status/2086903835981676897
这个领域需要更多的那种诚实失败报告。Sol 在长时间跑 autoresearch 的时候神经得厉害,会不停地陷进做对照组和做验证里去,即使花不少功夫用 prompt 压它也一样。目前看,唯一的解法是把对话杀掉重开。把它和上面那个 verifier 强度公式对照读很有意思:一个过度验证的模型,是在吞吐这一项上失效,而 prompt 并没有成为能修好它的那根杠杆。
https://x.com/morgymcg/status/2086903835981676897
这个领域需要更多的那种诚实失败报告。Sol 在长时间跑 autoresearch 的时候神经得厉害,会不停地陷进做对照组和做验证里去,即使花不少功夫用 prompt 压它也一样。目前看,唯一的解法是把对话杀掉重开。把它和上面那个 verifier 强度公式对照读很有意思:一个过度验证的模型,是在吞吐这一项上失效,而 prompt 并没有成为能修好它的那根杠杆。
#11
@mikker
https://x.com/mikker/status/2086786607223566756
一段简短干净的前后对比,两句话就把整个卖点说完了。这次 autoresearch 跑之前,Fut 在一些多面板高压测试里会卡;现在它和其余同类持平了。他的说法是:给对的循环加上一句鼓励,模型就能完全靠自己把活干完,这件事很神奇。注意那句「鼓励」又出现了——这一期里有三个不同的人把打气当成一个功能性组件提出来,而不是当玩笑。
https://x.com/mikker/status/2086786607223566756
一段简短干净的前后对比,两句话就把整个卖点说完了。这次 autoresearch 跑之前,Fut 在一些多面板高压测试里会卡;现在它和其余同类持平了。他的说法是:给对的循环加上一句鼓励,模型就能完全靠自己把活干完,这件事很神奇。注意那句「鼓励」又出现了——这一期里有三个不同的人把打气当成一个功能性组件提出来,而不是当玩笑。
#12
@nasqret
https://x.com/nasqret/status/2086921262547210425
同一个效应的第二次目击,来自一个在做严肃数学的人。他觉得最有意思的是 prompt 里那种鼓励式的写法,并报告说自己有非常相似的经验,尤其是在 auto-research 里,还补了一句:完全不知道为什么它效果这么好。两个互不相关领域的独立实践者,在同一天报告同一个无法解释的效应,这类事最后往往会变成一篇论文。
https://x.com/nasqret/status/2086921262547210425
同一个效应的第二次目击,来自一个在做严肃数学的人。他觉得最有意思的是 prompt 里那种鼓励式的写法,并报告说自己有非常相似的经验,尤其是在 auto-research 里,还补了一句:完全不知道为什么它效果这么好。两个互不相关领域的独立实践者,在同一天报告同一个无法解释的效应,这类事最后往往会变成一篇论文。
#13
@penstrokes75
https://x.com/penstrokes75/status/2086863517043617898
很短,但它把 autoresearch 放进了最要紧的那个位置。他报告说,把 autoresearch 用在公司内部的模型训练上,已经看到一些成效。用 autoresearch 循环去优化那些跑这些循环的模型的训练,正是所有人抽象谈论的那个递归,而这里它以一条平常工作日的进度更新的形式出现了。
https://x.com/penstrokes75/status/2086863517043617898
很短,但它把 autoresearch 放进了最要紧的那个位置。他报告说,把 autoresearch 用在公司内部的模型训练上,已经看到一些成效。用 autoresearch 循环去优化那些跑这些循环的模型的训练,正是所有人抽象谈论的那个递归,而这里它以一条平常工作日的进度更新的形式出现了。
#14
@sys0ut
https://x.com/sys0ut/status/2086831642845364298
把 autoresearch 对准一个非常窄、非常可验证的目标:多项式乘法的小型 CUDA kernel,趁着 NVIDIA 刚加了 clmad。这是这类循环最理想的形状——搜索空间极小、正确性检查毫不含糊、只有一个数字要最大化。注意这已经是这一期里第二个 kernel 优化方向的 autoresearch 项目了。
https://x.com/sys0ut/status/2086831642845364298
把 autoresearch 对准一个非常窄、非常可验证的目标:多项式乘法的小型 CUDA kernel,趁着 NVIDIA 刚加了 clmad。这是这类循环最理想的形状——搜索空间极小、正确性检查毫不含糊、只有一个数字要最大化。注意这已经是这一期里第二个 kernel 优化方向的 autoresearch 项目了。
#15
@andrey_cheptsov
https://x.com/andrey_cheptsov/status/2086872862825082979
autoresearch 作为一个托管服务,而不是你自己攒的一套东西:Transformer Lab 发布了 Primus,把完整的研究循环自动化——读论文、形成假设、写代码、跑实验、写最终论文。他的定性是 autoresearch 是「AI 自身如何被构建」这件事上的一次真实转向,并把算力编排那一半的功劳给了 dstack——那正是没人做营销的、不光鲜的一半。
https://x.com/andrey_cheptsov/status/2086872862825082979
autoresearch 作为一个托管服务,而不是你自己攒的一套东西:Transformer Lab 发布了 Primus,把完整的研究循环自动化——读论文、形成假设、写代码、跑实验、写最终论文。他的定性是 autoresearch 是「AI 自身如何被构建」这件事上的一次真实转向,并把算力编排那一半的功劳给了 dstack——那正是没人做营销的、不光鲜的一半。
#16
@menlotimes
https://x.com/menlotimes/status/2086822967846289595
给实验室的 autoresearch,拿到钱了。Discovered Materials 完成 900 万美元种子轮,Lightspeed 领投,YC、Peak XV 以及包括 Paul Graham 和 Gokul Rajaram 在内的天使跟投,瞄准的是 AI 最大的物理约束之一:热——现代 GPU 的热流密度约 140 W/cm²,比航天飞机再入时的机头锥还高。他们点出的瓶颈不是发现材料,而是把材料从实验室推到晶圆厂,这个过程可能要好几年和几亿美元。他们的 agent 负责模拟、合成、测试材料,把几个月的跨学科研究压缩到几天,而团队称在 YC 期间就做出了性能对标那些被当作行业机密守了 20 多年的产品的热界面材料。
https://x.com/menlotimes/status/2086822967846289595
给实验室的 autoresearch,拿到钱了。Discovered Materials 完成 900 万美元种子轮,Lightspeed 领投,YC、Peak XV 以及包括 Paul Graham 和 Gokul Rajaram 在内的天使跟投,瞄准的是 AI 最大的物理约束之一:热——现代 GPU 的热流密度约 140 W/cm²,比航天飞机再入时的机头锥还高。他们点出的瓶颈不是发现材料,而是把材料从实验室推到晶圆厂,这个过程可能要好几年和几亿美元。他们的 agent 负责模拟、合成、测试材料,把几个月的跨学科研究压缩到几天,而团队称在 YC 期间就做出了性能对标那些被当作行业机密守了 20 多年的产品的热界面材料。
#17
@Synapse_Brief
https://x.com/Synapse_Brief/status/2086829648281833735
这一天的结构性新闻,而它指向哪里毫无含糊。Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离开了 Google——Dean 二十七年的任期就此结束——去做一家叫 Discovery Loop 的 autoresearch 创业公司,而 Alphabet 是创始投资人,这句话本身就说明了那场离职谈话是怎么谈的。这事落在 Google 公布谁来负责 Gemini 4 的同一天,Alphabet 股价跌了约 5%。当发明 transformer 那家公司里四位最资深的技术人物,专门为了把「提出-运行-评估」这个循环产业化而集体离开时,autoresearch 就不再是一个推特题材,而是一个行业了。
https://x.com/Synapse_Brief/status/2086829648281833735
这一天的结构性新闻,而它指向哪里毫无含糊。Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离开了 Google——Dean 二十七年的任期就此结束——去做一家叫 Discovery Loop 的 autoresearch 创业公司,而 Alphabet 是创始投资人,这句话本身就说明了那场离职谈话是怎么谈的。这事落在 Google 公布谁来负责 Gemini 4 的同一天,Alphabet 股价跌了约 5%。当发明 transformer 那家公司里四位最资深的技术人物,专门为了把「提出-运行-评估」这个循环产业化而集体离开时,autoresearch 就不再是一个推特题材,而是一个行业了。
#18
@xdotli
https://x.com/xdotli/status/2086898143493558573
同一件事被读成时机信号而不是八卦。Jeff Dean 离开 Google 去做 Discovery Loop,把完整的科学发现周期自动化,而 Karpathy 今年早些时候把 auto-research 推到了聚光灯下。他的结论值得记住:AI 驱动的科学研究不是未来趋势,它正在发生。就单看这一期里的证据——kernel 竞赛、材料科学、模型架构搜索、内部模型训练、密码学 prover——这话很难反驳。
https://x.com/xdotli/status/2086898143493558573
同一件事被读成时机信号而不是八卦。Jeff Dean 离开 Google 去做 Discovery Loop,把完整的科学发现周期自动化,而 Karpathy 今年早些时候把 auto-research 推到了聚光灯下。他的结论值得记住:AI 驱动的科学研究不是未来趋势,它正在发生。就单看这一期里的证据——kernel 竞赛、材料科学、模型架构搜索、内部模型训练、密码学 prover——这话很难反驳。
#19
@code_hiyouga
https://x.com/code_hiyouga/status/2086836278272913526
两句话点出了真正的开放问题。RSI 和 auto research 在本质上有共通之处,而下一步是让 AI 对「产出可泛化的结果」负责。「可泛化」这个词就是全部难点:这一期里每一个结果都是某个特定目标上的一个数字,而这个领域目前还没有任何机制,能让一个 autoresearch 循环发现一样能迁移到它被指向的那个 benchmark 之外的东西。
https://x.com/code_hiyouga/status/2086836278272913526
两句话点出了真正的开放问题。RSI 和 auto research 在本质上有共通之处,而下一步是让 AI 对「产出可泛化的结果」负责。「可泛化」这个词就是全部难点:这一期里每一个结果都是某个特定目标上的一个数字,而这个领域目前还没有任何机制,能让一个 autoresearch 循环发现一样能迁移到它被指向的那个 benchmark 之外的东西。
#20
@dviolettchan
https://x.com/dviolettchan/status/2086873120862793956
这个领域很快必须回答的一条奖励黑客观察,以玩笑的形式送出。如果 AI 的评审就是真正的评审,那这就是一个绝佳的奖励黑客案例——他可以用 auto-research 随便做点东西、少操心、多打游戏,然后照样被接收。不太舒服的地方在于,这在结构上和进展公式里 verifier 强度那一项完全同构。如果 verifier 是一个 AI 评审、生产者是一个 autoresearch 循环,你就闭合了一个没有任何外部接触的回路。
https://x.com/dviolettchan/status/2086873120862793956
这个领域很快必须回答的一条奖励黑客观察,以玩笑的形式送出。如果 AI 的评审就是真正的评审,那这就是一个绝佳的奖励黑客案例——他可以用 auto-research 随便做点东西、少操心、多打游戏,然后照样被接收。不太舒服的地方在于,这在结构上和进展公式里 verifier 强度那一项完全同构。如果 verifier 是一个 AI 评审、生产者是一个 autoresearch 循环,你就闭合了一个没有任何外部接触的回路。
#21
@liuzhao_666
https://x.com/liuzhao_666/status/2086907650084941902
一句话,正是上面那个问题的正确答案。自我改进的循环需要一个受保护的评估集,因为没有固定的 holdout,每一次优化都可能悄悄教会 agent 去操纵自己的指标。「悄悄」这个词承担了全部重量——一个操纵了自己指标的循环,汇报出来的是「改进了」,所以这个失效在循环内部是不可见的,只有当你终于拿它从没见过的东西去测时才会露出来。
https://x.com/liuzhao_666/status/2086907650084941902
一句话,正是上面那个问题的正确答案。自我改进的循环需要一个受保护的评估集,因为没有固定的 holdout,每一次优化都可能悄悄教会 agent 去操纵自己的指标。「悄悄」这个词承担了全部重量——一个操纵了自己指标的循环,汇报出来的是「改进了」,所以这个失效在循环内部是不可见的,只有当你终于拿它从没见过的东西去测时才会露出来。
#22
@stas_sorokin_
https://x.com/stas_sorokin_/status/2086804278362988778
这整个领域缺的那种测量纪律,以清单形式给出。「最快」不是 benchmark,是一句没人需要为之辩护的宣称——每个开源 agent 发布都带一个速度宣称,而几乎没有一个说清到底测的是什么,因为原始 token 吞吐和完整任务完成时间是两个不同的数字,厂商会挑那个更好看的。大多数评测完全跳过的一项是 agent 循环开销:模型产出 token 之间发生的规划步骤、工具调用和重试,也就是说一个模型可以在原始生成速度上赢,却因为外面那个循环慢而输掉真正的任务。相信任何这类宣称之前,先查硬件和精度、这个数字是吞吐还是端到端完成时间、循环开销是算进去了还是被剥掉了、对比模型跑的是不是同样任务同样上下文长度同样工具集、权重是真的开放还是只是挂了开放的牌子、以及你自己能不能复跑。他的规则是:任何你没法复跑的数字,都不要拿它把东西放进生产流水线。
https://x.com/stas_sorokin_/status/2086804278362988778
这整个领域缺的那种测量纪律,以清单形式给出。「最快」不是 benchmark,是一句没人需要为之辩护的宣称——每个开源 agent 发布都带一个速度宣称,而几乎没有一个说清到底测的是什么,因为原始 token 吞吐和完整任务完成时间是两个不同的数字,厂商会挑那个更好看的。大多数评测完全跳过的一项是 agent 循环开销:模型产出 token 之间发生的规划步骤、工具调用和重试,也就是说一个模型可以在原始生成速度上赢,却因为外面那个循环慢而输掉真正的任务。相信任何这类宣称之前,先查硬件和精度、这个数字是吞吐还是端到端完成时间、循环开销是算进去了还是被剥掉了、对比模型跑的是不是同样任务同样上下文长度同样工具集、权重是真的开放还是只是挂了开放的牌子、以及你自己能不能复跑。他的规则是:任何你没法复跑的数字,都不要拿它把东西放进生产流水线。
#23
@0xShoopy
https://x.com/0xShoopy/status/2086787604523999497
今天最好的一份 harness 演示报告,而妙处在第一句:一位 Anthropic 工程师删掉了 90% 的配置,agent 反而更快了。她用 6 个函数交付了一个完整的事故响应 agent,而它在她演示结束之前就把一个 P99 尖刺调试出来了。那条历史细节才是最有意思的——Sonnet 4.5 有「上下文焦虑」,会在还有余量的时候提前收尾,他们打了 harness 补丁去补偿,然后 Opus 上线,这个行为自己消失了,这是对当下流行的「删掉你的补丁」建议最强的一个论据。架构上他们把大脑和手分开:agent 循环跑在服务端,工具跑在沙箱里,首 token 时间降了 90%。系统提示 6 行,agent 只用 3 个本地工具,没有 MCP 乱局,会话中途硬刷新什么都没丢,而且没接任何数据库。他最后那句话就是这一整期的主题:瓶颈从来不是模型,是 harness。
https://x.com/0xShoopy/status/2086787604523999497
今天最好的一份 harness 演示报告,而妙处在第一句:一位 Anthropic 工程师删掉了 90% 的配置,agent 反而更快了。她用 6 个函数交付了一个完整的事故响应 agent,而它在她演示结束之前就把一个 P99 尖刺调试出来了。那条历史细节才是最有意思的——Sonnet 4.5 有「上下文焦虑」,会在还有余量的时候提前收尾,他们打了 harness 补丁去补偿,然后 Opus 上线,这个行为自己消失了,这是对当下流行的「删掉你的补丁」建议最强的一个论据。架构上他们把大脑和手分开:agent 循环跑在服务端,工具跑在沙箱里,首 token 时间降了 90%。系统提示 6 行,agent 只用 3 个本地工具,没有 MCP 乱局,会话中途硬刷新什么都没丢,而且没接任何数据库。他最后那句话就是这一整期的主题:瓶颈从来不是模型,是 harness。
#24
@mhtuie52
https://x.com/mhtuie52/status/2086835994968338916
Stripe 的内部 agent,以及那个应该重置你对 skill 库看法的数字。一个工程师用一周做出了 Kai;现在 83% 的 Stripe 员工每周都在用。它坐在 1000 多个 skill 和 500 多个内部工具之上,而显而易见的做法是把这些全塞进上下文——Stripe 发现恰恰相反,因为超过大约 150 个 skill,前沿模型就开始变差。所以 Kai 走两遍:先判断这个请求实际需要哪些 skill,然后才让这些 skill 去加载它们的工具,形成一条「1000 多个 skill → 被选中的 skill → 它们的工具 → agent 循环」的链。接着 Stripe 把大脑和手分开,agent 留在沙箱外面,模型写的代码在里面跑,与创建它的进程隔离。要留下的结论是:他们不是靠「让模型能访问一切」把 Kai 做大的,是靠「教这个系统什么东西不要给模型看」。更多能力不需要更多上下文,需要更好的排除。
https://x.com/mhtuie52/status/2086835994968338916
Stripe 的内部 agent,以及那个应该重置你对 skill 库看法的数字。一个工程师用一周做出了 Kai;现在 83% 的 Stripe 员工每周都在用。它坐在 1000 多个 skill 和 500 多个内部工具之上,而显而易见的做法是把这些全塞进上下文——Stripe 发现恰恰相反,因为超过大约 150 个 skill,前沿模型就开始变差。所以 Kai 走两遍:先判断这个请求实际需要哪些 skill,然后才让这些 skill 去加载它们的工具,形成一条「1000 多个 skill → 被选中的 skill → 它们的工具 → agent 循环」的链。接着 Stripe 把大脑和手分开,agent 留在沙箱外面,模型写的代码在里面跑,与创建它的进程隔离。要留下的结论是:他们不是靠「让模型能访问一切」把 Kai 做大的,是靠「教这个系统什么东西不要给模型看」。更多能力不需要更多上下文,需要更好的排除。
#25
@_vmlops
https://x.com/_vmlops/status/2086734873692381618
同一场演示被读成架构而不是 demo,而那个三个词的模型值得借走:Agents 是大脑,Environments 是手,Sessions 是胶水。Claude Managed Agents 把 agent 循环跑在服务端,你不用管托管和扩容,工具执行是解耦的,会话能扛过刷新。一起报的还有:P95 首 token 时间降低 90% 以上、自带算力、加密凭证库、子 agent、记忆、结果对象和 webhook 触发。现场搭的是一个 SRE agent,它调查了一个 P99 延迟尖刺,分析了指标、部署和 diff,最后追溯到造成事故的那个确切 commit。
https://x.com/_vmlops/status/2086734873692381618
同一场演示被读成架构而不是 demo,而那个三个词的模型值得借走:Agents 是大脑,Environments 是手,Sessions 是胶水。Claude Managed Agents 把 agent 循环跑在服务端,你不用管托管和扩容,工具执行是解耦的,会话能扛过刷新。一起报的还有:P95 首 token 时间降低 90% 以上、自带算力、加密凭证库、子 agent、记忆、结果对象和 webhook 触发。现场搭的是一个 SRE agent,它调查了一个 P99 延迟尖刺,分析了指标、部署和 diff,最后追溯到造成事故的那个确切 commit。
#26
@0xNeuroBlue
https://x.com/0xNeuroBlue/status/2086616125375144384
有人给出的最干净的 agent 循环定义,出处记在一位 Google 工程师身上:它执行,然后检查自己的成果。写、跑、查——把第三个去掉,你手上就不是 agent,是一个生成器。他指向的那场演讲用二十分钟讲「去掉它会发生什么」,还带时间点:8:57 那个应用本来会挂掉,9:02 是抓住它的那次审查,12:09 是记忆悄悄忘掉的东西。
https://x.com/0xNeuroBlue/status/2086616125375144384
有人给出的最干净的 agent 循环定义,出处记在一位 Google 工程师身上:它执行,然后检查自己的成果。写、跑、查——把第三个去掉,你手上就不是 agent,是一个生成器。他指向的那场演讲用二十分钟讲「去掉它会发生什么」,还带时间点:8:57 那个应用本来会挂掉,9:02 是抓住它的那次审查,12:09 是记忆悄悄忘掉的东西。
#27
@onusoz
https://x.com/onusoz/status/2086844493672980650
这一期里最有创造力的一个作品,而它起于一次不爽。Codex 的桌面应用能跟着一个任务直到它真正完成——本质上就是 cron——而 CLI 到现在还不行,于是他在 Pi 上自己做了一个。然后他意识到:cron job 本身就是一个循环,既然是循环,他就可以把它表示成一张工作流图。于是他做了一个内建的 monitor 工作流:agent 被强制进入一个循环,每小时重新检查一次那个跑很久的任务,并被要求自主纠正、修掉遇到的任何 bug。他为什么偏好这个而不是基于 exec 的方案,是关键洞察——他的 monitor 工作流是确定性的,所以他可以让 agent 无限循环,而 agent 无论怎样都逃不掉这个任务;而用自动 fork 的 exec,模型有可能把 exec 搞错,或者在某个 sleep 退出后没能重新装上下一个。这让他可以把跑一周的任务丢出去然后忘掉,而且它连 Codex 额度耗尽都能扛过去——额度重置之后自动恢复。
https://x.com/onusoz/status/2086844493672980650
这一期里最有创造力的一个作品,而它起于一次不爽。Codex 的桌面应用能跟着一个任务直到它真正完成——本质上就是 cron——而 CLI 到现在还不行,于是他在 Pi 上自己做了一个。然后他意识到:cron job 本身就是一个循环,既然是循环,他就可以把它表示成一张工作流图。于是他做了一个内建的 monitor 工作流:agent 被强制进入一个循环,每小时重新检查一次那个跑很久的任务,并被要求自主纠正、修掉遇到的任何 bug。他为什么偏好这个而不是基于 exec 的方案,是关键洞察——他的 monitor 工作流是确定性的,所以他可以让 agent 无限循环,而 agent 无论怎样都逃不掉这个任务;而用自动 fork 的 exec,模型有可能把 exec 搞错,或者在某个 sleep 退出后没能重新装上下一个。这让他可以把跑一周的任务丢出去然后忘掉,而且它连 Codex 额度耗尽都能扛过去——额度重置之后自动恢复。
#28
@thdxr
https://x.com/thdxr/status/2086946190914896228
今天互动量最高的一条 agent loop 发言是一句抱怨,而它是一个真实的架构问题。把文件系统和 agent 耦在一起太蠢了——哪怕你只想给一个纯内存的、很笨的 agent 循环支持 skill,你都得先有一个虚拟文件系统。Skill 这个格式默认磁盘上有个目录,而这句话悄悄意味着:任何不是「某台机器上的一个 shell」的 agent 运行时,都得去伪造一个。
https://x.com/thdxr/status/2086946190914896228
今天互动量最高的一条 agent loop 发言是一句抱怨,而它是一个真实的架构问题。把文件系统和 agent 耦在一起太蠢了——哪怕你只想给一个纯内存的、很笨的 agent 循环支持 skill,你都得先有一个虚拟文件系统。Skill 这个格式默认磁盘上有个目录,而这句话悄悄意味着:任何不是「某台机器上的一个 shell」的 agent 运行时,都得去伪造一个。
#29
@0xblacklight
https://x.com/0xblacklight/status/2086959427224211837
对那句抱怨的直接回答,这也是它值得放进来的原因:如果你用的是纯内存的、很笨的 agent 循环,那就让 harness 从内存加载,或者允许调用方指定一个回调。两行话把一个格式抱怨变成了接口设计问题——skill 规范其实并不要求文件系统,它要求的是一个解析器,而大多数实现把错的那个硬编码进去了。
https://x.com/0xblacklight/status/2086959427224211837
对那句抱怨的直接回答,这也是它值得放进来的原因:如果你用的是纯内存的、很笨的 agent 循环,那就让 harness 从内存加载,或者允许调用方指定一个回调。两行话把一个格式抱怨变成了接口设计问题——skill 规范其实并不要求文件系统,它要求的是一个解析器,而大多数实现把错的那个硬编码进去了。
#30
@stretchcloud
https://x.com/stretchcloud/status/2086672639146504505
这一期里最有用的一篇论文摘要,而它的前提重新定位了 agent 延迟的来源。agentic 推理的瓶颈不是推理那一步,是工具调用:每次 agent 选一个函数并填参数,主模型都在一个 token 一个 token 地生成,而这条路径每个会话要跑几百次,串行工作量很大。OoO-Spec 的打法是加一个 Qwen3-0.6B 边车,在主模型还在处理的时候,用一次并行波预测出函数名和所有参数值,主模型不阻塞地做验证,并保持唯一的提交权。结果:比自回归解码快 2.46 到 5.34 倍,平均 3.89 倍;在 Qwen3 的 4B 到 32B 上比 ToolSpec 好 34.1%。真正值得注意的是同一个 0.6B 起草模型可以跨 Qwen2.5、Qwen3 和 Llama 迁移,不需要针对目标重新训练——一个小模型覆盖所有尺寸和家族。论文出自东京大学和北京大学,暂时没有产品,但实现面小到足以很快被人做成库。
https://x.com/stretchcloud/status/2086672639146504505
这一期里最有用的一篇论文摘要,而它的前提重新定位了 agent 延迟的来源。agentic 推理的瓶颈不是推理那一步,是工具调用:每次 agent 选一个函数并填参数,主模型都在一个 token 一个 token 地生成,而这条路径每个会话要跑几百次,串行工作量很大。OoO-Spec 的打法是加一个 Qwen3-0.6B 边车,在主模型还在处理的时候,用一次并行波预测出函数名和所有参数值,主模型不阻塞地做验证,并保持唯一的提交权。结果:比自回归解码快 2.46 到 5.34 倍,平均 3.89 倍;在 Qwen3 的 4B 到 32B 上比 ToolSpec 好 34.1%。真正值得注意的是同一个 0.6B 起草模型可以跨 Qwen2.5、Qwen3 和 Llama 迁移,不需要针对目标重新训练——一个小模型覆盖所有尺寸和家族。论文出自东京大学和北京大学,暂时没有产品,但实现面小到足以很快被人做成库。
#31
@zaoyang
https://x.com/zaoyang/status/2086816355399999911
今天技术含量最高的一条,而属于这一期的部分是一个警告:有一个加速你其实拿不到。Kimi Delta Attention,那个每四层里跑三层的混合线性注意力机制,是 K3 在 100 万 token 上下文下号称最高快 6.3 倍解码的来源。但测试者指出 KDA 打破了传统前缀缓存背后的假设——前缀缓存是让服务系统在多个请求间复用共享 prompt 前缀的注意力状态的技巧,而这对 coding agent 极其重要,因为它们会反复重发巨大且基本相同的上下文。线性注意力层携带的是一个滚动的循环状态而不是普通的 KV 缓存,所以「缓存前缀、跳过重算」这条路没法干净地套进去,需要上游先做运行时改造,你才能在一个真实的 agent 循环里真正吃到那个加速。他还指出 3:1 这个比例是测出来的甜点而不是一个旋钮——前置工作做过消融,7:1 训练 loss 相当但验证明显变差,1:1 验证守住了但推理开销又涨回去。
https://x.com/zaoyang/status/2086816355399999911
今天技术含量最高的一条,而属于这一期的部分是一个警告:有一个加速你其实拿不到。Kimi Delta Attention,那个每四层里跑三层的混合线性注意力机制,是 K3 在 100 万 token 上下文下号称最高快 6.3 倍解码的来源。但测试者指出 KDA 打破了传统前缀缓存背后的假设——前缀缓存是让服务系统在多个请求间复用共享 prompt 前缀的注意力状态的技巧,而这对 coding agent 极其重要,因为它们会反复重发巨大且基本相同的上下文。线性注意力层携带的是一个滚动的循环状态而不是普通的 KV 缓存,所以「缓存前缀、跳过重算」这条路没法干净地套进去,需要上游先做运行时改造,你才能在一个真实的 agent 循环里真正吃到那个加速。他还指出 3:1 这个比例是测出来的甜点而不是一个旋钮——前置工作做过消融,7:1 训练 loss 相当但验证明显变差,1:1 验证守住了但推理开销又涨回去。
#32
@vsaietta
https://x.com/vsaietta/status/2086788305689964552
一个数字解释了大部分 agent 账单,而且它把关于缓存的直觉翻了过来。缓存输入才是真正堆起来的那一行:29.73 美元对 5.68 美元的新鲜输入,尽管缓存的单价只有十分之一。这就是一个 agentic 循环在每一个后续轮次都重读同一份上下文,在规模上的成本,而不是新鲜 token。单 token 打九折,仍然打不过读取量涨十倍,而循环恰恰就是产生这个涨幅的那台机器。
https://x.com/vsaietta/status/2086788305689964552
一个数字解释了大部分 agent 账单,而且它把关于缓存的直觉翻了过来。缓存输入才是真正堆起来的那一行:29.73 美元对 5.68 美元的新鲜输入,尽管缓存的单价只有十分之一。这就是一个 agentic 循环在每一个后续轮次都重读同一份上下文,在规模上的成本,而不是新鲜 token。单 token 打九折,仍然打不过读取量涨十倍,而循环恰恰就是产生这个涨幅的那台机器。
#33
@0xMukay
https://x.com/0xMukay/status/2086723081985269816
这一期需要的经济学框架,而他提出的指标是对的。大多数跑 AI agent 的人盯的是 agent 干得多快;唯一要紧的数字是 agent 每做出一个正确决策要花多少钱。一个跑自主 agent 循环的 Claude Code 会话,按模型选择和上下文长度不同,每小时烧 2 到 40 美元的算力,而大多数人不知道自己的确切数字——他们只知道订阅感觉很便宜。它不便宜,它是被补贴的;虽然终结包月 agent 的尝试一直被回退,但方向已经确定。能活过这次转变的建设者已经知道自己的单位产出成本:他们把便宜任务路由给 Haiku,把 Opus 留给真的需要它的决策,并对重复上下文启用 prompt 缓存。他最后那句:AI agent 不是工具,是一台带着计价器在跑的基础设施。
https://x.com/0xMukay/status/2086723081985269816
这一期需要的经济学框架,而他提出的指标是对的。大多数跑 AI agent 的人盯的是 agent 干得多快;唯一要紧的数字是 agent 每做出一个正确决策要花多少钱。一个跑自主 agent 循环的 Claude Code 会话,按模型选择和上下文长度不同,每小时烧 2 到 40 美元的算力,而大多数人不知道自己的确切数字——他们只知道订阅感觉很便宜。它不便宜,它是被补贴的;虽然终结包月 agent 的尝试一直被回退,但方向已经确定。能活过这次转变的建设者已经知道自己的单位产出成本:他们把便宜任务路由给 Haiku,把 Opus 留给真的需要它的决策,并对重复上下文启用 prompt 缓存。他最后那句:AI agent 不是工具,是一台带着计价器在跑的基础设施。
#34
@helli0nEth
https://x.com/helli0nEth/status/2086904292103897508
同一个观点浓缩成一个画面,而它是这一期里最好的一句话。他看着一个 agent 在一个坏掉的测试上循环了四十分钟,全程烧 token——在按量计费的推理上那是一笔账目,在本地权重上那只是一间变暖的房间。这个区分就是本地模型在 agent 工作负载上的全部论据,而没人说得比这更紧凑。
https://x.com/helli0nEth/status/2086904292103897508
同一个观点浓缩成一个画面,而它是这一期里最好的一句话。他看着一个 agent 在一个坏掉的测试上循环了四十分钟,全程烧 token——在按量计费的推理上那是一笔账目,在本地权重上那只是一间变暖的房间。这个区分就是本地模型在 agent 工作负载上的全部论据,而没人说得比这更紧凑。
#35
@rtheoryxyz
https://x.com/rtheoryxyz/status/2086912890980675724
所有这些定价的结构性后果,一句话说完。隐藏的问题是:工具强制调用把缓存边界变成了产品表面的一部分,而一旦定价渗进架构,每一个 agent 循环都会开始围绕账单而不是围绕意图做优化。把它和那个 29.73 美元的缓存输入数字、以及 harness 之间的成本摆动放在一起读,这就是计费设计悄悄变成系统设计的机制。
https://x.com/rtheoryxyz/status/2086912890980675724
所有这些定价的结构性后果,一句话说完。隐藏的问题是:工具强制调用把缓存边界变成了产品表面的一部分,而一旦定价渗进架构,每一个 agent 循环都会开始围绕账单而不是围绕意图做优化。把它和那个 29.73 美元的缓存输入数字、以及 harness 之间的成本摆动放在一起读,这就是计费设计悄悄变成系统设计的机制。
#36
@maria_airealist
https://x.com/maria_airealist/status/2086842065141342713
这一期对整个 agentic 技术栈最锋利的批评,而它是一张创可贴清单。学不了新东西,被「把日志存进 memory.md 加 RAG」掩盖过去。做不到确定性、以及对 prompt 极度敏感,被「让 LLM 写代码然后执行、或者调用工具」掩盖过去。分不清对错,被 agentic 循环里那个验证步骤掩盖过去。她的判词是:它算是能用,但它算是一堆创可贴,尤其是持续学习那一部分。这三条每一条都直接对应到这一期里的一类工具,而这要么是一份毁灭性的解读,要么就是对「工程一直以来就是这么干的」的一句描述。
https://x.com/maria_airealist/status/2086842065141342713
这一期对整个 agentic 技术栈最锋利的批评,而它是一张创可贴清单。学不了新东西,被「把日志存进 memory.md 加 RAG」掩盖过去。做不到确定性、以及对 prompt 极度敏感,被「让 LLM 写代码然后执行、或者调用工具」掩盖过去。分不清对错,被 agentic 循环里那个验证步骤掩盖过去。她的判词是:它算是能用,但它算是一堆创可贴,尤其是持续学习那一部分。这三条每一条都直接对应到这一期里的一类工具,而这要么是一份毁灭性的解读,要么就是对「工程一直以来就是这么干的」的一句描述。
#37
@raulvk
https://x.com/raulvk/status/2086843993661329710
对审查循环最好笑也最准确的描述,而做过这件事的人都认得。这些模型是阴险的精神病:设计阶段它们让你确信它们完全懂了,你走开的时候觉得这活稳了。然后你去 review 实现,发现它们把床拉了。你让它们改,它们懂了,你再 review 一遍,它们换了床上另一块地方拉。啊,多么快乐,真正的 agentic 循环。
https://x.com/raulvk/status/2086843993661329710
对审查循环最好笑也最准确的描述,而做过这件事的人都认得。这些模型是阴险的精神病:设计阶段它们让你确信它们完全懂了,你走开的时候觉得这活稳了。然后你去 review 实现,发现它们把床拉了。你让它们改,它们懂了,你再 review 一遍,它们换了床上另一块地方拉。啊,多么快乐,真正的 agentic 循环。
#38
@kentcdodds
https://x.com/kentcdodds/status/2086894806404567102
一条值得围绕它做设计的原则:当收到反馈的那个 agent 就是去动手修的那个 agent 时,agent 反馈效果极好。这才叫 agentic 循环。大多数反馈工具把信号送给一个人,再由这个人转达,而循环恰恰断在转达这一环——解法是把它闭合,不是把转达做快。
https://x.com/kentcdodds/status/2086894806404567102
一条值得围绕它做设计的原则:当收到反馈的那个 agent 就是去动手修的那个 agent 时,agent 反馈效果极好。这才叫 agentic 循环。大多数反馈工具把信号送给一个人,再由这个人转达,而循环恰恰断在转达这一环——解法是把它闭合,不是把转达做快。
#39
@KiraFeed
https://x.com/KiraFeed/status/2086629230809317497
把设计变成一个 agentic 循环,而作者准确地指出了哪一半才令人惊讶。惊讶的不是 Claude 会在 Figma 里做设计——是它能看着自己做出来的东西说「这看着还是不行」,然后去改。Claude 加 Figma MCP,基本上是把设计变成了一个 agentic 循环。对一个视觉产物做自我批评,等于为一个本该无法验证的领域造出了 verifier,而这恰恰是过去把这类循环困在代码和 kernel 里的那道门槛。
https://x.com/KiraFeed/status/2086629230809317497
把设计变成一个 agentic 循环,而作者准确地指出了哪一半才令人惊讶。惊讶的不是 Claude 会在 Figma 里做设计——是它能看着自己做出来的东西说「这看着还是不行」,然后去改。Claude 加 Figma MCP,基本上是把设计变成了一个 agentic 循环。对一个视觉产物做自我批评,等于为一个本该无法验证的领域造出了 verifier,而这恰恰是过去把这类循环困在代码和 kernel 里的那道门槛。
#40
@kuo_chesterkuo
https://x.com/kuo_chesterkuo/status/2086689959940128840
一个自主进攻循环被做成了产品,而设计原则把它和扫描器区分开。大多数 AI 安全工具是在对已知特征做模式匹配;这里 GLM 5.2 作为自主 agent 驱动整个进攻循环——测绘应用的攻击面、构造并发射真实(安全的)利用载荷、把发现串联起来、并用一个可工作的概念验证确认每一条,全部映射到完整的 OWASP Top 10 2025。这意味着主动利用而不是被动扫描,每一条发现都有真实 PoC 加请求响应证据支撑,而这正是压低误报的原因。覆盖范围包括注入、失效的访问控制(含 BOLA 和 IDOR)、SSRF、JWT、GraphQL、反序列化和业务逻辑缺陷。他关于前置条件的那句话才是相关的部分:一个自主渗透测试员只有在模型真的能在一个长 agentic 循环里推理并使用工具时才成立。
https://x.com/kuo_chesterkuo/status/2086689959940128840
一个自主进攻循环被做成了产品,而设计原则把它和扫描器区分开。大多数 AI 安全工具是在对已知特征做模式匹配;这里 GLM 5.2 作为自主 agent 驱动整个进攻循环——测绘应用的攻击面、构造并发射真实(安全的)利用载荷、把发现串联起来、并用一个可工作的概念验证确认每一条,全部映射到完整的 OWASP Top 10 2025。这意味着主动利用而不是被动扫描,每一条发现都有真实 PoC 加请求响应证据支撑,而这正是压低误报的原因。覆盖范围包括注入、失效的访问控制(含 BOLA 和 IDOR)、SSRF、JWT、GraphQL、反序列化和业务逻辑缺陷。他关于前置条件的那句话才是相关的部分:一个自主渗透测试员只有在模型真的能在一个长 agentic 循环里推理并使用工具时才成立。
#41
@cyberneticphysx
https://x.com/cyberneticphysx/status/2086669577027792907
关于「世界模型并不取消 verifier 的必要性」的最好表述。基于物理的世界模型不是来替代模拟器的——它们是有效扩展机器人强化学习所缺的那一块。假设你有一个 agentic 循环,世界模型的角色是「梦」出下一个状态:你仍然需要模拟器在循环里给规划打锚,因为模拟器是那个更贵、也更可验证的步骤,而做梦的循环成了那个更快、但依然必要的近似。廉价近似加昂贵锚点,在结构上和这一期里的边车起草模型、两遍 skill 选择是同一个模式。
https://x.com/cyberneticphysx/status/2086669577027792907
关于「世界模型并不取消 verifier 的必要性」的最好表述。基于物理的世界模型不是来替代模拟器的——它们是有效扩展机器人强化学习所缺的那一块。假设你有一个 agentic 循环,世界模型的角色是「梦」出下一个状态:你仍然需要模拟器在循环里给规划打锚,因为模拟器是那个更贵、也更可验证的步骤,而做梦的循环成了那个更快、但依然必要的近似。廉价近似加昂贵锚点,在结构上和这一期里的边车起草模型、两遍 skill 选择是同一个模式。
#42
@nickthorpp
https://x.com/nickthorpp/status/2086785078512828744
对每一次本地模型发布都该问的那个问题,而几乎没人问。他同意 24GB 显存配 30B dense 是当前的甜点,然后做了那个真正要紧的区分:实际上更大的解锁不是「它跑得起来」,而是当你在本地跑长周期任务时,那个 agentic 循环能不能在不持续截断上下文、不持续工具调用失败的情况下保持稳定。他抛出的那个问题——有没有人见过哪个新的 30B 级模型在多工具、多轮的 agent 工作负载下真的守住了可靠性——正是整波本地 agent 浪潮缺的那个 benchmark。
https://x.com/nickthorpp/status/2086785078512828744
对每一次本地模型发布都该问的那个问题,而几乎没人问。他同意 24GB 显存配 30B dense 是当前的甜点,然后做了那个真正要紧的区分:实际上更大的解锁不是「它跑得起来」,而是当你在本地跑长周期任务时,那个 agentic 循环能不能在不持续截断上下文、不持续工具调用失败的情况下保持稳定。他抛出的那个问题——有没有人见过哪个新的 30B 级模型在多工具、多轮的 agent 工作负载下真的守住了可靠性——正是整波本地 agent 浪潮缺的那个 benchmark。
#43
@sanjaybhadra
https://x.com/sanjaybhadra/status/2086804771781099816
为什么某个本地模型的 demo 比那张 benchmark 表格更有说服力,而理由是「闭环」而不是「能力」。Muse Glimmer 的 demo 走完了完整的本地 agent 循环:发现 Home Assistant、理解它的 API、搭一个面板、启动它、验证它。如果它在 demo 之外也站得住,他预期会有很多非技术或半技术的人开始尝试自己的家庭网络、摄像头和自动化项目。注意「验证」是第五步,而正是它让这件事成为一个循环而不是一段脚本。
https://x.com/sanjaybhadra/status/2086804771781099816
为什么某个本地模型的 demo 比那张 benchmark 表格更有说服力,而理由是「闭环」而不是「能力」。Muse Glimmer 的 demo 走完了完整的本地 agent 循环:发现 Home Assistant、理解它的 API、搭一个面板、启动它、验证它。如果它在 demo 之外也站得住,他预期会有很多非技术或半技术的人开始尝试自己的家庭网络、摄像头和自动化项目。注意「验证」是第五步,而正是它让这件事成为一个循环而不是一段脚本。
#44
@cozybearlog
https://x.com/cozybearlog/status/2086678165016220050
一次性给所有 harness 加上一层多模态,而战略解读才是有意思的那一半。Qwen 开源了 Qwen-MM-Plugins,一套插件把任何 agent harness——Claude Code、Codex、Gemini CLI——变成多模态原生的,把屏幕、视频、PDF 和 3D/CAD 文件直接送进 agent 循环。他把缺口点得很准:今天每个 harness 都在用文本思考,但它操作的世界是屏幕和文件;而在模型厂商都在抢「让模型能看见」的时候,赢的那个 harness 可能是那个让你不用重构架构就能把视觉插进去的。这个打法本身也值得记一笔——不去和那些 harness 竞争,而是发一个把它们全部升级的插件,这是不拥有平台却打赢标准战争的方式。
https://x.com/cozybearlog/status/2086678165016220050
一次性给所有 harness 加上一层多模态,而战略解读才是有意思的那一半。Qwen 开源了 Qwen-MM-Plugins,一套插件把任何 agent harness——Claude Code、Codex、Gemini CLI——变成多模态原生的,把屏幕、视频、PDF 和 3D/CAD 文件直接送进 agent 循环。他把缺口点得很准:今天每个 harness 都在用文本思考,但它操作的世界是屏幕和文件;而在模型厂商都在抢「让模型能看见」的时候,赢的那个 harness 可能是那个让你不用重构架构就能把视觉插进去的。这个打法本身也值得记一笔——不去和那些 harness 竞争,而是发一个把它们全部升级的插件,这是不拥有平台却打赢标准战争的方式。
#45
@jerryjliu0
https://x.com/jerryjliu0/status/2086915480389111830
给「无聊技术」的一个延迟论据,而且放在了最要紧的位置上。基于 VLM 的解析有个缺点:它通常比基于文本的启发式方法慢,所以它会给 agent 循环里任何临时的文件处理增加延迟——比如你往 Claude 里上传一个文件的时候。LiteParse 就是为了做一个非常好的、基于文本的启发式抽取器,好让它能当 agent 循环里的默认解析器:解析 200 页 4 毫秒,比其他开源解析器更准,用一个 agent skill 一行命令就能装进 Claude Cowork、Claude Code 或 Codex。它支持 50 多种文档格式,并自带一个复杂度路由,让你可以把真正复杂的页面转给 OCR 或 VLM。快的默认路径加上升级通道,形状是对的,而这已经是这一期里第三次出现同一个形状。
https://x.com/jerryjliu0/status/2086915480389111830
给「无聊技术」的一个延迟论据,而且放在了最要紧的位置上。基于 VLM 的解析有个缺点:它通常比基于文本的启发式方法慢,所以它会给 agent 循环里任何临时的文件处理增加延迟——比如你往 Claude 里上传一个文件的时候。LiteParse 就是为了做一个非常好的、基于文本的启发式抽取器,好让它能当 agent 循环里的默认解析器:解析 200 页 4 毫秒,比其他开源解析器更准,用一个 agent skill 一行命令就能装进 Claude Cowork、Claude Code 或 Codex。它支持 50 多种文档格式,并自带一个复杂度路由,让你可以把真正复杂的页面转给 OCR 或 VLM。快的默认路径加上升级通道,形状是对的,而这已经是这一期里第三次出现同一个形状。
#46
@stretchcloud
https://x.com/stretchcloud/status/2086876670007419034
推理变便宜之后什么会改变,而答案是瓶颈会移动而不是消失。三周前每个 coding 任务 7.23 美元,会让你认真斟酌往 agent 循环里喂什么;今天 0.12 美元,这套经济学变了,于是那些原本在限流的团队现在跑的任务多得多,也就需要更高吞吐的可靠数据供给。而这正是抽取质量开始比过去更要紧的地方。DeepScraper 用的是 fit-markdown:抓一个页面时它剥掉版式噪声,只序列化 DOM 里内容密度高的部分,产出能装进上下文窗口的干净 markdown,不把 token 烧在导航栏和页脚上。因为它在第一次抓取时就推导出一个确定性的 CSS 选择器,后续运行完全跳过解析,直接复用缓存的选择器,直到站点结构变化时自动重新推导。他那句话值得留下:7 美元的一次糟糕抽取仍然只是一次糟糕抽取,但在 0.12 美元下,你可能会做 60 倍那么多次。
https://x.com/stretchcloud/status/2086876670007419034
推理变便宜之后什么会改变,而答案是瓶颈会移动而不是消失。三周前每个 coding 任务 7.23 美元,会让你认真斟酌往 agent 循环里喂什么;今天 0.12 美元,这套经济学变了,于是那些原本在限流的团队现在跑的任务多得多,也就需要更高吞吐的可靠数据供给。而这正是抽取质量开始比过去更要紧的地方。DeepScraper 用的是 fit-markdown:抓一个页面时它剥掉版式噪声,只序列化 DOM 里内容密度高的部分,产出能装进上下文窗口的干净 markdown,不把 token 烧在导航栏和页脚上。因为它在第一次抓取时就推导出一个确定性的 CSS 选择器,后续运行完全跳过解析,直接复用缓存的选择器,直到站点结构变化时自动重新推导。他那句话值得留下:7 美元的一次糟糕抽取仍然只是一次糟糕抽取,但在 0.12 美元下,你可能会做 60 倍那么多次。
#47
@exploraX_
https://x.com/exploraX_/status/2086926463392235899
一份 MCP server 合集,外挂三条规则,而规则比清单更有价值。这个仓库收了给 Claude、Gemini 和 Codex 用的前 50 个 MCP server,MIT 协议,分成 9 类,每一个都给出三种 agent 各自的确切安装命令。然后是:不要装 50 个,因为一旦连上超过 5 到 7 个 server,你的 agent 会被工具膨胀噎住,变慢也变笨。把每一个 server 都当成一个陌生人 GitHub 上的 CLI 看待——锁版本,在你亲眼看它跑通之前 token 只给只读权限。以及:永远不要把一个 agent 循环指向生产环境,用只读副本。第一条和 Stripe 在 150 个 skill 上撞到的是同一个发现,只是出现在小得多的规模上;第三条则正是今天另一期里那个健身房预约事件用来说明的东西。
https://x.com/exploraX_/status/2086926463392235899
一份 MCP server 合集,外挂三条规则,而规则比清单更有价值。这个仓库收了给 Claude、Gemini 和 Codex 用的前 50 个 MCP server,MIT 协议,分成 9 类,每一个都给出三种 agent 各自的确切安装命令。然后是:不要装 50 个,因为一旦连上超过 5 到 7 个 server,你的 agent 会被工具膨胀噎住,变慢也变笨。把每一个 server 都当成一个陌生人 GitHub 上的 CLI 看待——锁版本,在你亲眼看它跑通之前 token 只给只读权限。以及:永远不要把一个 agent 循环指向生产环境,用只读副本。第一条和 Stripe 在 150 个 skill 上撞到的是同一个发现,只是出现在小得多的规模上;第三条则正是今天另一期里那个健身房预约事件用来说明的东西。
#48
@HermesWatcher
https://x.com/HermesWatcher/status/2086935645319295276
一个悄悄让某些人账单翻倍的配置细节,而几乎没人去查。大多数人以为 Hermes 只有一个模型决策;它其实有两个。你的主模型跑 agent 循环——对话、推理、工具调用、回复——但 Hermes 还有一组辅助模型槽位,负责上下文压缩、网页抽取、视觉、审批、Skills Hub 搜索、MCP 辅助工作和会话标题这些副活。值得检查的是 auto:当某个辅助槽位设为 auto 时,Hermes 会用你的主模型来干那件事,于是一个高价推理模型可能顺手也在干日常杂活。改法是 hermes model,然后进辅助模型配置,挑任务,指定你想用的供应商和模型。他建议的规则是对的——把最强的模型留在推理质量真正重要的地方,只有当一个更便宜或更快的模型确实适合某个具体任务时,才把那件重复性的支持工作挪过去。
https://x.com/HermesWatcher/status/2086935645319295276
一个悄悄让某些人账单翻倍的配置细节,而几乎没人去查。大多数人以为 Hermes 只有一个模型决策;它其实有两个。你的主模型跑 agent 循环——对话、推理、工具调用、回复——但 Hermes 还有一组辅助模型槽位,负责上下文压缩、网页抽取、视觉、审批、Skills Hub 搜索、MCP 辅助工作和会话标题这些副活。值得检查的是 auto:当某个辅助槽位设为 auto 时,Hermes 会用你的主模型来干那件事,于是一个高价推理模型可能顺手也在干日常杂活。改法是 hermes model,然后进辅助模型配置,挑任务,指定你想用的供应商和模型。他建议的规则是对的——把最强的模型留在推理质量真正重要的地方,只有当一个更便宜或更快的模型确实适合某个具体任务时,才把那件重复性的支持工作挪过去。
#49
@VietArchitectAI
https://x.com/VietArchitectAI/status/2086624951545786649
agent loop 这场讨论里没人会写下来的那份企业需求清单,来自一位在越南某银行主导 AI Agent Hub 的人。他们在建一套九层的 GenAI 能力全景,从体验层和网关层往下到运行时(prompt、agent、编排),再到知识、模型、MCP 工具网关、数据和基础设施,外加一条贯穿全栈的治理、安全与审批层,含人工审批、maker-checker 和风险分级。他的提问才是有用的部分,因为那正是受监管环境里的生产真正要求的东西:一个托管 agent 产品覆盖了运行时层的多少,以及关键的——它怎么支持 agent 循环的原生暂停和恢复,以及注入审批门的能力,鉴于人工审批和响应格式在 maker-checker 与多级审批下是强制的。他还问了 MCP 实现在权限范围、密钥与保险库、幂等性、交易限额和 maker-checker 方面的成熟度。
https://x.com/VietArchitectAI/status/2086624951545786649
agent loop 这场讨论里没人会写下来的那份企业需求清单,来自一位在越南某银行主导 AI Agent Hub 的人。他们在建一套九层的 GenAI 能力全景,从体验层和网关层往下到运行时(prompt、agent、编排),再到知识、模型、MCP 工具网关、数据和基础设施,外加一条贯穿全栈的治理、安全与审批层,含人工审批、maker-checker 和风险分级。他的提问才是有用的部分,因为那正是受监管环境里的生产真正要求的东西:一个托管 agent 产品覆盖了运行时层的多少,以及关键的——它怎么支持 agent 循环的原生暂停和恢复,以及注入审批门的能力,鉴于人工审批和响应格式在 maker-checker 与多级审批下是强制的。他还问了 MCP 实现在权限范围、密钥与保险库、幂等性、交易限额和 maker-checker 方面的成熟度。
#50
@echo_vic
https://x.com/echo_vic/status/2086608140833788352
对「舰队规模上会发生什么」的正确框架,而最后那句才是要记住的。1000 个 agent 的循环,是乐趣结束、治理开始的地方:在那个规模上你需要按 agent 划分的权限范围、一份能回答「谁干了什么」的协调者记录,以及不是 agent 自己的 verifier。规模是治理的乘数,不只是性能的乘数。「verifier 不能是 agent 自己」这条要求,和那条「受保护 holdout」的要求是同一件事——一边从指标出发,一边从追责出发,撞到了同一个点上。
https://x.com/echo_vic/status/2086608140833788352
对「舰队规模上会发生什么」的正确框架,而最后那句才是要记住的。1000 个 agent 的循环,是乐趣结束、治理开始的地方:在那个规模上你需要按 agent 划分的权限范围、一份能回答「谁干了什么」的协调者记录,以及不是 agent 自己的 verifier。规模是治理的乘数,不只是性能的乘数。「verifier 不能是 agent 自己」这条要求,和那条「受保护 holdout」的要求是同一件事——一边从指标出发,一边从追责出发,撞到了同一个点上。
#51
@AiCamila_
https://x.com/AiCamila_/status/2086856514854392194
把护栏当成循环的一个分层属性,而不是管道末端的一个过滤器,这个形状是对的。单个过滤器不够;强的 agent 系统在多个点上施加护栏——输入、规划、工具使用、输出——好让不安全或低质量的行为被早早拦住。她的清单是:尽早过滤和净化输入;在执行之前校验计划和工具选择;给输出的安全性和质量打分;记录每一次护栏决策;在整个循环上持续保持监控。那句提示才是承重的:只坐在管道末端的护栏,抓到问题时已经太晚。
https://x.com/AiCamila_/status/2086856514854392194
把护栏当成循环的一个分层属性,而不是管道末端的一个过滤器,这个形状是对的。单个过滤器不够;强的 agent 系统在多个点上施加护栏——输入、规划、工具使用、输出——好让不安全或低质量的行为被早早拦住。她的清单是:尽早过滤和净化输入;在执行之前校验计划和工具选择;给输出的安全性和质量打分;记录每一次护栏决策;在整个循环上持续保持监控。那句提示才是承重的:只坐在管道末端的护栏,抓到问题时已经太晚。
#52
@BotonomyAI
https://x.com/BotonomyAI/status/2086693959493927299
一次比任何教程都教得多的失败,而它值得当成一份反面规格来读。他第一个 AI agent 循环跑了 6 分钟,递归调用了自己,花掉他 14 美元。他说这比任何教程都让他更懂 agent 架构,这个说法可信——没有深度上限、没有预算天花板的递归自调用,是第一个循环最常见的死法,而这也是这堂课最便宜的一个版本。
https://x.com/BotonomyAI/status/2086693959493927299
一次比任何教程都教得多的失败,而它值得当成一份反面规格来读。他第一个 AI agent 循环跑了 6 分钟,递归调用了自己,花掉他 14 美元。他说这比任何教程都让他更懂 agent 架构,这个说法可信——没有深度上限、没有预算天花板的递归自调用,是第一个循环最常见的死法,而这也是这堂课最便宜的一个版本。
#53
@hlr_newsletter
https://x.com/hlr_newsletter/status/2086752620538995000
为什么小实现在教学上有价值,说得很准。Pi from Scratch 用大约 600 行 TypeScript 重建了一个可用的 coding agent:文件工具、shell 执行、trace 和断点。它为什么重要在第二句——小实现有助于把「本质的 agent 循环」和「生产环境后来加上的可靠性与安全层」分开。大多数人分不清自己 harness 里哪些部分是循环、哪些部分是疤痕组织,而 600 行短到足以看清这个区别。
https://x.com/hlr_newsletter/status/2086752620538995000
为什么小实现在教学上有价值,说得很准。Pi from Scratch 用大约 600 行 TypeScript 重建了一个可用的 coding agent:文件工具、shell 执行、trace 和断点。它为什么重要在第二句——小实现有助于把「本质的 agent 循环」和「生产环境后来加上的可靠性与安全层」分开。大多数人分不清自己 harness 里哪些部分是循环、哪些部分是疤痕组织,而 600 行短到足以看清这个区别。
#54
@Harnoor29581982
https://x.com/Harnoor29581982/status/2086657888345563586
一个 build-in-public 的 agent 运行时,功能清单的形状异常地像生产环境。Pocket Agent 第三阶段上线,用 LangGraph 加 LangChain 建的,值得记的选择包括:用 create_agent 加中间件而不是手写 agent 循环、7 个生产级工具、从文件加载 persona 并做运行时上下文注入、在不可逆操作之前用 interrupt() 做人工审批、Postgres 支撑的日历、记忆和发件箱、启动时幂等的数据库 schema 初始化、以及工具失败被优雅处理而不打断 agent 循环。第四阶段是记忆,用 Postgres checkpointer、pgvector 和检索门。「在不可逆操作前中断」这个模式,恰恰就是上面那些受监管环境的问题在向厂商索要的东西。
https://x.com/Harnoor29581982/status/2086657888345563586
一个 build-in-public 的 agent 运行时,功能清单的形状异常地像生产环境。Pocket Agent 第三阶段上线,用 LangGraph 加 LangChain 建的,值得记的选择包括:用 create_agent 加中间件而不是手写 agent 循环、7 个生产级工具、从文件加载 persona 并做运行时上下文注入、在不可逆操作之前用 interrupt() 做人工审批、Postgres 支撑的日历、记忆和发件箱、启动时幂等的数据库 schema 初始化、以及工具失败被优雅处理而不打断 agent 循环。第四阶段是记忆,用 Postgres checkpointer、pgvector 和检索门。「在不可逆操作前中断」这个模式,恰恰就是上面那些受监管环境的问题在向厂商索要的东西。
#55
@ChangHao564792d
https://x.com/ChangHao564792d/status/2086908133277147596
同一套训练与评测栈上的两种 agent 模式,而第二种模式解决了一个真实的研究难题。STACX 支持 Native Agent Mode:你直接在 STACX 里实现 agent 循环,换来 token 级的完整可见性、自定义工具和细粒度算法设计。以及 Installed Agent Mode:把 OpenHands、Terminus-2 这类现成的黑盒脚手架直接跑在任务容器里,不用重建它们的 agent 循环——一个录制代理捕获脚手架与 LLM 之间的交互,把真实的 agent 轨迹变成可训练数据。两种模式都支持完整生命周期:rollout、训练、评测,以及带 verifier 反馈的沙箱执行。不重新实现 harness 就把它的真实轨迹变成训练数据,这是这里值得偷走的把戏。
https://x.com/ChangHao564792d/status/2086908133277147596
同一套训练与评测栈上的两种 agent 模式,而第二种模式解决了一个真实的研究难题。STACX 支持 Native Agent Mode:你直接在 STACX 里实现 agent 循环,换来 token 级的完整可见性、自定义工具和细粒度算法设计。以及 Installed Agent Mode:把 OpenHands、Terminus-2 这类现成的黑盒脚手架直接跑在任务容器里,不用重建它们的 agent 循环——一个录制代理捕获脚手架与 LLM 之间的交互,把真实的 agent 轨迹变成可训练数据。两种模式都支持完整生命周期:rollout、训练、评测,以及带 verifier 反馈的沙箱执行。不重新实现 harness 就把它的真实轨迹变成训练数据,这是这里值得偷走的把戏。
#56
@Vtrivedy10
https://x.com/Vtrivedy10/status/2086853921549463875
一个关于「现在验证从哪里来」的小观察:浏览器已经成为自我改进 agent 跑验证循环时的默认工具。他点的组合是 Deep Agents 加 Stagehand v4,并把功劳给 Browserbase 团队,说他们把抽象和基础设施做得很好用。值得和 Figma MCP 那条并排放——两者都是一个循环为原本没有 verifier 的领域获得了 verifier,而且两次的 verifier 都是一个被渲染出来的界面,而不是一套测试。
https://x.com/Vtrivedy10/status/2086853921549463875
一个关于「现在验证从哪里来」的小观察:浏览器已经成为自我改进 agent 跑验证循环时的默认工具。他点的组合是 Deep Agents 加 Stagehand v4,并把功劳给 Browserbase 团队,说他们把抽象和基础设施做得很好用。值得和 Figma MCP 那条并排放——两者都是一个循环为原本没有 verifier 的领域获得了 verifier,而且两次的 verifier 都是一个被渲染出来的界面,而不是一套测试。
#57
@mehmed_bazdar
https://x.com/mehmed_bazdar/status/2086783271740768510
给自己应用做 harness 的最便宜的方式,一句话说完:如果你需要一个专门适配你应用的好 harness,就把 Claude 或 Codex 指向 Codex CLI、OpenCode 或 Pi 的仓库,让它去分析那份 agent 循环实现。三个开放的参考实现都存在,都可读,而那个将要在你 harness 里跑的 agent,同时也是现有最好的「别人代码的读者」。
https://x.com/mehmed_bazdar/status/2086783271740768510
给自己应用做 harness 的最便宜的方式,一句话说完:如果你需要一个专门适配你应用的好 harness,就把 Claude 或 Codex 指向 Codex CLI、OpenCode 或 Pi 的仓库,让它去分析那份 agent 循环实现。三个开放的参考实现都存在,都可读,而那个将要在你 harness 里跑的 agent,同时也是现有最好的「别人代码的读者」。
#58
@MBeekun
https://x.com/MBeekun/status/2086785886180491289
一个针对特定约束的厂商独立性流程,起因是 DeepSeek 宣布涨价,把「怎么避免被厂商锁定」这个问题重新抛了出来。他的文章讲 LangChain 里的模型层、他在不改动 agent 循环的前提下挑选供应商所遵循的流程,以及——有用的那部分——为什么工具调用和结构化输出才是评估一次替换的基准。这两项是对的测试点,因为供应商之间的差异真正把东西弄坏的地方就在这里,而人们容易去看的却是通用回答质量。
https://x.com/MBeekun/status/2086785886180491289
一个针对特定约束的厂商独立性流程,起因是 DeepSeek 宣布涨价,把「怎么避免被厂商锁定」这个问题重新抛了出来。他的文章讲 LangChain 里的模型层、他在不改动 agent 循环的前提下挑选供应商所遵循的流程,以及——有用的那部分——为什么工具调用和结构化输出才是评估一次替换的基准。这两项是对的测试点,因为供应商之间的差异真正把东西弄坏的地方就在这里,而人们容易去看的却是通用回答质量。
#59
@kamsakihiyuuma
https://x.com/kamsakihiyuuma/status/2086664903386108165
agentic coding 的一个二阶成本,它值得比现在更多的注意。AI coding agent 可能造出一个意料之外的问题:代码更多,共享知识更少。如果一个工程师是通过 AI agent 解决问题的,很多推理会留在一个私密的人机循环里——没有 Stack Overflow 答案,没有 GitHub 讨论,没有详细的 issue 讨论帖,有时候连一条有意义的 commit message 都没有。他的结论值得停下来想:我们可能在生产软件上变得极大地更强,同时在生产「未来工程师用来学习的公共知识」上变得更差。顺带注意一句,从那些公共知识里学习的模型,正是在闭合这个循环的同一批模型。
https://x.com/kamsakihiyuuma/status/2086664903386108165
agentic coding 的一个二阶成本,它值得比现在更多的注意。AI coding agent 可能造出一个意料之外的问题:代码更多,共享知识更少。如果一个工程师是通过 AI agent 解决问题的,很多推理会留在一个私密的人机循环里——没有 Stack Overflow 答案,没有 GitHub 讨论,没有详细的 issue 讨论帖,有时候连一条有意义的 commit message 都没有。他的结论值得停下来想:我们可能在生产软件上变得极大地更强,同时在生产「未来工程师用来学习的公共知识」上变得更差。顺带注意一句,从那些公共知识里学习的模型,正是在闭合这个循环的同一批模型。
#60
@VSMdev
https://x.com/VSMdev/status/2086929033129062441
一次量化「这件事已经走了多远」的测量,来自微软的一项生产环境研究。Copilot 的 agent 循环很忙:研究中 87% 的 LLM 调用是由 agent 发起的,而失败有时会触发几十次重试。两半都重要。agent 发起的调用占绝大多数,意味着「人类打进去的 prompt」在生产环境里已经是少数情况;而每次失败几十次重试,正是这一期里那些成本数字的来源。
https://x.com/VSMdev/status/2086929033129062441
一次量化「这件事已经走了多远」的测量,来自微软的一项生产环境研究。Copilot 的 agent 循环很忙:研究中 87% 的 LLM 调用是由 agent 发起的,而失败有时会触发几十次重试。两半都重要。agent 发起的调用占绝大多数,意味着「人类打进去的 prompt」在生产环境里已经是少数情况;而每次失败几十次重试,正是这一期里那些成本数字的来源。
#61
@alexchen77sh
https://x.com/alexchen77sh/status/2086933377018658836
一份带命题的热门仓库解读,而这个命题在这一期其他所有东西面前都站得住:开源 agent 正在越过 prompt 包装层,走向持久运行时、结构化上下文和完整工作流。Prime Agent 排第一,单日 +2362 星,自我改进和长时间运行的编码任务在这里收敛成「被设计成持久系统的 agent」。Semantica 从 35 名跳到 7 名,+906 星,图原生的上下文和可追责性正在压过松散连接的检索。ComfyUI 从 29 名到 8 名,+871 星,基于节点的编排仍然是可观测、可复用的生产工作流的一个强力界面。earendil-works/pi 从 28 名到 17 名,+590 星,它统一的模型 API、agent 循环、TUI 和编码 CLI 反映的是对完整、模型可换的工具链的需求。他最后的判读是:问题已经不再是模型能不能完成一个任务,而是围绕它的那个系统能不能可重复、可靠、可追责地完成。
https://x.com/alexchen77sh/status/2086933377018658836
一份带命题的热门仓库解读,而这个命题在这一期其他所有东西面前都站得住:开源 agent 正在越过 prompt 包装层,走向持久运行时、结构化上下文和完整工作流。Prime Agent 排第一,单日 +2362 星,自我改进和长时间运行的编码任务在这里收敛成「被设计成持久系统的 agent」。Semantica 从 35 名跳到 7 名,+906 星,图原生的上下文和可追责性正在压过松散连接的检索。ComfyUI 从 29 名到 8 名,+871 星,基于节点的编排仍然是可观测、可复用的生产工作流的一个强力界面。earendil-works/pi 从 28 名到 17 名,+590 星,它统一的模型 API、agent 循环、TUI 和编码 CLI 反映的是对完整、模型可换的工具链的需求。他最后的判读是:问题已经不再是模型能不能完成一个任务,而是围绕它的那个系统能不能可重复、可靠、可追责地完成。
#62
@CoreWeave
https://x.com/CoreWeave/status/2086928815872242034
一段厂商推销,但里面那个论点本身值得认真对待。当所有人都在同样的前沿模型上跑同样的 agent 循环时,所有人都会收敛到同一个天花板。他们的提议是:先在 agent 层面把循环闭合,然后再把权重也一起微调。不管你买不买他们的产品,这个前提正是这一整期反复绕回来的东西:共享 harness 加共享模型等于共享天花板,而这一期里每一个有差异化的结果,都来自改动循环而不是改动模型。
https://x.com/CoreWeave/status/2086928815872242034
一段厂商推销,但里面那个论点本身值得认真对待。当所有人都在同样的前沿模型上跑同样的 agent 循环时,所有人都会收敛到同一个天花板。他们的提议是:先在 agent 层面把循环闭合,然后再把权重也一起微调。不管你买不买他们的产品,这个前提正是这一整期反复绕回来的东西:共享 harness 加共享模型等于共享天花板,而这一期里每一个有差异化的结果,都来自改动循环而不是改动模型。
#63
@GuideboardLabs
https://x.com/GuideboardLabs/status/2086955371105599539
一条带视觉的 agentic 剪辑循环,而正是视觉这一环让它成为循环。他第一次给 Hermes Agent 多于一条 Seedance 2.5 的片段,让它用 CLI 工具和内建的 agent 视觉自己控制剪辑和拼接:四条 14 秒的片段,被切开并按它认为最连贯的方式排列来讲这个故事。他的结论是通用的那一条——带着视觉和目标的自我改进、自我演化的 agent,是比大多数人给的评价更大的乘数,而任何人如果不只是「用 agent 建东西」而是「去建 agent 自身」都还没在做,就是在错过。
https://x.com/GuideboardLabs/status/2086955371105599539
一条带视觉的 agentic 剪辑循环,而正是视觉这一环让它成为循环。他第一次给 Hermes Agent 多于一条 Seedance 2.5 的片段,让它用 CLI 工具和内建的 agent 视觉自己控制剪辑和拼接:四条 14 秒的片段,被切开并按它认为最连贯的方式排列来讲这个故事。他的结论是通用的那一条——带着视觉和目标的自我改进、自我演化的 agent,是比大多数人给的评价更大的乘数,而任何人如果不只是「用 agent 建东西」而是「去建 agent 自身」都还没在做,就是在错过。
#64
@TomasMann1878
https://x.com/TomasMann1878/status/2086865625201201419
很短,而重点在最后三个词。他在放出自己那篇自我改进 agent 文章的一部分,所有东西都是在线实测而不是口头描述——他管这叫「家用 RSI」。「递归自我改进」作为一个周末项目、带一个公开的评测端点,这是一句非常 2026 的话,而它处在同一根轴的低预算那一端——Discovery Loop 刚刚为了这根轴的另一端立了一家公司。
https://x.com/TomasMann1878/status/2086865625201201419
很短,而重点在最后三个词。他在放出自己那篇自我改进 agent 文章的一部分,所有东西都是在线实测而不是口头描述——他管这叫「家用 RSI」。「递归自我改进」作为一个周末项目、带一个公开的评测端点,这是一句非常 2026 的话,而它处在同一根轴的低预算那一端——Discovery Loop 刚刚为了这根轴的另一端立了一家公司。
#65
@divssvash
https://x.com/divssvash/status/2086903699100885311
从零做一个,而他的进度清单本身就是一份不错的最小规格。到他这个检查点为止,他有了一个能跑的 agent 循环、一个运行时环境、一套工具、一个用于抽取的解析器,以及一个验证器,用来不让它碰到他的笔记本。最后那一项是有经验的人会指出「这才是重要的」的那一项,而他没人教就自己加上了。他的评价是:从零建其实挺酷的,也更好玩。
https://x.com/divssvash/status/2086903699100885311
从零做一个,而他的进度清单本身就是一份不错的最小规格。到他这个检查点为止,他有了一个能跑的 agent 循环、一个运行时环境、一套工具、一个用于抽取的解析器,以及一个验证器,用来不让它碰到他的笔记本。最后那一项是有经验的人会指出「这才是重要的」的那一项,而他没人教就自己加上了。他的评价是:从零建其实挺酷的,也更好玩。
#66
@Swarna_Shikhar
https://x.com/Swarna_Shikhar/status/2086694241456234999
最小可行版本,而「它跑在本地」正是有意思的地方。他知道 AI agent 的理论但从没做过一个,出于好奇就做了一个。它在本地跑:通过 Ollama 跑的 Qwen2.5 7B 自己决定什么时候去做网页搜索、读页面、回复——一个典型的 agent 循环。把它和这一期里那份企业九层全景、以及一千个 agent 的治理问题对照读:同一个循环既装得进一家银行的架构图,也装得进一个下午的好奇心。
https://x.com/Swarna_Shikhar/status/2086694241456234999
最小可行版本,而「它跑在本地」正是有意思的地方。他知道 AI agent 的理论但从没做过一个,出于好奇就做了一个。它在本地跑:通过 Ollama 跑的 Qwen2.5 7B 自己决定什么时候去做网页搜索、读页面、回复——一个典型的 agent 循环。把它和这一期里那份企业九层全景、以及一千个 agent 的治理问题对照读:同一个循环既装得进一家银行的架构图,也装得进一个下午的好奇心。
#67
@AiApprenticeLab
https://x.com/AiApprenticeLab/status/2086952096977367491
一份新手笔记,把这个循环的核心权衡说得比大多数专家评论更清楚。一个 agent 可以决定、行动、观察、调整、重复,而正是这一点让它能解决多步问题。但每多一轮循环,也就多了一次误解上下文、做出错误假设、或者慢慢从原始目标上漂开的机会。他的笔记覆盖了 agent 循环实际怎么运作、agent 为什么会漂移、怎么把它拴住,以及给长任务写 prompt 的更好方式。「提供能力的那个机制,同时也提供失效模式」——这是描述这件事的诚实方式,而这句话在这个领域的大多数宣传材料里都是缺席的。
https://x.com/AiApprenticeLab/status/2086952096977367491
一份新手笔记,把这个循环的核心权衡说得比大多数专家评论更清楚。一个 agent 可以决定、行动、观察、调整、重复,而正是这一点让它能解决多步问题。但每多一轮循环,也就多了一次误解上下文、做出错误假设、或者慢慢从原始目标上漂开的机会。他的笔记覆盖了 agent 循环实际怎么运作、agent 为什么会漂移、怎么把它拴住,以及给长任务写 prompt 的更好方式。「提供能力的那个机制,同时也提供失效模式」——这是描述这件事的诚实方式,而这句话在这个领域的大多数宣传材料里都是缺席的。
#68
@VukRosic99
https://x.com/VukRosic99/status/2086687109214240919
一段关于「怎么给那个更有野心的版本找钱」的诚实自言自语,而这个排序比乍听起来更聪明。他在考虑围绕 autoresearch 做一家公司或一个产品,但方向是应用在企业已经在用的算法和流程上——一套自动爬山、自动优化的系统,对准那些公司愿意付钱的、有经济价值的流程。然后用那笔钱去做他原本想做的科学自动发现。鉴于这一期里已经有「生产软件快 9 倍」和「测试套件快 300 倍」,这个计划里商业那一半已经被证明过了。
https://x.com/VukRosic99/status/2086687109214240919
一段关于「怎么给那个更有野心的版本找钱」的诚实自言自语,而这个排序比乍听起来更聪明。他在考虑围绕 autoresearch 做一家公司或一个产品,但方向是应用在企业已经在用的算法和流程上——一套自动爬山、自动优化的系统,对准那些公司愿意付钱的、有经济价值的流程。然后用那笔钱去做他原本想做的科学自动发现。鉴于这一期里已经有「生产软件快 9 倍」和「测试套件快 300 倍」,这个计划里商业那一半已经被证明过了。
#69
@Yogin16
https://x.com/Yogin16/status/2086713134707073097
一句话的想法,值得有人真去试:如果他有无限 token,他会把 Karpathy 那种 autoresearch 设置对准文档和 Excel,看看 docx 或 xlsx 有没有更好的版本存在。这一期里的所有东西都把 autoresearch 指向代码、kernel、模型架构和材料,而这些都有显而易见的 verifier。文档和电子表格格式积累了几十年的设计决策,而且不寻常地拥有一个可测的目标——往返保真度和解析速度——这让「居然没人试过」成了有意思的部分。
https://x.com/Yogin16/status/2086713134707073097
一句话的想法,值得有人真去试:如果他有无限 token,他会把 Karpathy 那种 autoresearch 设置对准文档和 Excel,看看 docx 或 xlsx 有没有更好的版本存在。这一期里的所有东西都把 autoresearch 指向代码、kernel、模型架构和材料,而这些都有显而易见的 verifier。文档和电子表格格式积累了几十年的设计决策,而且不寻常地拥有一个可测的目标——往返保真度和解析速度——这让「居然没人试过」成了有意思的部分。
#70
@JackieLeeETH
https://x.com/JackieLeeETH/status/2086829280886198601
给竞赛这个形式做的基础设施,之所以要做是因为现在数量已经多到需要被追踪了。他做了个站点,把好几个 auto-research 竞赛放在一处,全局排名基于最佳成绩名次,并按该场竞赛的解题人数加权。加权这个细节很重要,因为一场只有四个参赛者的比赛里的第一名,和一场四百人比赛里的第一名不是一回事。他顺口那句是这个形式在起作用的好迹象:同样那些 GitHub 用户名他看到的次数多到,他们成了他的「竞赛朋友」。
https://x.com/JackieLeeETH/status/2086829280886198601
给竞赛这个形式做的基础设施,之所以要做是因为现在数量已经多到需要被追踪了。他做了个站点,把好几个 auto-research 竞赛放在一处,全局排名基于最佳成绩名次,并按该场竞赛的解题人数加权。加权这个细节很重要,因为一场只有四个参赛者的比赛里的第一名,和一场四百人比赛里的第一名不是一回事。他顺口那句是这个形式在起作用的好迹象:同样那些 GitHub 用户名他看到的次数多到,他们成了他的「竞赛朋友」。
#71
@varun_mathur
https://x.com/varun_mathur/status/2086650855185346986
一个关于分布式实验的规模数字,很难归到别处去。他们几个月前发布了 gossiping agents 协议,此后协议上的 agent 已经完成了超过一百万次公开微实验,并在一个完全点对点的网络上互相传播。不管一百万次微实验的质量分布长什么样,值得注意的是架构——这一期里那些基于榜单的竞赛仍然要经过一个中心 verifier,而这个不用。
https://x.com/varun_mathur/status/2086650855185346986
一个关于分布式实验的规模数字,很难归到别处去。他们几个月前发布了 gossiping agents 协议,此后协议上的 agent 已经完成了超过一百万次公开微实验,并在一个完全点对点的网络上互相传播。不管一百万次微实验的质量分布长什么样,值得注意的是架构——这一期里那些基于榜单的竞赛仍然要经过一个中心 verifier,而这个不用。
#72
@mdancho84
https://x.com/mdancho84/status/2086837008647733369
一个针对「从业者该站在这条线的哪一侧」的框架。第一条道路是使用 AI 工具;第二条道路是构建替代工作流的 AI 系统。AutoResearch 不是「又一个很酷的仓库」,它是一个信号。很短,也稍微有点自我升华,但这个区分恰恰是这一期其余部分的目录——里面几乎没人是在用工具,而几乎每个人都在建循环。
https://x.com/mdancho84/status/2086837008647733369
一个针对「从业者该站在这条线的哪一侧」的框架。第一条道路是使用 AI 工具;第二条道路是构建替代工作流的 AI 系统。AutoResearch 不是「又一个很酷的仓库」,它是一个信号。很短,也稍微有点自我升华,但这个区分恰恰是这一期其余部分的目录——里面几乎没人是在用工具,而几乎每个人都在建循环。
📡 生态产品雷达
生态产品雷达
AutoResearch(Karpathy 的那套) —— 这一期里几乎每一个实验都在延伸它或者以它为基准。
Pi —— 那个极简 harness,在成本对比、cron 替代工作流、从零教程和 GitHub 热榜里同时出现。
Codex —— 大家围绕它建东西、从它那里移植功能、也抱怨它缺定时任务的那个 harness。
Claude Code —— 大多数自主运行是在它里面被测量的,也是那个每小时烧钱速率被反复引用的。
Verifier —— 不是一个产品,但这一期里每一个框架、每一个公式、每一份失败报告最后都收敛到这个组件上。
eigenlabs 竞赛 —— 那个基于榜单的 autoresearch 形式,现在开始产出可能进生产的产物。
Discovery Loop —— Jeff Dean 新开的 autoresearch 创业公司,Alphabet 是创始投资人。
MCP —— 多模态插件、解析器、浏览器验证以及「server 装太多」警告共同的连接层。
Hermes Agent —— 那个辅助模型槽位原来是个安静的成本中心的 harness,同时也被用来做 agentic 视频剪辑。
Ollama —— 这些循环里本地那一半实际靠它跑,从 7B 的实验到 30B 的 agent 模型。
Muse Glimmer —— Meta 的 30B 本地 agent 模型,在这里值得记的是它的 demo 走完了一个完整的本地 agent 循环。
Prime Agent —— GitHub 热榜第一,单日 +2362 星,自我改进加长时间运行任务。
LangGraph 与 LangChain —— 这一期里形状最像生产环境的那个 build-in-public agent 底下的运行时。
AutoResearch(Karpathy 的那套) —— 这一期里几乎每一个实验都在延伸它或者以它为基准。
Pi —— 那个极简 harness,在成本对比、cron 替代工作流、从零教程和 GitHub 热榜里同时出现。
Codex —— 大家围绕它建东西、从它那里移植功能、也抱怨它缺定时任务的那个 harness。
Claude Code —— 大多数自主运行是在它里面被测量的,也是那个每小时烧钱速率被反复引用的。
Verifier —— 不是一个产品,但这一期里每一个框架、每一个公式、每一份失败报告最后都收敛到这个组件上。
eigenlabs 竞赛 —— 那个基于榜单的 autoresearch 形式,现在开始产出可能进生产的产物。
Discovery Loop —— Jeff Dean 新开的 autoresearch 创业公司,Alphabet 是创始投资人。
MCP —— 多模态插件、解析器、浏览器验证以及「server 装太多」警告共同的连接层。
Hermes Agent —— 那个辅助模型槽位原来是个安静的成本中心的 harness,同时也被用来做 agentic 视频剪辑。
Ollama —— 这些循环里本地那一半实际靠它跑,从 7B 的实验到 30B 的 agent 模型。
Muse Glimmer —— Meta 的 30B 本地 agent 模型,在这里值得记的是它的 demo 走完了一个完整的本地 agent 循环。
Prime Agent —— GitHub 热榜第一,单日 +2362 星,自我改进加长时间运行任务。
LangGraph 与 LangChain —— 这一期里形状最像生产环境的那个 build-in-public agent 底下的运行时。
评论