Loop 日报: 2026年7月28日
autoresearch 今天不再是一句口号,而是变成了管道工程。主角是 AREX,一个中国团队做的深度研究 agent,它 4B 的版本据称靠「循环」打赢了体量大得多的基线——研究、逐条审计每个论断、留下已验证的、记住失败的、再来一遍。这是迄今为止最清楚的一幅画面:真正意义上第一版递归自我改进,改进的是「造下一个模型的那套流程」,而不是权重本身。在这条主线底下,讨论变得异常务实:给失败步骤设死重试上限,而不是让模型自己决定何时放弃;在有人三小时烧掉三万八千美元之后开始给每个 key 设支出上限;循环之间的记忆比循环速度更重要;还有实打实的数据显示,把扩展思考关掉反而抬高了通过率。最让人意外的一条是硬件已经缩到多小——一个不到 4GB、约等于一比特的模型,在一块二手 8GB 显卡上自己跑完整的构建、测试、修复循环。而应用还在不断离开代码编辑器:光子器件设计、CFD、结构分析、量化策略,甚至有人用一个 autoresearch 循环把一个都市圈的社交信息流清洗干净。
#1
@sudoingX
https://x.com/sudoingX/status/2081453712149721457
作者把市面上几款自主智能体框架都亲手跑了一遍,结论是 Hermes Agent 目前最强。最有说服力的证据是:Hermes 能干净利落地驱动一个很小的本地模型跑完整个 agentic loop,而像 OpenClaw 这样更重的框架连本地端点都找不到,直接卡在门口挂掉。这不是吹捧,而是围绕小型本地模型上 loop 可靠性做的第一手对比。
https://x.com/sudoingX/status/2081453712149721457
作者把市面上几款自主智能体框架都亲手跑了一遍,结论是 Hermes Agent 目前最强。最有说服力的证据是:Hermes 能干净利落地驱动一个很小的本地模型跑完整个 agentic loop,而像 OpenClaw 这样更重的框架连本地端点都找不到,直接卡在门口挂掉。这不是吹捧,而是围绕小型本地模型上 loop 可靠性做的第一手对比。
#2
@imjustnewatai
https://x.com/imjustnewatai/status/2081254855167922347
这是对 AREX 的深度拆解,一个来自中国、能递归自我改进的深度研究智能体,据称其 4B 版本在六个基准里有五个都打赢了 Qwen3.5-35B。它不是一次性给答案,而是先做研究、再逐条审计每个论断、保留验证过的结论、记住走过的死路,并把每个薄弱论点变成新的定向研究任务,整个过程最多能循环 300 个动作、跑五轮外层自我改进,同时还会压缩自己的上下文。消融实验显示,自主更新上下文(+11.8)和外层递归审计(+11.1)是提升的主因。
https://x.com/imjustnewatai/status/2081254855167922347
这是对 AREX 的深度拆解,一个来自中国、能递归自我改进的深度研究智能体,据称其 4B 版本在六个基准里有五个都打赢了 Qwen3.5-35B。它不是一次性给答案,而是先做研究、再逐条审计每个论断、保留验证过的结论、记住走过的死路,并把每个薄弱论点变成新的定向研究任务,整个过程最多能循环 300 个动作、跑五轮外层自我改进,同时还会压缩自己的上下文。消融实验显示,自主更新上下文(+11.8)和外层递归审计(+11.1)是提升的主因。
#3
@sudoingX
https://x.com/sudoingX/status/2081420006244655259
作者把一个仅 3.9GB、约 1-bit 的模型 Bonsai 交给 Hermes agent 驱动,只给一份规格说明,让它在 RTX 3060 Ti 8GB 上自主搭出一个能跑的转子(汪克尔)发动机仿真。这个 agent 自己写代码、自己跑了十项几何测试、遇到失败就读报错、再改自己写的那几行,反复崩溃又自我修复了三次,最终发动机转起来、十项测试全绿,全程可观测。作者强调这是一个小型本地模型产出的、可证明正确的仿真,而不是一张示意图。
https://x.com/sudoingX/status/2081420006244655259
作者把一个仅 3.9GB、约 1-bit 的模型 Bonsai 交给 Hermes agent 驱动,只给一份规格说明,让它在 RTX 3060 Ti 8GB 上自主搭出一个能跑的转子(汪克尔)发动机仿真。这个 agent 自己写代码、自己跑了十项几何测试、遇到失败就读报错、再改自己写的那几行,反复崩溃又自我修复了三次,最终发动机转起来、十项测试全绿,全程可观测。作者强调这是一个小型本地模型产出的、可证明正确的仿真,而不是一张示意图。
#4
@imjustnewatai
https://x.com/imjustnewatai/status/2081206432905429421
这篇很接地气的文章认为,第一个真正的递归自我改进不会多么光鲜:它会是一个能改进「造下一代系统的过程」的系统,比如训练代码、kernel、评测、数据管线、agent 脚手架,然后再让这套系统自动化更多同类研发。文中举了已经跑通的具体案例:Darwin Godel machine 在 SWE-bench 上从 20% 涨到 50%,一个能自我改写的编码 agent 从 17% 涨到 53%,但也点明这些改的都是冻结模型外面的脚手架,而非权重本身。真正的临界点在于:每一次改进能否把下一次加速到快过算力、数据和安全瓶颈的复利速度。
https://x.com/imjustnewatai/status/2081206432905429421
这篇很接地气的文章认为,第一个真正的递归自我改进不会多么光鲜:它会是一个能改进「造下一代系统的过程」的系统,比如训练代码、kernel、评测、数据管线、agent 脚手架,然后再让这套系统自动化更多同类研发。文中举了已经跑通的具体案例:Darwin Godel machine 在 SWE-bench 上从 20% 涨到 50%,一个能自我改写的编码 agent 从 17% 涨到 53%,但也点明这些改的都是冻结模型外面的脚手架,而非权重本身。真正的临界点在于:每一次改进能否把下一次加速到快过算力、数据和安全瓶颈的复利速度。
#5
@DreggNet
https://x.com/DreggNet/status/2081288406940737553
作者说他们把自研的「Dragon's Egg」自动研究系统放到 AWS 上跑,目标是找出最快的代码实现,硬性条件是:没有相对旧实现和规格证明正确之前,任务不算完成。因为系统还会对编译器本身做推理,AI 想绕过编译器时可以直接绕过去。这是一个用 autoresearch 驱动、经过验证的底层性能优化的具体案例,而不是漫无边际的生成。
https://x.com/DreggNet/status/2081288406940737553
作者说他们把自研的「Dragon's Egg」自动研究系统放到 AWS 上跑,目标是找出最快的代码实现,硬性条件是:没有相对旧实现和规格证明正确之前,任务不算完成。因为系统还会对编译器本身做推理,AI 想绕过编译器时可以直接绕过去。这是一个用 autoresearch 驱动、经过验证的底层性能优化的具体案例,而不是漫无边际的生成。
#6
@ottogin1
https://x.com/ottogin1/status/2081463918090973470
作者在两个真实的 autoresearch 任务上测了 Opus 5,结果出人意料:在 LLM 训练类任务上它打赢了 Fable 5,在 CUDA kernel 优化上也只略微落后 Fable 5。这是一次把前沿模型放进 autoresearch loop、在真正硬核的系统问题上做的正面对比测评。
https://x.com/ottogin1/status/2081463918090973470
作者在两个真实的 autoresearch 任务上测了 Opus 5,结果出人意料:在 LLM 训练类任务上它打赢了 Fable 5,在 CUDA kernel 优化上也只略微落后 Fable 5。这是一次把前沿模型放进 autoresearch loop、在真正硬核的系统问题上做的正面对比测评。
#7
@ThePremiseOfIt
https://x.com/ThePremiseOfIt/status/2081437504184459363
这是一条第一手的可靠性观察:gpt-5.6-sol 在 autoresearch loop 里跑时,会持续且严重地把作者的整条训练管线搞退步,而换用另一个模型时从没出过这种问题。作者由此得出结论:对于一个你放手让它在代码库上无人值守跑 loop 的模型,真正重要的是对齐和一致性,而不是纸面上的基准分数。
https://x.com/ThePremiseOfIt/status/2081437504184459363
这是一条第一手的可靠性观察:gpt-5.6-sol 在 autoresearch loop 里跑时,会持续且严重地把作者的整条训练管线搞退步,而换用另一个模型时从没出过这种问题。作者由此得出结论:对于一个你放手让它在代码库上无人值守跑 loop 的模型,真正重要的是对齐和一致性,而不是纸面上的基准分数。
#8
@jackcai1206
https://x.com/jackcai1206/status/2081252992695570674
作者密集用过很多 auto-research agent 之后发现一个难题:没有人在环里的话,很难让它们朝着简洁、优雅的方案去优化。相反,这些 agent 总是靠不断堆复杂度来稳稳压出收益,而且它们能容忍的复杂度高得惊人。这是对无监督 autoresearch 失效模式的一针见血的观察:它会往复杂而非优雅的方向漂。
https://x.com/jackcai1206/status/2081252992695570674
作者密集用过很多 auto-research agent 之后发现一个难题:没有人在环里的话,很难让它们朝着简洁、优雅的方案去优化。相反,这些 agent 总是靠不断堆复杂度来稳稳压出收益,而且它们能容忍的复杂度高得惊人。这是对无监督 autoresearch 失效模式的一针见血的观察:它会往复杂而非优雅的方向漂。
#9
@christophcsmith
https://x.com/christophcsmith/status/2081198410158268503
作者之前给自己所在的都市区做过一个自定义 Bluesky feed,靠正则匹配城市名,结果误报一大堆。他对这个 feed 跑了一轮 auto-research loop,效果改善了很多。这是一个非前沿、很日常的例子:用 autoresearch loop 反复打磨一个内容过滤 feed。
https://x.com/christophcsmith/status/2081198410158268503
作者之前给自己所在的都市区做过一个自定义 Bluesky feed,靠正则匹配城市名,结果误报一大堆。他对这个 feed 跑了一轮 auto-research loop,效果改善了很多。这是一个非前沿、很日常的例子:用 autoresearch loop 反复打磨一个内容过滤 feed。
#10
@luoyu_toc
https://x.com/luoyu_toc/status/2081256558252662822
一位 EMNLP 应急审稿人花了五小时读一篇论文后感慨:它的 motivation 像是在造火箭,方法却像在拧一颗螺丝。他观察到,Auto Research 正让「编出听起来很激动人心的 motivation」变得越来越容易,但把它落成一个有说服力的方法、拿出扎实证据,仍是研究里最难、最难被自动化的环节之一。这是对 autoresearch 当下「帮得上哪、帮不上哪」的犀利点评。
https://x.com/luoyu_toc/status/2081256558252662822
一位 EMNLP 应急审稿人花了五小时读一篇论文后感慨:它的 motivation 像是在造火箭,方法却像在拧一颗螺丝。他观察到,Auto Research 正让「编出听起来很激动人心的 motivation」变得越来越容易,但把它落成一个有说服力的方法、拿出扎实证据,仍是研究里最难、最难被自动化的环节之一。这是对 autoresearch 当下「帮得上哪、帮不上哪」的犀利点评。
#11
@SasuRobert
https://x.com/SasuRobert/status/2081429156147974522
作者说他们拿 flash-lite 来给自己的 agentic 系统做基准测试和 autoresearch,因为它最方便用 batch API 搭建、也最好测试复杂的 loop、graph、评测和 RL 技巧。极快的响应让他们的 autoresearch 能迅速铺开规模。这是一条很具体的工作流心得:挑一个又便宜又快的模型当 autoresearch 迭代的主力。
https://x.com/SasuRobert/status/2081429156147974522
作者说他们拿 flash-lite 来给自己的 agentic 系统做基准测试和 autoresearch,因为它最方便用 batch API 搭建、也最好测试复杂的 loop、graph、评测和 RL 技巧。极快的响应让他们的 autoresearch 能迅速铺开规模。这是一条很具体的工作流心得:挑一个又便宜又快的模型当 autoresearch 迭代的主力。
#12
@FakePsyho
https://x.com/FakePsyho/status/2081519777420300392
一位做基准测试的老手解释了为什么好的 autoresearch 评测几乎不存在:要用像样的样本量去测交互式问题或 autoresearch 能力,成本极高,单次评测就要一万美元以上,没人愿意掏这钱。他还补充说,自己看过的大多数基准要么是灌水,要么只测了某个很窄的能力点。这是对拖住 autoresearch 的「度量鸿沟」的一次具体诊断。
https://x.com/FakePsyho/status/2081519777420300392
一位做基准测试的老手解释了为什么好的 autoresearch 评测几乎不存在:要用像样的样本量去测交互式问题或 autoresearch 能力,成本极高,单次评测就要一万美元以上,没人愿意掏这钱。他还补充说,自己看过的大多数基准要么是灌水,要么只测了某个很窄的能力点。这是对拖住 autoresearch 的「度量鸿沟」的一次具体诊断。
#13
@ariccio
https://x.com/ariccio/status/2081511612226085201
作者说他一直在等有人把前沿模型放进 autoresearch loop 里做 CFD(计算流体力学),本来想自己上,但他的 token 额度已经全排给了类似的工程挑战:桁架/结构分析、双管蒸汽系统建模,还有给他爸做的高尔夫数据分析。这让人瞥见 autoresearch 正被用到真实的物理工程问题上,而不只是写代码。
https://x.com/ariccio/status/2081511612226085201
作者说他一直在等有人把前沿模型放进 autoresearch loop 里做 CFD(计算流体力学),本来想自己上,但他的 token 额度已经全排给了类似的工程挑战:桁架/结构分析、双管蒸汽系统建模,还有给他爸做的高尔夫数据分析。这让人瞥见 autoresearch 正被用到真实的物理工程问题上,而不只是写代码。
#14
@minhash
https://x.com/minhash/status/2081312620783784095
作者主张 autoresearch 可能是 AI 最重要的产出,尤其是在那些奖励可验证的领域,比如 AI、系统、硬件、工程和医学,但眼下它做得远远不够。他发问:为什么没有更多公司专注于把这件事做得更好?这是一条简洁的市场判断,把 autoresearch 基础设施标为一个被严重低估、少人建设的机会。
https://x.com/minhash/status/2081312620783784095
作者主张 autoresearch 可能是 AI 最重要的产出,尤其是在那些奖励可验证的领域,比如 AI、系统、硬件、工程和医学,但眼下它做得远远不够。他发问:为什么没有更多公司专注于把这件事做得更好?这是一条简洁的市场判断,把 autoresearch 基础设施标为一个被严重低估、少人建设的机会。
#15
@LeeLeepenkman
https://x.com/LeeLeepenkman/status/2081243329065550330
作者说他把自己那个「跑到停不下来」的 agent 指向几乎任何目标,它就会不停改进那个目标直到改不动为止,一路漂到一条 auto-research 式的改进曲线上——基座模型越强它越强,再加上人在环里就更强。他把这与更早的 Ralph-loop 实验联系起来,认为递归自我改进其实早在有这个名字之前,就悄悄从长时间运行的编码 agent 里冒出来了。
https://x.com/LeeLeepenkman/status/2081243329065550330
作者说他把自己那个「跑到停不下来」的 agent 指向几乎任何目标,它就会不停改进那个目标直到改不动为止,一路漂到一条 auto-research 式的改进曲线上——基座模型越强它越强,再加上人在环里就更强。他把这与更早的 Ralph-loop 实验联系起来,认为递归自我改进其实早在有这个名字之前,就悄悄从长时间运行的编码 agent 里冒出来了。
#16
@twerpzz
https://x.com/twerpzz/status/2081407634205241638
作者在公司里基于一套 ecc auto-research 方案搭了一个自我改进的 loop:他每次会话都会被打分,因为一切都持久化在 GitHub 里,他的技能、排障能力和 token 使用效率都在随时间可量化地提升。这是一个很具体的个人例子:把 autoresearch 式的反馈闭环用在改进一个人类操作者自己的工作流上,而不只是改进模型。
https://x.com/twerpzz/status/2081407634205241638
作者在公司里基于一套 ecc auto-research 方案搭了一个自我改进的 loop:他每次会话都会被打分,因为一切都持久化在 GitHub 里,他的技能、排障能力和 token 使用效率都在随时间可量化地提升。这是一个很具体的个人例子:把 autoresearch 式的反馈闭环用在改进一个人类操作者自己的工作流上,而不只是改进模型。
#17
@quantum_jake
https://x.com/quantum_jake/status/2081480883731873852
作者转发了 Flexcompute 的一场演讲,内容是他们如何用 auto research 做光子学设计。这是一个具体线索,表明 autoresearch 正被用到一个专门的硬件设计领域(光子学)里,背后还有一家真实公司在做。
https://x.com/quantum_jake/status/2081480883731873852
作者转发了 Flexcompute 的一场演讲,内容是他们如何用 auto research 做光子学设计。这是一个具体线索,表明 autoresearch 正被用到一个专门的硬件设计领域(光子学)里,背后还有一家真实公司在做。
#18
@trashpandaemoji
https://x.com/trashpandaemoji/status/2081467064662049034
作者提议:与其把同一个东西造好几遍,不如让 agent 在高影响力的决策点上持续分叉,等这条分支学到足够多之后再收拢,把学到的东西吸收回来。他把「用 agent 做自动化」直接类比成「把 auto-research 用到软件构建上」。这是一条关于 agent 构建时「分叉—收拢」式探索的方法论笔记。
https://x.com/trashpandaemoji/status/2081467064662049034
作者提议:与其把同一个东西造好几遍,不如让 agent 在高影响力的决策点上持续分叉,等这条分支学到足够多之后再收拢,把学到的东西吸收回来。他把「用 agent 做自动化」直接类比成「把 auto-research 用到软件构建上」。这是一条关于 agent 构建时「分叉—收拢」式探索的方法论笔记。
#19
@silentguyy66
https://x.com/silentguyy66/status/2081311870862979410
作者呼应了 Karpathy 的观点:agent 里还没有实现真正精巧的记忆,现在所谓的记忆只是窗口塞满时的上下文压缩,所以下一轮迭代等于是从头瞎起步。他认为大家都在优化 loop 的速度,几乎没人去做 loop 之间的持久上下文,而对于复利效应,loop 之间的一层记忆比 loop 速度重要得多。这是对「loop 间记忆」这一瓶颈的清晰阐述。
https://x.com/silentguyy66/status/2081311870862979410
作者呼应了 Karpathy 的观点:agent 里还没有实现真正精巧的记忆,现在所谓的记忆只是窗口塞满时的上下文压缩,所以下一轮迭代等于是从头瞎起步。他认为大家都在优化 loop 的速度,几乎没人去做 loop 之间的持久上下文,而对于复利效应,loop 之间的一层记忆比 loop 速度重要得多。这是对「loop 间记忆」这一瓶颈的清晰阐述。
#20
@VibeCoderOfek
https://x.com/VibeCoderOfek/status/2081259867159810222
作者主张,能自我改进的 harness 才是当下真正的系统难题,因为大多数 agent 工作仍把 loop 当成黑盒,而不是当成一个能在硬约束下改写自身脚手架的东西。这是一个精炼的论点:agent 工程的前沿,是一个能编辑自己 harness 的 loop。
https://x.com/VibeCoderOfek/status/2081259867159810222
作者主张,能自我改进的 harness 才是当下真正的系统难题,因为大多数 agent 工作仍把 loop 当成黑盒,而不是当成一个能在硬约束下改写自身脚手架的东西。这是一个精炼的论点:agent 工程的前沿,是一个能编辑自己 harness 的 loop。
#21
@VontariusF
https://x.com/VontariusF/status/2081251903594188805
作者宣布开源了一个 CLI,它能接入任意 agent 系统,基于你公司的情况自动完成政府合同发现、拨款寻源和申请书撰写,全程自动驾驶。它是本地优先的、准确的,配合 Hermes 使用时还能自我改进。这是一个面向具体非编码业务流程的、能自我改进的 agent 工具。
https://x.com/VontariusF/status/2081251903594188805
作者宣布开源了一个 CLI,它能接入任意 agent 系统,基于你公司的情况自动完成政府合同发现、拨款寻源和申请书撰写,全程自动驾驶。它是本地优先的、准确的,配合 Hermes 使用时还能自我改进。这是一个面向具体非编码业务流程的、能自我改进的 agent 工具。
#22
@DrElectronX
https://x.com/DrElectronX/status/2081353018436641213
作者勾勒了一个「/jarvis 模式」的 agent:它会配好 git、策略、SOP、组织结构,还有一套分层可搜索的记忆系统,装上最佳实践,并按优先级自我改进代码库和 issue,除非真有必要绝不打扰用户,只用提问和建议来引导他。这是一份关于「自主、自我改进的操作型 agent」的具体设想。
https://x.com/DrElectronX/status/2081353018436641213
作者勾勒了一个「/jarvis 模式」的 agent:它会配好 git、策略、SOP、组织结构,还有一套分层可搜索的记忆系统,装上最佳实践,并按优先级自我改进代码库和 issue,除非真有必要绝不打扰用户,只用提问和建议来引导他。这是一份关于「自主、自我改进的操作型 agent」的具体设想。
#23
@echantech1
https://x.com/echantech1/status/2081299231848169830
作者分享了搭 agentic loop 的诚实心得:光是来回写 loop 的 markdown 和脚本来调它就花了约 20 分钟,定义好成功/失败/验收标准非常关键,而且每个 loop 应该只瞄准一个瓶颈。他坦白承认,用 loop 去攻瓶颈往往其实是偷懒,造出一门「slop cannon」来识别并证明根因。这是对一个真正的 loop 需要多少前期投入的务实记录。
https://x.com/echantech1/status/2081299231848169830
作者分享了搭 agentic loop 的诚实心得:光是来回写 loop 的 markdown 和脚本来调它就花了约 20 分钟,定义好成功/失败/验收标准非常关键,而且每个 loop 应该只瞄准一个瓶颈。他坦白承认,用 loop 去攻瓶颈往往其实是偷懒,造出一门「slop cannon」来识别并证明根因。这是对一个真正的 loop 需要多少前期投入的务实记录。
#24
@RonnyBruknapp
https://x.com/RonnyBruknapp/status/2081399978598056241
作者解释道,同一个模型在 Claude Code 和 Cursor 里表现不同,问题出在 harness 而非模型:Claude Code 给它更多仓库内容和一个真正的 agentic loop,而 Cursor 把你框在紧凑的行内编辑里。他认为所谓「X 打赢 Y」通常只是说你更偏好那种工作流,并不代表模型变强了。这是对「harness 才是变量」的清晰表达。
https://x.com/RonnyBruknapp/status/2081399978598056241
作者解释道,同一个模型在 Claude Code 和 Cursor 里表现不同,问题出在 harness 而非模型:Claude Code 给它更多仓库内容和一个真正的 agentic loop,而 Cursor 把你框在紧凑的行内编辑里。他认为所谓「X 打赢 Y」通常只是说你更偏好那种工作流,并不代表模型变强了。这是对「harness 才是变量」的清晰表达。
#25
@faisalusuf
https://x.com/faisalusuf/status/2081172350272463224
这是一条第一手的警示:正是那种毫无管控的黑盒 agentic loop,才导致某些机构收到 Anthropic 开出的数百万美元的意外账单。作者建议,把工作交给一个不受控的 loop 时要格外谨慎,做好随时被吓一跳的准备。这是对无界自主 loop 成本风险的一记具体告诫。
https://x.com/faisalusuf/status/2081172350272463224
这是一条第一手的警示:正是那种毫无管控的黑盒 agentic loop,才导致某些机构收到 Anthropic 开出的数百万美元的意外账单。作者建议,把工作交给一个不受控的 loop 时要格外谨慎,做好随时被吓一跳的准备。这是对无界自主 loop 成本风险的一记具体告诫。
#26
@MoezZhioua
https://x.com/MoezZhioua/status/2081407045677298049
作者说他只用 792 行代码、四个工具就搭出了一个完整的 agent loop,理由是跳过 MCP 能省下几万个 token,把上下文预算收紧。核心心得是:让 harness 尽量精简,把 token 预算用在刀刃上,而不是加载一堆模型很少用到的臃肿工具 schema。
https://x.com/MoezZhioua/status/2081407045677298049
作者说他只用 792 行代码、四个工具就搭出了一个完整的 agent loop,理由是跳过 MCP 能省下几万个 token,把上下文预算收紧。核心心得是:让 harness 尽量精简,把 token 预算用在刀刃上,而不是加载一堆模型很少用到的臃肿工具 schema。
#27
@denogrowth
https://x.com/denogrowth/status/2081359395347128440
作者讲了一个案例:因为没设置每把 key 的花费上限,一名员工三小时内就烧掉了 38,000 美元的 AI 费用。他警告说,一个 agent loop 在一下午就能花光整个团队一个月的预算,而且这笔成本要等账单到手才浮出水面。他敦促开发者在把线上 key 发出去之前,先设好硬性上限、告警和每 key 限额。
https://x.com/denogrowth/status/2081359395347128440
作者讲了一个案例:因为没设置每把 key 的花费上限,一名员工三小时内就烧掉了 38,000 美元的 AI 费用。他警告说,一个 agent loop 在一下午就能花光整个团队一个月的预算,而且这笔成本要等账单到手才浮出水面。他敦促开发者在把线上 key 发出去之前,先设好硬性上限、告警和每 key 限额。
#28
@ja818_
https://x.com/ja818_/status/2081354345707348226
作者介绍了他们搭的 agent 系统 Houston:它删掉了随包捆绑的 CLI provider 二进制文件(现在改在进程内跑 provider),并彻底移除了 MCP 客户端,只留一个进程内 MCP server 把五个工具桥接到后端。他们认为真正的分野不是 CLI 还是 MCP,而是模型在上下文里看到什么、以及凭据握在谁手里;他们用 integration_search 和 integration_execute 这两个工具就暴露出 1000 多个集成,而不是塞给模型成千上万个 schema。
https://x.com/ja818_/status/2081354345707348226
作者介绍了他们搭的 agent 系统 Houston:它删掉了随包捆绑的 CLI provider 二进制文件(现在改在进程内跑 provider),并彻底移除了 MCP 客户端,只留一个进程内 MCP server 把五个工具桥接到后端。他们认为真正的分野不是 CLI 还是 MCP,而是模型在上下文里看到什么、以及凭据握在谁手里;他们用 integration_search 和 integration_execute 这两个工具就暴露出 1000 多个集成,而不是塞给模型成千上万个 schema。
#29
@stretchcloud
https://x.com/stretchcloud/status/2081512135167988068
作者总结了一份微软对数万名工程师的遥测研究:Copilot CLI 用户合并的 PR 多出 24.9%(连续用满五天以上的人多出 50.1%),相对同一人群里的 Claude Code 用户有 2.2 倍的提升。他认为在 PR 产出这件事上,Copilot 更紧密的 GitHub/PR 工作流集成胜过了 Claude Code 更宽泛的 agent loop,瓶颈在于工作流集成而非模型能力。
https://x.com/stretchcloud/status/2081512135167988068
作者总结了一份微软对数万名工程师的遥测研究:Copilot CLI 用户合并的 PR 多出 24.9%(连续用满五天以上的人多出 50.1%),相对同一人群里的 Claude Code 用户有 2.2 倍的提升。他认为在 PR 产出这件事上,Copilot 更紧密的 GitHub/PR 工作流集成胜过了 Claude Code 更宽泛的 agent loop,瓶颈在于工作流集成而非模型能力。
#30
@DogukanUrker
https://x.com/DogukanUrker/status/2081278089212948612
作者诊断出一个现象:agent loop 跑到一半丢了工具定义、开始乱调工具,很可能是 Ollama 默认的 num_ctx 把上下文截断到了 4096 token,而不是模型本身出了问题。他建议把 num_ctx 调大后重试,或者干脆直接走 llama.cpp——他自己就是这么跑的。这是对一个常见本地 agent loop 崩溃的具体、可操作的修复办法。
https://x.com/DogukanUrker/status/2081278089212948612
作者诊断出一个现象:agent loop 跑到一半丢了工具定义、开始乱调工具,很可能是 Ollama 默认的 num_ctx 把上下文截断到了 4096 token,而不是模型本身出了问题。他建议把 num_ctx 调大后重试,或者干脆直接走 llama.cpp——他自己就是这么跑的。这是对一个常见本地 agent loop 崩溃的具体、可操作的修复办法。
#31
@MichaelGannotti
https://x.com/MichaelGannotti/status/2081449488041062604
作者根据一份「offlabel 指南」发现,在留出的验证任务上开启 extended thinking 是净负面的:它会在干净代码里凭空造出 bug、对已授权的工作过度拒绝,还有一次让 agent loop 在第 11 轮卡了 91 分钟。他给出具体通过率:关掉 thinking 是 94.2%,开启后只有 91.3%。这是一条有数据支撑的论据,反对在 loop 里条件反射式地把推理强度拉满。
https://x.com/MichaelGannotti/status/2081449488041062604
作者根据一份「offlabel 指南」发现,在留出的验证任务上开启 extended thinking 是净负面的:它会在干净代码里凭空造出 bug、对已授权的工作过度拒绝,还有一次让 agent loop 在第 11 轮卡了 91 分钟。他给出具体通过率:关掉 thinking 是 94.2%,开启后只有 91.3%。这是一条有数据支撑的论据,反对在 loop 里条件反射式地把推理强度拉满。
#32
@anton_bt
https://x.com/anton_bt/status/2081390359205040628
作者干净地区分了三种常被混为一谈的架构:harness(工具、权限、记忆、预算、重试构成的受控环境)、loop(PLAN→ACT→VERIFY→REPAIR,由来自真实验证器的结构化反馈驱动)、以及 graph(带路由和审计轨迹的分支工作流)。他强调 loop 的价值在于结构化反馈而非盲目重试,并给出建议顺序:先建 harness,有了验证器之后再加 loop,只有当工作流真的需要分支时才加 graph。
https://x.com/anton_bt/status/2081390359205040628
作者干净地区分了三种常被混为一谈的架构:harness(工具、权限、记忆、预算、重试构成的受控环境)、loop(PLAN→ACT→VERIFY→REPAIR,由来自真实验证器的结构化反馈驱动)、以及 graph(带路由和审计轨迹的分支工作流)。他强调 loop 的价值在于结构化反馈而非盲目重试,并给出建议顺序:先建 harness,有了验证器之后再加 loop,只有当工作流真的需要分支时才加 graph。
#33
@ZayahNelson0
https://x.com/ZayahNelson0/status/2081190505145331860
作者描述了一个每天跑的 agent loop,用来投递求职申请外加发冷邮件,它会操作一个真实浏览器,并在横跨 14 家 provider 的 43 把免费额度 API key 之间轮换调度,每月成本 0 美元。这是一个完全自主的个人 loop 的具体例子,它最主要的工程技巧就是靠激进的多 provider key 轮换来一直保持免费。
https://x.com/ZayahNelson0/status/2081190505145331860
作者描述了一个每天跑的 agent loop,用来投递求职申请外加发冷邮件,它会操作一个真实浏览器,并在横跨 14 家 provider 的 43 把免费额度 API key 之间轮换调度,每月成本 0 美元。这是一个完全自主的个人 loop 的具体例子,它最主要的工程技巧就是靠激进的多 provider key 轮换来一直保持免费。
#34
@stretchcloud
https://x.com/stretchcloud/status/2081204105515811180
作者解释了他们为 agentic 记忆检索层选 turbopuffer 而非 pgvector 等方案的架构决策:它完全跑在对象存储上(比 RAM+SSD 便宜约 70 倍),写入速度约 1,190 chunk/秒(pgvector 只有 540–760),并支撑着 Cursor 在 8000 万个命名空间、上万亿 chunk 上的索引。核心论点是:随着 agent 数量激增,agentic 记忆真正隐藏的瓶颈是「每命名空间的成本」,而不是召回质量。
https://x.com/stretchcloud/status/2081204105515811180
作者解释了他们为 agentic 记忆检索层选 turbopuffer 而非 pgvector 等方案的架构决策:它完全跑在对象存储上(比 RAM+SSD 便宜约 70 倍),写入速度约 1,190 chunk/秒(pgvector 只有 540–760),并支撑着 Cursor 在 8000 万个命名空间、上万亿 chunk 上的索引。核心论点是:随着 agent 数量激增,agentic 记忆真正隐藏的瓶颈是「每命名空间的成本」,而不是召回质量。
#35
@EddyWoodss
https://x.com/EddyWoodss/status/2081247870154330287
作者宣布推出一个免费的「agent loop 检测器」工具,能在递归自我改进的螺旋烧光额度之前把它抓住,同时还一起发布了另外两个工具。这是一件很具体的 loop 安全工具,正好对准了这个圈子里大家反复警告的那种失控烧钱的失效模式。
https://x.com/EddyWoodss/status/2081247870154330287
作者宣布推出一个免费的「agent loop 检测器」工具,能在递归自我改进的螺旋烧光额度之前把它抓住,同时还一起发布了另外两个工具。这是一件很具体的 loop 安全工具,正好对准了这个圈子里大家反复警告的那种失控烧钱的失效模式。
#36
@neil_xbt
https://x.com/neil_xbt/status/2081231787616076219
作者说,在他研究的 70 个真实世界 agent-loop 实现里,很大一部分对「失败步骤最多重试几次」根本没有任何正式上限,于是失败时的行为全凭模型当场临时决定。他主张严格的升级机制:设定明确的恢复尝试次数、明确的成功标准,一旦触及上限就硬性移交给人,绝不允许对同一个失败方法搞什么有创意的第五次尝试。
https://x.com/neil_xbt/status/2081231787616076219
作者说,在他研究的 70 个真实世界 agent-loop 实现里,很大一部分对「失败步骤最多重试几次」根本没有任何正式上限,于是失败时的行为全凭模型当场临时决定。他主张严格的升级机制:设定明确的恢复尝试次数、明确的成功标准,一旦触及上限就硬性移交给人,绝不允许对同一个失败方法搞什么有创意的第五次尝试。
#37
@mernit
https://x.com/mernit/status/2081436968219800026
作者分享了 agent skill 的心得:用人写的 skill 比 AI 生成的 skill 效果好得多,而一个好的 skill 恰好只需说清三件事——输入、输出、以及「什么算好」。他建议的迭代方式是:跑 agent loop,根据每次运行的结果去更新这三项,直到 skill 表现符合预期。
https://x.com/mernit/status/2081436968219800026
作者分享了 agent skill 的心得:用人写的 skill 比 AI 生成的 skill 效果好得多,而一个好的 skill 恰好只需说清三件事——输入、输出、以及「什么算好」。他建议的迭代方式是:跑 agent loop,根据每次运行的结果去更新这三项,直到 skill 表现符合预期。
#38
@liocoh
https://x.com/liocoh/status/2081434944144801999
作者点出一个真正被冷落的话题:把开源模型当无人值守的 agent 来跑。所有人都在测聊天质量,却几乎没人展示:当一个本地模型连续几小时跑 agent loop 时会发生什么,以及如何在错误滚雪球之前就抓到它在出问题。这是对「长时程本地 agent 缺失评测范式」的一针见血的观察。
https://x.com/liocoh/status/2081434944144801999
作者点出一个真正被冷落的话题:把开源模型当无人值守的 agent 来跑。所有人都在测聊天质量,却几乎没人展示:当一个本地模型连续几小时跑 agent loop 时会发生什么,以及如何在错误滚雪球之前就抓到它在出问题。这是对「长时程本地 agent 缺失评测范式」的一针见血的观察。
📡 生态产品雷达
生态产品雷达
MCP — 大家正在重新争论的工具层;不少人主张跳过或最小化它,能给每个循环省下几万个 token。
Hermes Agent — 驱动微型本地模型跑完整「构建-测试-修复」循环、并带持久记忆的首选 harness。
Codex — 反复出现的、开放且循环可审计的替代品,大家常和 Claude Code 并跑或对打。
AREX — 本周被讨论最多的项目:一个开放的、递归自我改进的深度研究 agent,放出了 4B 和 122B 两个尺寸。
Bonsai — 一个约 3.9GB、一比特的模型,靠在廉价硬件上把 agent 循环撑过第三轮,不断让人意外。
MCP — 大家正在重新争论的工具层;不少人主张跳过或最小化它,能给每个循环省下几万个 token。
Hermes Agent — 驱动微型本地模型跑完整「构建-测试-修复」循环、并带持久记忆的首选 harness。
Codex — 反复出现的、开放且循环可审计的替代品,大家常和 Claude Code 并跑或对打。
AREX — 本周被讨论最多的项目:一个开放的、递归自我改进的深度研究 agent,放出了 4B 和 122B 两个尺寸。
Bonsai — 一个约 3.9GB、一比特的模型,靠在廉价硬件上把 agent 循环撑过第三轮,不断让人意外。
评论