2026年7月22日loop

Loop 日报: 2026年7月22日

今天 loop 本身已经不好玩了。谁都能写个 while 循环去调模型、跑工具,真正把好帖子和噪音区分开的,是围在 loop 外面的那一圈东西:它怎么知道自己做完了,怎么知道自己卡住了,谁来给输出打分,以及没人盯着的时候这一晚上要烧掉多少钱。有个帖子把 loop 该有的八种退出方式列了个清单,冲到 13.5 万以上的曝光,大家的注意力已经明显挪到这边了。与此同时,无人值守跑一个 agent 的硬件门槛掉到了二手 200 美元的游戏显卡,一个自主 agent 在 OpenAI 的招聘赛里悄悄赢过了一千名人类 ML 工程师,剑桥和 NVIDIA 的一篇论文则直接说整个自我改进领域一直在优化错的东西。下面是大家今天真正跑过、跑挂过、量过的东西。
💡#1
@hanakoxbt
https://x.com/hanakoxbt/status/2079325855155707941
今天转发量最高的 loop 帖,本质是一份 checklist:你的 agent loop 需要八个出口,而大多数人只写了一个。目标达成(由 evaluator 按 rubric 打分,而不是模型自己宣布胜利)、由 harness 而非 prompt 强制的轮次上限、token 或美元的预算上限、真实时钟的 deadline、每轮对状态做哈希、连续三轮没变化就判定无进展、放在 loop 外面的人工 kill switch、连续错误阈值且成功后清零、以及外部事件 webhook(PR 已经 merge 了,这活儿就不用干了)。最值得抄走的是那句总结:只有一个出口的 loop 会卡死,有八个出口的才叫系统。先写退出条件,再写 prompt。
💡#2
@free_ai_guides
https://x.com/free_ai_guides/status/2079310010933453017
Weco AI 的 CEO 讲了他们的 agent Aiden 参加 OpenAI Parameter Golf 招聘赛的全过程,对手是大约一千名 ML 工程师。22 天里它在单个 H100 节点上跑了约 1300 次实验,只用掉全场算力的 4% 不到,却贡献了排行榜上约 15% 的记录。人类最强选手拿了三项记录,Aiden 拿了七项。更能说明问题的是按 PR 算的 H-index:Aiden 是 10,最强人类是 7,也就是说别的工程师 fork 和续写 agent 成果的次数超过了任何一个人。作者给的结论很实在:Aiden 那些破纪录的 PR 几乎每一个都能追溯到某篇人类论文,或者某个人留下的一句「这个想法太难实现,我放弃了」。人负责创意,agent 负责不知疲倦地执行,而你的 eval 就是 loss function。
💡#3
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2079318538100342854
一篇覆盖 1250 篇论文的递归自我改进综述,最后落到一个瓶颈上:evaluator。对照实验里,让模型做十轮自我批评、中间不加任何外部检查,它会彻底停止进步,直到把一个 grounding 步骤加回来。整个文献里这个模式都成立:信号强的时候(证明检查器、能跑通的测试)loop 会复利;信号弱的时候(一个对自己很自信的模型)loop 就是在打转、坍缩,或者把模型最笃定的那个偏见反复强化。这篇的真正价值在于它按「系统里到底什么被改了」和「是否还有人在把关」给每种自我改进方法排了序,因为「自我改进」这个词现在被滥用得太厉害了。
💡#4
@yyyiiillluuu
https://x.com/yyyiiillluuu/status/2079251789489320355
剑桥和 NVIDIA 的论文直接攻击了所有自我改进 loop 的默认假设:评估标准在 agent 变强的过程中保持不动。物种从来不是在冻结的环境里进化的,静态 verifier 迟早会饱和或被钻空子。他们的 Red Queen Gödel Machine 把评估本身也塞进改进 loop,用 epoch 的方式跑:一个 epoch 内标准冻结,所以单 epoch 的保证依然成立,到 epoch 边界时效用函数本身进化一次。在可验证的代码任务上,靠加入 agent-as-judge 的代码审查信号,它用少 1.35 到 1.72 倍的 token 打败了此前的 SOTA。埋得最深那条结论最扎人:最强的 baseline reviewer 对 AI 生成论文的过度接受率最高能到人类的 1.91 倍。
💡#5
@rudrank
https://x.com/rudrank/status/2079000846730481701
这才是生产环境里自我维护的工具长什么样。App Store Connect CLI 从今年一月只有一个 TestFlight 反馈命令,做到了覆盖 1300 多个 App Store Connect 接口的完整能力,现在还被 OpenAI 官方 Codex 文档推荐为 agentic 流程发布 iOS 应用的方式。这个 repo 自己给 issue 和 PR 分类、自己修、自己审自己的修复、还趁作者睡觉的时候发版——上个月他大概只花了五小时,照样出了十五个版本。他把最顶上那层叫 agentception:一个自动化 agent 读 CLI 自身的 analytics,找出别的 agent 在哪里卡壳,每天提交改进,再由第二个自动化 agent 验证后才发布。顺带这个项目还给他带来了 14 个 offer、3 个收购意向和一次 acquihire。
💡#6
@SeanDonahoe
https://x.com/SeanDonahoe/status/2079203494112924078
终于有人真去读了 Auto-Company 的代码——就是那个 725 星、号称 14 个 AI agent 通宵经营一家公司的 CMU 开源项目。掀开看,它是一个 743 行的 bash 脚本,每 30 秒调一次 Claude Code,每个 cycle 都是全新的 headless session,整套记忆系统就是一个 Markdown 文件,每轮醒来读一遍、死之前重写一遍。没有向量库,没有编排框架,14 个 agent 就是 persona 提示词文件,每轮挑 3 到 5 个当 subagent 演一演。但有三个设计是真的好:强制收敛(第一轮头脑风暴,第二轮做 pre-mortem 并强制 GO 或 NO-GO,第三轮起必须产出物料,禁止纯讨论)、卡住检测(连续两次 Next Action 一样就自判卡死)、以及整个系统靠改一个文件来操舵。难看的地方是它用 bypassPermissions 直接跑在你的宿主机上,没有容器,护栏就是几个 markdown 文件。
💡#7
@sudoingX
https://x.com/sudoingX/status/2079180442285244814
今天最清晰的硬件数据点。昨天一张 1660 Super 6GB 只能跑聊天,今天一张 200 美元的二手 RTX 3060 Ti 8GB 就能在同样的 Bonsai 27B 1-bit 模型上跑完整 agentic loop,多出来的两个 G 改变了一切。llama-server 现在 8 个 G 里占 6.8,还带满 128k 上下文,是 6GB 卡能装下的十六倍,生成速度 42 tokens/s,翻了一倍。他挂了个 Hermes agent 上去然后走人:30 多分钟,它自己跑 benchmark、撞上自己的失败又恢复过来,全程没掉过 loop。他自己那句总结最好记——6GB 能装模型,8GB 才能跑 agent。
💡#8
@sudoingX
https://x.com/sudoingX/status/2079226356576223725
后续那张对比表值得存下来。GTX 1660 Super,6GB,150 美元,20 tokens/s,约 8k 上下文,只能聊天,因为 server 装不下。RTX 3060 Ti,8GB,200 美元,42 tokens/s,128k 上下文,能跑完整 agent loop。RTX 3090,24GB,900 美元,68 tokens/s,约 786k 上下文。干活的模型是 Bonsai 27B 1-bit,Qwen 3.6 27B 的量化版,硬盘上 3.5GB,混合注意力让 KV cache 极小——他明说了,KV cache 小才是 8GB 从聊天跨到 agent 的全部原因。速度基本就跟显存带宽走,三分之一的带宽换来三分之一的 tokens。他还量了缓存填满过程中的衰减:刚开始 42 tokens/s,65k 时约 20,跑满 128k 约 13,是斜坡不是悬崖,全程没爆显存。
💡#9
@DominiqueCAPaul
https://x.com/DominiqueCAPaul/status/2079143695740284956
一个机器人团队在实验看板上加了新面板,追踪执行器拆箱任务的成功率,有意思的是他们选的指标:不看实测成功率,看 95% 置信下界。理由是实验做太多本身就有点像 p-hacking,所以如果他们相信自己的模型好、想把数字推上去,那就多跑 eval,而不是挑对自己有利的结果。他说这个设计是直接从 autoresearch 的图表里搬来的,同时也老实承认,现实中的机器人研究没多「auto」,每一次 eval 都得有人盯着。
💡#10
@nifinet
https://x.com/nifinet/status/2079219916948054446
两个 Anthropic 工程师盯了一周完全说不通的 agent 运行记录,最后试了个挺蠢的办法:闭眼一整分钟,睁开看屏幕一秒,再闭上——模拟一下当 Claude 是什么体验。结果真管用,因为模型缺的正是他们从没想过要给的上下文。帖子接着把 Karpathy 那条一句话规则(评估不了就 auto-research 不了)套到 outbound 销售上:coding agent 之所以起飞是因为代码有测试,而 outbound 也在这条线的正确一侧,因为市场会给每一次触达打分——回复、约会、不回、不匹配。他给的 loop 是:每个结果都带原因记录下来,一次只提一个改动,用 eval gate 干掉那些只是听起来聪明的改动,保留人工 merge,让 operator 来定标准。
💡#11
@Haezl_Crypto
https://x.com/Haezl_Crypto/status/2079219730700009529
一个照着 Karpathy autoresearch 做的自主研究 agent 被收进了 ONcompute 官方教程,值得注意的是它不需要什么。一个本地 Qwen3-14B 跑在同一张做训练的 H200 上,读实验历史、提假设、改写 train.py,只保留能提升结果的改动。最多跑 200 轮迭代,全程不需要任何 API key。纯本地硬件上的自主 ML 研究,直接消掉了那个常见反驳:这种 loop 只有前沿实验室的预算才玩得起。
💡#12
@ShehabAnwer
https://x.com/ShehabAnwer/status/2079225751765762429
一个 Kaggle 提交长成了 Agent-ProSAT,一个直接受 Karpathy autoresearch 启发的 agent 驱动 loop,用来迭代改进解 Alice-in-Wonderland 谜题的纯 Python solver。这个 agent 反向推出谜题规则,生成代码去求解并验证每个程序化步骤,产出适合 Nemotron 风格微调的短的可验证 CoT 轨迹。最值得抄的设计细节是循环式的 Twin Blind Check,它能防止 solver 在 session 期间偷看答案。目标是产出 token 高效、可审计、能在人类或 AI 审查下持续演化的推理数据,这比再刷一个榜单分数有意思多了。
💡#13
@stas_sorokin_
https://x.com/stas_sorokin_/status/2079193046323806697
一份很紧凑、可以直接落地的规范,管的是 agent 从给出答案到执行下一步之间那道闸。开跑之前先把 pass condition 写死,验证必须严格二值(verified 等于 1,unverified 等于 0),所有 unverified 的结果都扔回通宵的 autoresearch loop,用 judge-alignment 让评估始终绑在 pass condition 上,把这条操作规则写进 CLAUDE.md 好让它真的改变 agent 行为,只有结果回来是 verified 才允许下一步。最点睛那句:如果一个未验证的结果照样能推动流程往前走,那你的验证 loop 就是个装饰。
💡#14
@stretchcloud
https://x.com/stretchcloud/status/2079040599630676057
沙箱悄悄成了 agentic 技术栈里独立的一个产品品类,有三个具体数据点。Tinyfish 给每个浏览器会话开一个专属 microVM,冷启动 4 秒,会话一结束立刻销毁——没有共享进程空间,没有持久状态,会话之间不串味。Unikraft 把这事推到 10 毫秒以内的启动时间,单台服务器并发跑十万以上 microVM,这就让隔离变成了默认的算力单元而不是特例。Browser Use 则把整个 agent loop 搬进 Unikraft microVM,VM 里零密钥:推理 loop、浏览器、工具调用全在里面,跑完 VM 就消失。底层原语是 Firecracker、gVisor 和 V8 isolates,各自在性能与隔离度的曲线上占一个点。
💡#15
@ArcanusOrdo
https://x.com/ArcanusOrdo/status/2079353520008876327
有人给 agent loop 真的做了一层治理并把 commit 贴了出来。这个包加了 AuditLedger(内存里的 SHA-256 哈希链账本,记录 task 和 tool 事件)、ExecutionBudget(按任务限制工具调用数、迭代数和可选的 token)、task 级的 ExecutionContext(保存审批和取消状态),以及一个默认拒绝的 GovernancePolicy 来给能力分级。只读工具正常跑,本地写和网络工具需要按任务显式批准,第三方桌面控制类工具直接拒绝——哪怕你把它加进了白名单。Token 和迭代上限会往下传进 agent loop,取消请求会阻断后续工具调用,还提供了 cancel 和审计历史的 API 接口。35 个测试通过,而那条刻意划下的边界——在有真沙箱之前,屏幕和输入控制一律拒绝——比大多数 agent 框架都克制。
💡#16
@imwon_dev
https://x.com/imwon_dev/status/2079015791048241238
对事后 trace 分析为什么失效的一次精准诊断。他的工具读的是跑完的 agent trace,只能问「这两个输出是不是完全一样」,这能抓到原样重复,但抓不到真正的失败模式:loop 一直在动,却没有引入任何新证据。另一个开发者给他的重构建议是在每个工具边界打一条决策记录——新证据、沿用旧信息、或者为什么改变了——这样「原地打转」就变成可观测的,因为你记录的是新证据的缺席,而不是从重复字节里去猜。他很诚实地说自己控制不了埋点,只能看到 agent 愿意吐出来的东西,而今天几乎没有 trace 会吐这些。这恰好是一个很有力的论据:agent 默认就该记这些。
💡#17
@cosocoio
https://x.com/cosocoio/status/2079118966480678937
这周对 loopmaxxing 最有力的反驳。网上全是让 agent 更自主、跑更久的帖子,但对精细代码他想要的恰恰相反,用的是他自己那套 baby-steps skill:挑出最小的、自洽的下一步改动,只展示这一处改动,说明预期效果,等批准,只应用被批准的那部分,然后重复。关键在于批准必须是一道真闸——沉默不算,含糊不算,部分同意也不算——连后续的格式调整或编译修复都算新的一小步,除非他明确扩大授权范围。他用一个无聊到固定的输出格式来强制执行:文件、一句话意图、before、after。对于出 bug 代价高昂的关键代码,自主性同样是昂贵的。
💡#18
@pauliusztin_
https://x.com/pauliusztin_/status/2079182034124079247
他花了几个月拆解 Claude Code、OpenCode、Pi 和 Aider 到底怎么工作,现在开始发一个开源系列 Building a Coding Agent From Scratch,核心观点是大多数人盯着 agent loop 看,而 loop 恰恰是最小的那块。真正让 coding agent 跑得起来的是 context engineering、human-in-the-loop 流程、durable execution、权限与沙箱、skills 与 subagents,以及 eval 和可观测性。他的实现用 Modal 托管 Qwen3 这类开源模型并跑远程沙箱,用 Kitaru 做持久化 runtime 让 agent 能暂停、恢复、从失败中爬起来,用 Opik 做 eval 和运行对比,然后故意用 Pydantic AI 写那个最简陋的 loop——就是为了展示所谓「agent」本身其实没几行代码。
💡#19
@HarrisDecodes
https://x.com/HarrisDecodes/status/2079106605140812285
他自己写了个能跟 Claude Code 对标的 coding harness,整套在 CrewAI 上开源了,组件清单基本可以当成同类项目的规格书。自主 agent loop、兼作长期记忆的文件工具、面向长任务的 planning、拥有独立上下文的 subagents、在一次性 VM 里做沙箱代码执行、human-in-the-loop 审批、以及带 checkpoint 的持久记忆。他解释为什么这事重要的方式很好:模型是大脑,harness 给它手,对写代码来说,这就是「在一个代码库里干活」和「生成文本」的区别。
💡#20
@thefounderspack
https://x.com/thefounderspack/status/2079326509416780057
xAI 用 Apache 2.0 开源了 Grok Build——不是一层 CLI 壳,而是整个 Rust 写的 coding agent harness,带完整 TUI,包括 agent loop、工具分发、MCP 支持和沙箱。运维上最要紧的一点是它能完全本地跑:指向一个 Ollama 实例,数据不出本机,默认关闭留存,之前存的代码数据也在删。它同时说三种 API 协议(OpenAI Chat、OpenAI Responses、Anthropic Messages),改一个 config.toml 就能从 xAI 云端切到本地 7B 模型。现在 harness 的重要性已经不输模型,把它变成可审查的,比再发一个 CLI 分量重得多。
💡#21
@Marco_Ramilli
https://x.com/Marco_Ramilli/status/2079036950644740112
一个小但确实跳出编程范畴的应用:novel-studio,一个写整本书的 agent loop。它把动态世界模拟和本地 RAG 结合起来,从一句 prompt 生成一部完整小说。才十四颗星,很早期,但它提醒了一件事——大家在代码上打磨的那套 loop 加记忆加验证的结构,可以直接迁移到任何长周期生成任务,而这类任务真正难的地方就是几千步之间的一致性。
💡#22
@allwefantasy
https://x.com/allwefantasy/status/2079115041115160592
关于 data agent 的一个很锋利的架构论点。大多数 data agent 是让 LLM 一次性生成一整个 Python 程序,InfiniSQL 走的是反方向:一条语句等于一次 tool call。他的理由是后者才真正贴合 agent loop 的形状——想、做、看、再决定——而一次性生成整个程序把这四步压成了一个无法验证的步骤。这是个很小的设计决定,但它决定了 loop 里到底还有没有地方能插进一次检查。
💡#23
@Nekt_0
https://x.com/Nekt_0/status/2079252763448410185
有人把 Karpathy 那场一小时对谈完整看完了,给出的摘要很有用。Karpathy 现在每天 16 小时都在指挥 AI agent,自己几乎不写代码;章节涵盖把整个功能交给 coding agent、用 WhatsApp 控制家里、AutoResearch 把人从优化 loop 里移出去、以及 MicroGPT 用 200 行重建一个 LLM。他的判断是智能家居那段是娱乐,AutoResearch 才是正题,因为一旦 agent 能提假设、跑实验、量结果,然后不等人就继续,研究就不再按人类速度推进了。有价值的程序员会变成那个定义目标、搭好环境、并且知道机器什么时候错了的人。
💡#24
@clairejyz
https://x.com/clairejyz/status/2079243768201715828
一期播客,请了 Lightspeed 的 partner 聊 loop engineering、跟 AI 协作的四个层次,以及 agent loop 的解剖。章节列表本身最有用:24:20 loop engineering 到底指什么,30:59 为什么 agent 需要一个专门为它们造的搜索引擎,46:54 AI agent 在哪里崩掉、变懒、直接放弃,54:06 agent 技术栈里还空着的位置以及下一批公司会长在哪。它也顺带聊了本周另一条线——三位 AI 大佬几天之内接连发布 AI 现状长文——但把 loop 这一半当成更有后果的那一半。
💡#25
@tiennguyendev
https://x.com/tiennguyendev/status/2079204690659549532
r/AI_Agents 上有人在一个 agent loop 上烧掉 1400 美元,才发现自动重载一直开着。那套系统里每个 agent 都严格照吩咐做事,永远做下去,这种失败模式没人会去设计防护,因为它压根不是 bug。他的结论很对:在你写下一个 agent 之前,先写的应该是花费上限和一条会升级给人的告警线。
💡#26
@enginenerdx
https://x.com/enginenerdx/status/2079127434700468544
同样的故事,规模大得多。一个 agent loop 一晚上烧掉 27.5 万美元,另一家机构干脆忘了设上限,一个月冲到 5 亿美元。审计反复查出同样三个洞:密钥泛滥、没有护栏、没有审计追踪。他那句总结值得记住——不是模型出了问题,是 harness 根本不存在。
💡#27
@drjoshcsimmons
https://x.com/drjoshcsimmons/status/2079220406976688531
今天最有价值的重构,就两句话。agent loop 是一个 ready set 只有一个元素的调度器:一次只处理一个工作单元,下一步由一次不透明的模型调用来决定。放在计算机领域的任何其他角落,我们都会管这叫一个很聪明但没有操作系统的进程。这也正好解释了为什么今天所有关于退出条件、预算、审计账本、卡死检测的帖子,本质上都是在重新发明我们改叫它 agent 那天删掉的那部分 OS。
💡#28
@afeiNick
https://x.com/afeiNick/status/2079338672608927966
大多数人把 agent 当遥控器用——提示、改、审、再提示、再改——他认为有用的转变不是「让 agent 一直跑下去」,而是设计出知道自己要完成什么、怎么自查、什么时候重启、什么时候停、什么时候该找人的 loop。收尾那句是今天整个主题最好的压缩:没有停止条件的 agent loop,只是一个很贵的重试按钮。
💡#29
@bendee983
https://x.com/bendee983/status/2079115389796028885
关于什么时候该弃用通用 harness 的一条清晰判据。在你还在探索用例或者干一次性活儿的时候,通用 harness 非常好用;但当一个 AI 应用成熟起来,规则会固化,每个任务的 prompt、模型、工具、skill 都会变得具体——到那个点,就值得自建 harness 或把现成的针对你的应用做优化。他还提到一个正在冒头的品类:自我改进的 harness,agent 用底层模型的推理能力去优化自己的 harness 代码。他也老实承认,harness engineering 这活儿很难。
💡#30
@0xPascual
https://x.com/0xPascual/status/2079124129480061137
对一位 Anthropic 工程师 20 分钟视频的细读,重点全放在视频里没展示的脚手架上。原始日志露出了一个四层 agent loop,带 subagent 委派和视觉自检,运行之间把记忆存下来,权重冻结的情况下每一轮都在变好。他的论据是成本结构:Fable 5 每百万输入 token 0.5 美元,加上 RunPod 上一小时 6 美元的 GPU,就能把整个 loop 跑完,中间不需要人。他的结论很直接——「提示词工程师」这个岗位的成本结构消失了,一个独立开发者现在可以搭出一套替代整个团队的系统。
💡#31
@Adham__Khaled__
https://x.com/Adham__Khaled__/status/2079170850868093211
Schmidhuber 发了一篇 97 页综述,梳理 AI agent 怎么自我改进,这个分类法值得内化。每个 agent 都是基础模型加一层操作脚手架,而这层脚手架有四个耐用部件:prompt 和系统指令、记忆的存储与检索、工具集与接口、控制与路由逻辑。自我改进被定义为一次自我诱发的更新——agent 从自己的运行记录里提取信号,然后把持久改动落到权重或这四个部件上。两条路径并列存在:改模型更慢但更稳,改脚手架更快也可回滚。综述覆盖软件、网页、游戏、科学、机器人和桌面控制,还配了一个持续跟踪该领域的开源 GitHub 列表。
💡#32
@nielskaspers
https://x.com/nielskaspers/status/2079132204467097863
judge 问题的产品侧版本。AI 产品在生成上过度优化、在验证上严重欠建设,标志是市场开始谈 validation engineer 和「管理 agent loop」这类岗位。瓶颈已经不是拿到输出,而是怎么让用户足够快地信任、检查、纠正它,快到愿意继续用这个产品。他给的验证在 UI 上具体长什么样:引用、diff、审批、审计追踪、一键回滚。Demo 质量赢的是关注度,验证质量赢的是留存。
💡#33
@mardehaym
https://x.com/mardehaym/status/2079267458175705575
关于 auto-research 之后非前沿实验室的人还剩什么位置,一篇真有分量的战略思考。他的框架是:OpenAI、Anthropic、Google、Meta 全都在做「用 AI 改进 AI」,卖 API 给你只是为了给这场竞赛输血,这意味着 evals 和数字化转型公司那套打法,地基正是这四家想让它变得无关紧要的东西。他给实验室闭环走向递归自我改进 50-60% 的概率,窗口 4 到 15 年;给渐进式改进 40-50%,那种情况下 LLM 与生产之间的确定性层会变成关键基础设施。他还公开承认自己公司只有在第二种结局下才成立,这在这类文章里是罕见的诚实。
💡#34
@Rezzi_sol
https://x.com/Rezzi_sol/status/2079281852981166377
把 chatbot 变成系统的三段式拆解,很干净。反馈 loop:任务结束后把实际结果和预期结果做对比,把错误、缺失信息和糟糕决策记下来,而不是在 session 结束时全丢掉。动态学习:这些失败变成下一轮的上下文,让 agent 复用过去的错误并调整打法。自动 prompt 生成:系统读当前任务状态,判断下一步该干什么,自己写后续 prompt,不等人。结果是一个执行、评估、记住、纠正、再跑的持续循环,目标不是写出完美 prompt,而是造一个环境,让 agent 在第一个 prompt 消失之后还能继续变好。
💡#35
@dare0lu
https://x.com/dare0lu/status/2079060924959469923
必要的泼冷水的人。他认为自我改进 agent 的承诺纯属挥手,没有任何证据支撑,实际效果跟每个 agent harness 早就集成的简单记忆系统没有区别——在真实生产环境里可能还不如一个朴素的 scratchpad。值得跟那些综述论文对照着读,因为很多以自我改进名义发表的东西,就是换了个更好听牌子的记忆。
💡#36
@mesty_asin
https://x.com/mesty_asin/status/2079117560650305754
一条简短回复,点出了那个没人公布的指标。他承认 agentception 那个 loop(自动化 agent 读工具自身 analytics,找出别的 agent 在哪卡住)确实是新东西,也指出大多数自我改进的说法不过是换了包装的 cron job。然后他问了那个真能一锤定音的问题:verifier agent 否决第一次尝试的频率到底是多少?如果答案是几乎从不,那这个 verifier 就是装饰。
💡#37
@_vmlops
https://x.com/_vmlops/status/2079113822334583075
这周传得最广的那个数字,来自一位 Anthropic 工程师的播客:他们 90% 以上的工程师已经在用自我改进的 agent loop,预计几个月内会到 100%。另一个值得记的细节是,有些 agentic 工作流连跑好几天也没花掉几百美元,这跟「长时间运行的 loop 天然很贵」的直觉是相反的。播客拆的技术栈顺序是 agent、harness、loops、memory,顺序本身就有信息量。
💡#38
@cmyzie
https://x.com/cmyzie/status/2079354866573414595
大多数 agentic UI 教程都略过的一个现实约束。agent loop 不能放在前端跑,因为用户一刷新标签页,正在处理的这一轮就立刻死掉。就这一条事实,就逼着任何稍微像样的产品从一开始就把 agent 执行放到后端。他在整条 thread 里更大的观点是:「agent loop 不就是个 while 循环,大概 200 行」这种说法,在你真要拿它做产品的那一刻就散架了。
💡#39
@cortensor
https://x.com/cortensor/status/2079124901185864159
PyClaw 的开发日志,罕见地具体说明了 agent loop 的延迟到底花在哪。他们现在盯的是每次请求之前和之中 loop 做的那些准备步骤——这些步骤补上下文、加控制,但也同时加上了响应和推理延迟。工作内容是审计哪些预处理是每次请求都真的必须的、哪些可以跳过,并优化上下文、工具、记忆和模型调用在 loop 里的组装方式。他们明说目标是在能力、可靠性和速度之间取得更好平衡,而不是靠砍上下文换速度。
💡#40
@axionisfuture
https://x.com/axionisfuture/status/2079190049308987493
一句话的论点,逼你跳出单 loop 思维:你的 agent loop 只是一个工人,你却一直把它当整个团队在用。他提的转变是从 loop engineering 走向 graph engineering,同时跑两张图——一张 org graph 描述有哪些角色存在,一张 work graph 在运行途中自我改写。他点出的失败模式才是重点:一个节点挂了,三个 agent 悄无声息地开始拿旧数据干活,这种问题对任何单 loop 的退出条件都是隐形的。
💡#41
@max_vogel_dev
https://x.com/max_vogel_dev/status/2079106001601785899
对 Databricks 最近这批发布的一次不错的解读,拒绝把它们当成互不相干的公告。Lakebase、Lakehouse 实时能力、data agents,加上 gateway 和治理那摊活,指向的是同一件事:数据库的用户正在变成一个 agent loop,而不是开着 SQL 标签页的分析师。这个重构解释了为什么治理和 gateway 会跟数据产品一起冒出来——一个人拿着查询编辑器,你对权限层的需求远没有那么急迫,换成一个 loop 就完全不一样了。
💡#42
@vezko_zkp
https://x.com/vezko_zkp/status/2079251364094660621
一句话纠正大家读模型发布的方式。OpenAI 上了分档推理,成本跨度 25 倍,那真正的基准就不是最高分,而是能跑完一个 10 步 agent loop 的最便宜的那个 token。这个数字刚刚大幅下降,它对「什么东西值得挂着无人值守地跑」的影响,远比榜单排名变动大得多。
💡#43
@MarketTollMap
https://x.com/MarketTollMap/status/2079073167411233172
从盯着 agent 集群烧套餐额度里总结出的一条具体运维规则。模型质量可以很强,但如果一个 swarm 在 48 次小时级运行里就把额度耗光,这个工作流照样不是生产就绪。他的人工检查点是:在扩大任何 agent loop 之前,先测每次运行的成本。跟 1400 美元和 27.5 万美元那两个帖子是同一个教训,只不过被写成了流程步骤而不是恐怖故事。
💡#44
@ichong
https://x.com/ichong/status/2079326168311108037
给正在纠结买什么的人一条硬件分界线。如果你只想跑单路对话,Strix Halo 够用。如果你有 agent 集群、自我改进 agentic 流程、以及在本地或边缘做训练微调的打算,那就选 DGX Spark,因为这些都要并发、集群和 CUDA。跟那条二手 3060 Ti 的 thread 配着看正好:跑一个无人值守 loop 的门槛很便宜,但同时跑好几个是另一笔采购。
💡#45
@dancolta
https://x.com/dancolta/status/2079226394580525202
今天最不光鲜也最准确的一条。真正难的不是 agent loop,而是把它接进一门真实生意,让输出落到一个真的有影响的地方。没人发这部分,因为它无聊——这恰恰解释了为什么时间线上全是 loop 架构图,却几乎看不到哪个 loop 改变了一张损益表。
💡#46
@emadgnia
https://x.com/emadgnia/status/2079326346556117376
一条短观察,能重构不少人的升级决策。「能跑聊天机器人」和「能跑 agentic loop」之间的差距比大家想的小,很多时候只是 VRAM 余量的问题,而不是要换一个档次的模型。在你把整台机器换掉之前值得先查一下,你现有的模型可能只是缺个地方放 KV cache。
💡#47
@teortaxesTex
https://x.com/teortaxesTex/status/2079172215338094971
对递归自我改进作为一个「事件」的降温式看法。他的论点是 RSI 根本不是一个你能指出来的离散时刻——LLM 做 autoresearch 已经有一阵子了,连 Kimi 都能做 autoresearch,也就是说加速早就在进行中,而不是待发生。这对那种总把「闭环」当成未来某天的发布公告来讨论的话语,是一剂很有用的解药:我们已经坐在那条斜坡上了。
💡#48
@bonsaixbt
https://x.com/bonsaixbt/status/2079174397760327992
一个完整 agentic OS demo 的走查,整家公司由自主 agent 运营:一个 CEO orchestrator 协调一支实时的专家团队(研究员、CMO、销售、开发、数据分析师),每个 agent 有自己的角色,同时共享整个业务的完整上下文。研究 agent 拉竞品和市场情报,CMO 把它变成内容 brief,销售筛线索,数据分析师盯表现,开发改进流程,CEO 决定先处理哪件事。核心机制是共享记忆系统加知识图谱,所以一个 agent 学到的东西整个系统立刻能用——一个 agent 升级,整家公司一起变聪明,而不是每个 agent 都从零开始。
💡#49
@tonysimons_
https://x.com/tonysimons_/status/2079184723667026138
Hermes agent 大师课的十二个部分被整合到了一处,目录本身就是一份现代 harness 必须处理的清单:agent loop 与提示词架构、记忆、skills、工具、cron、gateway、subagents、浏览器与电脑操作、Kanban、profile,以及管理层。他还专门写了一节讲那些没人愿意聊的局限性,而这正是大多数 agent 文档会省掉的部分。当作一张地图看很有用:告诉你各个部件在哪里咬合、在哪里产生复利、又在哪里崩掉。
💡#50
@seldon_tech
https://x.com/seldon_tech/status/2079190905114829083
小事,但作为信号值得记一笔:第一届 Curious Machines 活动办成了,议程里专门有 auto-research 方向的报告,场地在 ETH 的 agent lab,报名超额到没法让所有想来的人进场。autoresearch 已经从推特 thread 走进了有学术机构承办的线下聚会,而这通常就是一项技术从个人驱动的潮流,转向开始积累会为它写论文的人的节点。
📡 生态产品雷达
生态产品雷达

Claude Code —— Auto-Company 那个 743 行 bash loop 的底座,也是那套四层 Anthropic 脚手架和多篇 harness 拆解的主角。
Hermes —— 驱动 8GB 显卡上那次无人值守 agent 运行,同时也是十二部分 harness 大师课的主题。
Ollama —— Grok Build 的本地模型落点,也是每一句「完全本地运行」背后的标准逃生口。
Qwen(Qwen3-14B / 经 Bonsai 1-bit 量化的 Qwen 3.6 27B)—— 本地 autoresearch loop 和 200 美元显卡 agent 基准里真正在干活的模型。
Pi —— 既被当作统一 LLM API 加 agent loop 加终端界面来引用,也是 coding agent 系列里被拆解的四个 harness 之一。
Unikraft / Firecracker / gVisor —— microVM 和沙箱原语,现在 agent runtime 是围着它们设计的,而不是事后再焊上去。
← 上一篇
超级用户日报: 2026年7月22日
下一篇 →
灵感雷达: 2026年7月22日
← 返回所有文章

评论

加载中...
>_