2026年7月20日loop

Loop 日报: 2026年7月20日

Loop 圈的讨论刚跨过一条线:大家不再问怎么搭 agent loop,开始争论 loop 是怎么死的。今天热度最高的几条帖子都是解剖课——每一轮循环里藏着的五个隐形决策、生产环境里悄悄烧 token 的退化模式、以及为什么最后活下来的往往是「更简单但退出条件更硬」的循环。与此同时建造者们继续交付:一个从零用 CrewAI 搭出来的开源编码 harness 拿了 9 万阅读,一个在 OpenClaw 上全自主跑了四个月的 agent 给顶级开源项目交出了真实贡献,还有一位研究者随手列出了自己并行运行的十个 autoresearch 项目,从推理 DSL 到 SAT 求解器。教育层也在成形——湾区的 auto-research 黑客松把周边三个街区停满了车,NVIDIA 工程师提议用「Autoresearch Academy」取代 Jupyter notebook 式教学。
💡#1
@akshay_pachaar
https://x.com/akshay_pachaar/status/2078460229365408100
从零构建了一个 100% 开源的编码 harness,对标 Claude Code,底层用 CrewAI。文章把 harness 拆解得很清楚:模型只决定下一步,harness 负责规划、工具、记忆和安全。他的实现包括核心 agent loop、兼作外部记忆的文件工具、长任务规划、独立上下文的 subagent、一次性 VM 里的沙箱执行、人工审批环节和持久化检查点。这条拿了超过 9.1 万展示,还配了手把手的长文。
💡#2
@hanakoxbt
https://x.com/hanakoxbt/status/2078612797114527763
提出每一轮 agent loop 其实做了五个决策,而你只看得到最后一个:往上下文里装什么、调用哪个工具、结果到底有没有成功、要不要继续跑、给下一轮留下什么记录。输出只是第五个决策——bug 全藏在前四个里,包括那个凌晨三点烧光预算、没人写上限的重试逻辑。附带一个围绕循环、分支和崩溃后可恢复检查点构建的 GitHub 仓库。
💡#3
@jerryjliu0
https://x.com/jerryjliu0/status/2078524983748563370
LlamaIndex 创始人用三行话压缩了当前的前沿:在 agent harness 之上搭工作流图,再用一个外层 agent loop 动态生成这个图,然后重复。「人生是一个循环(也是一张图)」——外层循环生成内层结构的模式,正是好几个团队同时收敛到的方向。
💡#4
@_Mira___Mira_
https://x.com/_Mira___Mira_/status/2078589568362922125
一条回复里列出了十个并行运行的 autoresearch 项目:支持导向向量和回溯采样的 LLM 推理实验 DSL、验证一个 GPT-5.6 自称超过 Google 保密版本的 Shor 算法电路、一个用「法庭」人格群加法官蒸馏出 80 页证据卷宗的预测引擎、把 2020 年复刻 OpenAI Five 的项目连同每秒百万帧的精简引擎交给 Sol 继续跑、在 Verilog 和逻辑谜题族上训练 SAT 求解器模型、把神经网络「反编译」成人类可读的 DSL,还有用 Mistral 免费 Leanstral API 在电子结构预测算法上跑 autoresearch 循环。一个人,十个循环,全在转。
💡#5
@blelbach
https://x.com/blelbach/status/2078607919843811450
NVIDIA 工程师想为长时程智能体时代彻底重做 CUDA 教程:让学员直接面对 harness 和强模型而不是 Jupyter notebook,把学习摊到多天,布置没有唯一正确答案的开放式任务,聚焦概念和硬件原理。他提议在 GTC 办一个每天早上 90 分钟的「Autoresearch Academy」。1.1 万展示——教学体系正在围绕 harness 重建。
💡#6
@free_ai_guides
https://x.com/free_ai_guides/status/2078319950285217879
Cua 团队在 AI Engineer 大会演讲的高密度回顾。后台执行(agent 在一个窗口里干活,你继续用桌面)把通过率从 62% 拉到 80%,还省了 34% 的 token。在真实电气工程任务上,最强的 agent 25 题只全对 6 题,从空白原理图开始成功率直接掉到 0%——当前的 agent 只会修改,不会创造。他们还在信任评测前先派一批专门 reward hacking 的 agent 去攻破自己的环境,并用按需沙箱池喂饱 RL 训练中的 GPU。
💡#7
@nikskld
https://x.com/nikskld/status/2078469490011168827
把 agent loop 拆成三类,罕见地诚实:定时循环(OpenClaw 每天 7 点拉睡眠分数、天气、日历和新闻做晨报)、验证循环(生成、审查、重画——Anthropic 说的 evaluator-optimizer)、自我改进循环(在 Kaggle 任务上迭代到 89% 准确率,但他仍称「没什么实用价值」)。现实核查:MLE-bench 的 75 个真实 Kaggle 比赛里,最强脚手架只在 16.9% 拿到铜牌。迭代有用——又慢又贵。而那个每天省 20 分钟的定时器,一个下午就能上线。
💡#8
@luciocs
https://x.com/luciocs/status/2078614715538850046
收尾了一个为期四个月的实验:一个跑在 OpenClaw 上的完全自主 agent,用循环加 auto-research 持续构建并给开源项目做贡献,结果是顶级项目里真实合入的贡献。配套帖子解释这个 agent 以一个人格身份运行,拥有完全自主权和不限量 token,专攻 agentic coding 的记忆同步问题——这是目前公开报告中持续时间最长的自主 agent 实验之一。
💡#9
@camale0nrar0
https://x.com/camale0nrar0/status/2078492889060171941
说每周跑一次 SEO auto-research 已经是标配,真正的 alpha 在每天 diff 搜索结果:用 Claude Code subagent 加 cron 抓取排名前十的意图页面,写成 delta markdown。在三个项目上跑下来,发现产品页摘要在 AI overviews 上第一周到第三周漂移了 12%——这种信号每周一次的节奏根本抓不到。
💡#10
@JinjingLiang
https://x.com/JinjingLiang/status/2078551143656067410
AGI House 和 Orca 办的 auto-research 黑客松来的人太多,车把附近三个街区都停满了。一年前 autoresearch 还只是 Karpathy 的一个仓库,现在能把线下场地挤爆——湾区的 loop 建造者社区已经形成临界规模,这是最直接的信号。
💡#11
@ShehabAnwer
https://x.com/ShehabAnwer/status/2078530272589390224
在 GitHub 开源了 Agent-ProSAT:一个 agentic loop,专门编写程序化求解器来解 Alice-in-Wonderland 推理谜题,为 Nemotron Reasoning Challenge 生成可验证、token 高效的思维链轨迹。求解器生成的数据集已发布在 Hugging Face——用循环不是为了回答问题,而是为了制造经过验证的训练数据,这是个干净的范例。
💡#12
@lagerskoy
https://x.com/lagerskoy/status/2078463938388472288
描述了一套用 Kimi K3 演化整个交易策略群的系统:生成多个策略、评估、选出最强的、把赢家喂回下一代。循环之下是一群专业分工的 agent——一个找想法、一个构建特征、其他的做回测、验证、识别市场状态。几十代进化自动运行,不需要人逐步启动。他也点出了要害:自主循环放大坏假设的速度和放大好假设一样快,系统越独立,验证和干净数据越重要。
💡#13
@USArmyPhoenix
https://x.com/USArmyPhoenix/status/2078491788340293684
详细讲了一套三机本地 AI 集群:一台执行核心工作,一台负责改进和构建(包括造出全新的 agent 和 Modelfile),第三台跑效率和可靠性诊断。Llama 现在就能通过 Ollama 本地跑,Kimi K3 权重 7 月 27 日发布后补上长时程编码和工具调用。用 CrewAI 或 AutoGen 在局域网内编排——完全隐私、零持续成本,「改进机」在执行机干活的同时真的在造更好的 agent。
💡#14
@annopost
https://x.com/annopost/status/2078623927165984861
把开源的 Hermes Agent 和 Paperclip 组合成一个自我改进的多智能体工作流引擎:Paperclip 做编排层(经理),管组织架构、排期、预算和监控看板;Hermes 做自主专家(工人),执行任务并通过内置学习循环把经验沉淀成可复用的技能。经理-工人分离,技能在工人侧积累。
💡#15
@junfanzhu98
https://x.com/junfanzhu98/status/2078531903700037819
论证计算机使用智能体(CUA)就是迭代速度更快的机器人学研究:两者共享观察-理解-规划-行动-反馈的循环,但 CUA 能瞬间生成上千个环境并即时重置,机器人每次试验又慢又贵。最锋利的论断:评测才是瓶颈,下一条 scaling law 可能是评测的 scaling,而 CUA 可能成为递归自我改进的第一个实用平台——因为数字 agent 跑得起几百万次「执行-失败-分析-改进」,实体机器人跑不起。
💡#16
@prasad_pilla
https://x.com/prasad_pilla/status/2078399601204429210
在 Alan AI 给 agentic 工程团队开了一场「Loop Engineering」内部课:从手动提示 agent,转向工程化一个能自己规划、执行、验证、修复、停止的系统。健康的循环需要触发器、目标、上下文和工具、验证(「agent 说完成了不算证据——测试通过才是证据」)、以及停止条件。他对「有边界的自主」的定义:agent 可以改源码但碰不到密钥,重试两次就升级给人,开 PR 必须附带通过的测试。人类往上走一层——设计循环、审查证据,而不是写提示词。
💡#17
@m1rossgm
https://x.com/m1rossgm/status/2078557623478038635
说教人搭 agent loop 已经是新版「教你配 cron 任务」——这个原语本身已经无聊了。真正的课程是退化模式:三个循环串联时中间那个静默卡死、工具调用成功但模型理解错返回值继续跑、用重试掩盖上下文窗口不够的旧循环。大多数朴素循环失败得足够优雅,你要到生产环境烧 token 时才发现。他的结论:取代朴素循环的不是更聪明的循环,通常是一个更简单、但退出条件更硬的循环。
💡#18
@tooArr
https://x.com/tooArr/status/2078375522233426101
分享了他在 Cursor Ultra 计划上性价比最高的 agent loop 工作流:Grok 4.5 high-fast 做规划,Composer 2.5 fast 执行,Grok 4.5 审查,Composer 修正,循环往复,沿路沉淀经验。他把整个循环打包成了一个 Cursor 插件——贵模型规划、便宜模型执行的异构模型循环,被产品化成了工作流。
💡#19
@MalMposha
https://x.com/MalMposha/status/2078469958711792039
一个具体的便携 agent 架构:Mac Mini 留在家里跑 OpenClaw,通过 Telegram 连接;随身带一个小设备实时流式录音并转写,让 agent 每 30 分钟循环一次读转写稿、提取有价值的信息、发帖。agent 待在家里,出门的只有传感器。
💡#20
@lakshayverma__
https://x.com/lakshayverma__/status/2078595647805239635
用 Playwright 和 Puppeteer 探索浏览器自动化时撞上了真问题:控制浏览器容易,把浏览器状态表示给模型难——原始 HTML 和 DOM 树噪音大、token 重。最后落到 Vercel Labs 开源的 agent-browser 和它的无障碍快照:一棵只含相关元素、带可操作引用的紧凑树,让 observe-decide-act-verify 循环干净得多。他的结论:更好的浏览器 agent 可能不需要更大的模型,需要的是对浏览器更好的表示。
💡#21
@0x0SojalSec
https://x.com/0x0SojalSec/status/2078547602464026652
用一个简单代理把 ChatGPT 的 Codex 模型路由进 Claude Code 的「大脑」里跑:Claude Code 保留工具链、agent loop、文件操作、技能、subagent 和编排,GPT 提供推理和另一池配额。对撞到单家限额、又更喜欢另一家 harness 的人来说,这是份实用配方。
💡#22
@BTheriot2014
https://x.com/BTheriot2014/status/2078462903917928461
描绘了从循环到图的跃迁:循环让单个 agent 的行为可编程,图让整个 agent 组织可编程,动态图让这个组织能自我改进。他描述了一张运行中的作业图:研究、构建、控制、分发四类专业 agent 共享状态,底层是运行时重组触发器——性能信号、失败聚类、预算变化——能在任务进行中晋升模型、组建临时评审组、坍缩多余的分支。
💡#23
@vinicius2prg
https://x.com/vinicius2prg/status/2078464806219022769
主张你不可能预先为每种失败模式设计 agent loop——那样你会永远停在规划阶段。先上线简单版本,让它撞上真实的边界情况,再精确修补那一处。他在最近一个大型 Rust 重写项目里看着这一幕发生:在现实碰撞中活下来的循环,胜过白板上看起来完美的那个。
💡#24
@codependent_ai
https://x.com/codependent_ai/status/2078564831930753110
曾经想从零造自己的 harness,现在觉得没意义了:agent loop 已经可以用现成的开源原语拼出来,所以他们的项目 Resonant 从 harness 转型做客户端。论点是——差异化的不再是循环本身,而是团队很少认真构建的「关系层」。循环正在商品化,这是一个小而扎眼的注脚。
📡 生态产品雷达
生态产品雷达

OpenClaw ——个人自主循环的默认容器(自主开源贡献者、定时晨报、Telegram 连接的家用 agent)
Claude Code ——SEO delta 定时任务、代理 GPT 推理的首选 harness,也是 DIY harness 的参考设计
CrewAI ——爆款开源编码 harness 和多机本地集群共同的底层框架
Kimi K3 ——今天在演化交易策略群,7 月 27 日本地权重发布
Grok / Grok Build ——绑定文件夹的 agent loop,用户在要求扩展到 git 仓库之外
Hermes Agent ——经理-工人架构里的自主工人
Codex ——被路由进其他 harness 当推理半边的模型
← 上一篇
超级用户日报: 2026年7月20日
下一篇 →
灵感雷达: 2026年7月20日
← 返回所有文章

评论

加载中...
>_