2026年7月21日loop

Loop 日报: 2026年7月21日

今天最清楚的一个信号是,autoresearch 已经不再专指写代码了,而是变成了:只要一个问题有可编辑的文件、又有可量化的分数,就能拿它来跑。有人通魔法门英雄无敌的 bot、有人跑 CUDA kernel、有人调机器人控制策略、还有人拿它优化自己的科研 harness。另一半讨论则往上走了一层,重点不是「这是我的 loop」,而是「loop 连跑好几天会在哪崩」——记忆、trace、确定性回放,以及判断模型到底该不该动脑子。工具本身已经白菜化了,真正有争议、有门槛的是围绕它们的工程纪律。
💡#1
@parfenchuk
https://x.com/parfenchuk/status/2078944720630247589
他本想看看 LLM 打一整局魔法门英雄无敌 III 的水平如何,但逐回合下太慢,于是干脆让模型去 autoresearch 这些 bot:在 300 局测试对战里迭代一个脚本 bot,再把产出的 bot 拉进联赛互打。结果 GPT-5.6 Sol 在 xhigh 下拿金,GPT-5.5 xhigh 拿银,Claude Opus 4.8 high 拿铜。这是整个趋势最干净的一次体现:模型不是在打游戏,而是在写和打磨那个负责打游戏的东西。Fable 则以太危险为由拒绝接这活。
💡#2
@yacineMTB
https://x.com/yacineMTB/status/2078817976153682256
他在自己业余机器人的 autoresearch 环境里,让 GPT-5.6 Sol 给正在训练的控制策略整点新花样,结果在等一个十小时的超参搜索期间,模型没闲着,自顾自地去翻 bug、无人提示地改进整个代码库。这种空闲期的行为才是真正的产品价值:一个 agent 不把长任务当成等待,而当成把其他一切变得更好的免费时间。这就是 autoresearch 从模型层渗进普通机器人工程的一个例子。
💡#3
@kazani351
https://x.com/kazani351/status/2078817494559776964
一段藏在 newsletter 里的短话,抛出了今天最锋利的一个说法:某个 AI 实验室让 autoresearch 跑自己跑了八天,做出的科研 harness 比两年手工调优的还好。就算只是大致属实,这也正是大家一直在理论上念叨的递归自我改进——只不过它不是以宣言的形式出现,而是作为一个运维结果被交付出来。harness 改进 harness,才是真正要紧的那个 loop。
💡#4
@dobleio
https://x.com/dobleio/status/2078796383725781110
他从最近一次中国模型发布里读出一层不太隐晦的意味:他们用类似 autoresearch 的方法优化 GPU kernel,而且专门针对 H200(在中国被严格限制)以及某个替代厂商的 GPGPU 做了优化。他的解读是,对 kernel 做 autoresearch 现在成了地缘工具,是对 CUDA 护城河的一次进攻——因为只要 loop 能把 kernel 重定向到你实际买得到的任意芯片上,厂商锁定就会被削弱。这是难得一次把 autoresearch 当产业战略而非开发玩具来读的视角。
💡#5
@RRicefan
https://x.com/RRicefan/status/2078707122553159980
他从一场 auto-research 黑客松里带出两条来自前 OpenAI VP 和一位 Meta 研究员的经验:现有 benchmark 饱和得太快,以及 auto-research agent 应该去推理该做什么,而不只是怎么做。他把这一点直接接到一个非编程领域:他们的量化交易 evals 恰好提供了这些——一个不会饱和的市场,加上一个用于构思和探索的策略生成 gym。难点在于问题选择而非执行,这个洞见是今天关于 loop 说得最有用的一句。
💡#6
@ThePeelPod
https://x.com/ThePeelPod/status/2078920470687006883
他给自我改进的 loop 立了一条承重论点:一条你无法确定性回放的轨迹,是没法改进的。如果 trace 是和基础设施分开记录的,你就没法重跑第 1 到第 18 步、改掉第 18 步、再看结果有没有变好。把 trace 生成直接烤进 step 函数本身,可观测性就成了基础设施的衍生物,于是你能分叉路径、在 20% 用户上 A/B 两个 harness 改动、并在更低的 token 成本下确认同样的结果。自我改进是基础设施的一个属性,而不是外挂上去的东西。
💡#7
@learningPikachu
https://x.com/learningPikachu/status/2078864053351702814
他反驳了一场把公司建模成一堆自我改进 loop 的演讲,给出两条要紧的架构性修正。公司的记忆不是一颗大脑,而是个人记忆与关系记忆之和;真正算数的 loop 也不是单 agent,而是多 agent 的,策略、信任和效率都是在边缘处被协商出来的。这只是条短评,却把整个「公司即 loop」的想法重新框成了一个记忆与协商问题,而非一个 prompt 问题。
💡#8
@adxtyahq
https://x.com/adxtyahq/status/2078745000763064345
他把一家创业公司的 LLM 成本砍了 65-70%,从每次 prompt 3-4 美元降到 1-1.5 美元,机制是一个 agent loop,而非调 prompt。一个 prompt 分类器按范围和复杂度路由,让简单请求绕开贵模型;请求被拆成一个个 feature,每个跑 generate-test-regenerate 直到通过校验;生成是逐文件进行而非一把梭。之后才由另一个 agent loop 跑工具调用和校验,再流式输出。第一次尝试其实还把成本搞得更糟(每次 prompt 5 美元),花了好几周重建才降下来——一个有用的提醒:loop 工程是迭代的,也会倒退。
💡#9
@reksas13
https://x.com/reksas13/status/2078706611460120767
他借化学来给正在发生的事命名:自催化,即产物会加速自己所在的反应。LangChain 的第四个 agent loop 正是如此——trace 喂给一个 agent,这个 agent 再改写自己的 harness,于是 loop 会复利式滚起来。这只是一句话的框定,却是最贴切的心智模型,能解释为什么自我改进的 loop 感觉和普通自动化不一样:它的输出会让下一次运行更快。
💡#10
@stretchcloud
https://x.com/stretchcloud/status/2078812095257498019
他记录了一个浏览器自动化模式,本质上是一个自我搭脚手架的 loop:agent 控制浏览器执行一次动作,同时把每个网络请求录进一个 HAR 文件,再从抓到的流量里推导出一个带类型的 API client,之后每次交互都彻底绕开浏览器。演示是用 GPT-5.6 Sol 在 3.5 秒内造出一个 Uber Eats CLI,全程看不到浏览器。更深一层的意思是,agent 正在变得擅长替换自己的脚手架——发现阶段用昂贵灵活的工具,执行阶段用便宜可靠的 client,这正是老练工程师的做法。
💡#11
@ThibaultJaigu
https://x.com/ThibaultJaigu/status/2078828583716544699
他抛出一张真正令人意外的图:在 agent loop 中间,Kimi K3 比上一代想得更少,平均只用 120 个 reasoning token,但面对一个全新的用户 prompt 时会跳到 2,269 个。这是 19 倍的跨度,而 K2.7 只有 3.7 倍。模型学会了不出于习惯地思考,只在值得时才花推理,这正是你想要的长 loop 里的行为——毕竟每一个被浪费的 reasoning token 都会在几十次调用里被成倍放大。
💡#12
@Okeha1810
https://x.com/Okeha1810/status/2078733115791417570
他最大的代码改进策略,是一个会交叉验证任何生成计划的对抗式 agentic loop,被打包成了一个自定义 skill。这只是条小帖,却是本周一个清晰模式的一部分:杠杆最高的 loop 不是写代码那个,而是在任何代码写出来之前就试图把计划撕碎那个。把对抗式自审做成可复用的 skill,就是「judge 才是产品」这句话的实践版本。
💡#13
@ZeroDayDevApp
https://x.com/ZeroDayDevApp/status/2078985865423196489
他用 Harbor 框架在终端 evals 上测试 agent,结论是真正的工作在于上下文管理和工具调用的纪律,而不在模型。有状态的 websocket 只是传输层;真正的问题是 agent loop 有没有强制最小权限的工具访问,还是默默假设模型会一直小心。这是一个很接地气的提醒:大多数 agent loop 的失败是 harness 的失败,而非智能的失败。
💡#14
@D0xedDevi0
https://x.com/D0xedDevi0/status/2078678448038375644
他讲了自己搭的那套 agent 大脑:一个与厂商无关的 Hermes 风格 agentic loop,把 Hermes 的 XML tool_call/tool_response 块与可开关的 reasoning、以及 JSON/schema 模式交织在一起。这是一份很具体的工程记录,讲的是自己撸一个 loop 而不是套用框架,而与厂商无关这一点是最有意思的选择——让 loop 独立于任何单一模型厂商,正是本周整个生态都在冒出的那股可移植性本能。
💡#15
@AndJakobsson
https://x.com/AndJakobsson/status/2078804498374447343
他把 OpenClaw、LangChain 和 Hermes 的对比做成了一棵靠玩来解锁的能力树,形状很能说明问题。LangChain 那棵从 agent harness 和工具调用一路延伸到 RAG、编排和 middleware;OpenClaw 那棵全都围着网关转——channel 插件、会话隔离、人格、路由;Hermes 那棵则是自我改进的自主 agent——持久记忆、会话搜索、agent 给自己写的 skill 文档、execute_code 和子 agent 委派。这是一个很干净的方式,让你看清这三个所谓「agent」工具其实在解三个完全不同的问题。
💡#16
@cheese_big80393
https://x.com/cheese_big80393/status/2078753499786186829
这是给所有 loop 狂热最诚实的一记回击:他这版 AI 精神病,是想把自己日常做的每件事都变成一个 agent loop,然后花上几个小时几天在改进它上兜圈子,最后又几乎不用它的产出。这只是条随手回复,却点破了 autoresearch 时刻真正的失败模式:loop 变成了爱好而非工具,打磨 loop 这件元工作悄悄挤掉了它本该服务的那件正事。
📡 生态产品雷达
生态产品雷达

Claude Code 和 Codex 仍是大家把 loop 包在外面的默认 harness。Hermes 被反复当成自我改进 agent 的那个选项(持久记忆、自写 skill、子 agent 委派)。LangChain 因其第四个会改写自己 harness 的「自催化」agent loop 被点名。Kimi K3 因逐 loop 自适应推理而受关注。而 AGI House 则持续举办 auto-research 黑客松,这套方法论有很大一部分正是在那里公开地被打磨出来的。
← 上一篇
超级用户日报: 2026年7月21日
下一篇 →
灵感雷达: 2026年7月21日
← 返回所有文章

评论

加载中...
>_