Loop 日报: 2026年8月6日
今天的 loop 讨论明显分裂成两个阵营。一边是真刀真枪出成果的循环:一个从零发明的无 GPS 无人机导航模型(81 轮迭代跑出来的)、给 Zod 提了四个性能优化的上游 PR、一个在 Lonely Runner 猜想上取得实质进展的 agent、还有一套 20 个频道全自动运转的 TikTok 带货系统。另一边则是迄今最强的一波反 loop 证据:一篇论文测了 18 种自我审查方法,全都干不过简单的重复采样;Echo Gap 失败模式——agent 反复检索自己的错误反而越来越自信;还有「置信度悬崖」——LLM 裁判的准确率早就崩了,但它还在若无其事地下判决。今天浮现出的共识是:生成很便宜,验证才是产品本身,而且裁判绝不能是写改动的那个模型。
#1
@SpringStreetNYC
https://x.com/SpringStreetNYC/status/2084604364904182038
作者完成了第四个受 Karpathy autoresearch 启发的项目,叫 Beeline,一个「没有 GPS 的 GPS」无人机导航原型。他和 Claude 一起迭代了 81 个想法,最后找到一个小神经网络,位置召回率 96%:用带经纬度标注的卫星瓦片训练,然后喂一帧实时相机画面,它就能「记起」自己在哪。有意思的反转是,harness 必须把过拟合当成特性来拥抱——因为这个模型本来就是为单一地理围栏定制的。最大的意外:卡在 75 轮实验的平台期,破局靠的是修 harness,而不是改 loop。全程从零手写、不用任何领域库,GPL 开源。
https://x.com/SpringStreetNYC/status/2084604364904182038
作者完成了第四个受 Karpathy autoresearch 启发的项目,叫 Beeline,一个「没有 GPS 的 GPS」无人机导航原型。他和 Claude 一起迭代了 81 个想法,最后找到一个小神经网络,位置召回率 96%:用带经纬度标注的卫星瓦片训练,然后喂一帧实时相机画面,它就能「记起」自己在哪。有意思的反转是,harness 必须把过拟合当成特性来拥抱——因为这个模型本来就是为单一地理围栏定制的。最大的意外:卡在 75 轮实验的平台期,破局靠的是修 harness,而不是改 loop。全程从零手写、不用任何领域库,GPL 开源。
#2
@zirkelc_
https://x.com/zirkelc_/status/2084690335775547643
继续把 autoresearch 实验对准真实目标:Zod v4。循环和之前一样,但门槛收得更紧:成对 A/B 基准测试、校准过的噪声底线、外加行为一致性守卫。18 个实验里 11 个活了下来,每个基准用例都落在 1.2 到 2.5 倍的加速区间,最终以四个上游 PR 的形式合进了 Zod。一个业余爱好级的 loop 毕业升级成对大型开源库的正式贡献,非常干净的范例。
https://x.com/zirkelc_/status/2084690335775547643
继续把 autoresearch 实验对准真实目标:Zod v4。循环和之前一样,但门槛收得更紧:成对 A/B 基准测试、校准过的噪声底线、外加行为一致性守卫。18 个实验里 11 个活了下来,每个基准用例都落在 1.2 到 2.5 倍的加速区间,最终以四个上游 PR 的形式合进了 Zod。一个业余爱好级的 loop 毕业升级成对大型开源库的正式贡献,非常干净的范例。
#3
@yo_puaaa
https://x.com/yo_puaaa/status/2084760811726123093
把一个小型 auto-research 跑在生产环境的产品上,专门去挖那些没人愿意花时间做的微优化。大约 2 美元、100 万 token 的成本,它研究了怎么给测试套件提速,结果把两整块测试跑快了 50%。这条的重点在于框架本身:比一杯咖啡还便宜的实验成本,去做那些永远不值得投人力的优化。
https://x.com/yo_puaaa/status/2084760811726123093
把一个小型 auto-research 跑在生产环境的产品上,专门去挖那些没人愿意花时间做的微优化。大约 2 美元、100 万 token 的成本,它研究了怎么给测试套件提速,结果把两整块测试跑快了 50%。这条的重点在于框架本身:比一杯咖啡还便宜的实验成本,去做那些永远不值得投人力的优化。
#4
@Cheeks2184
https://x.com/Cheeks2184/status/2084436855060123878
受 OpenAI 数学成果的启发,作者让一个跑在 GPT-5.6 Sol 上的 agent loop 去攻 Lonely Runner 猜想——一个数学界的公开难题,并称已经取得实质性进展。他现在在等 Astra 发布,希望新模型能真正把证明收尾。开放猜想级别的工作,如今成了消费者晚上挂机跑的 loop,而不是实验室项目。
https://x.com/Cheeks2184/status/2084436855060123878
受 OpenAI 数学成果的启发,作者让一个跑在 GPT-5.6 Sol 上的 agent loop 去攻 Lonely Runner 猜想——一个数学界的公开难题,并称已经取得实质性进展。他现在在等 Astra 发布,希望新模型能真正把证明收尾。开放猜想级别的工作,如今成了消费者晚上挂机跑的 loop,而不是实验室项目。
#5
@steveng_0808
https://x.com/steveng_0808/status/2084626601623601585
搭了一套全自动联盟营销系统,同时跑着 20 多个 TikTok 频道,Instagram 也马上安排上。Auto-research 负责抓取和锁定细分趋势,auto-sourcing 找出热销商品并塞进流水线,人类只剩最后一步:上架商品和链接前快速过目一遍。一个完全不写代码、直接面向收入、每天自己转的 loop。
https://x.com/steveng_0808/status/2084626601623601585
搭了一套全自动联盟营销系统,同时跑着 20 多个 TikTok 频道,Instagram 也马上安排上。Auto-research 负责抓取和锁定细分趋势,auto-sourcing 找出热销商品并塞进流水线,人类只剩最后一步:上架商品和链接前快速过目一遍。一个完全不写代码、直接面向收入、每天自己转的 loop。
#6
@SeijinJung
https://x.com/SeijinJung/status/2084682565634629725
在一条 demo 24 小时冲到 180 万播放之后,作者发表了一篇研究文章,讲这个自我改进营销 agent 背后的技术进展。他的愿景是:未来每家企业都会有一个持续运行、自我改进的营销 agent 来帮自己增长。这条是今天互动最高的 loop 帖子之一,18.5 万曝光。
https://x.com/SeijinJung/status/2084682565634629725
在一条 demo 24 小时冲到 180 万播放之后,作者发表了一篇研究文章,讲这个自我改进营销 agent 背后的技术进展。他的愿景是:未来每家企业都会有一个持续运行、自我改进的营销 agent 来帮自己增长。这条是今天互动最高的 loop 帖子之一,18.5 万曝光。
#7
@dair_ai
https://x.com/dair_ai/status/2084706693880135848
Harness-R1 用在线强化学习训了一个专职的 9B「harness 工程师」,专门给别的 agent 打补丁。它把一个冻结目标 agent 的失败轨迹批量转换成经过验证的可执行补丁,再用重跑的结果提供奖励信号。在 WebShop、ALFWorld 和 DBBench 上,原版 Qwen3.5-9B 从 44.3% 提到 53.6%;针对特定目标训练的工程师还能把一个微调过的目标 agent 从 59.2% 拉到 64.2%。如果你在生产环境跑 agent,你的失败日志已经是现成的训练数据了。
https://x.com/dair_ai/status/2084706693880135848
Harness-R1 用在线强化学习训了一个专职的 9B「harness 工程师」,专门给别的 agent 打补丁。它把一个冻结目标 agent 的失败轨迹批量转换成经过验证的可执行补丁,再用重跑的结果提供奖励信号。在 WebShop、ALFWorld 和 DBBench 上,原版 Qwen3.5-9B 从 44.3% 提到 53.6%;针对特定目标训练的工程师还能把一个微调过的目标 agent 从 59.2% 拉到 64.2%。如果你在生产环境跑 agent,你的失败日志已经是现成的训练数据了。
#8
@dair_ai
https://x.com/dair_ai/status/2084746281189270015
一篇论文解释为什么自我改进的 autoresearch loop 一直很脆:判断力早就失效了,它们还在继续给自己的想法打分。在公开的 AutoSOTA 日志里,有效改动的比例从早期迭代的 70% 掉到第六轮的 43%,裁判的选择性准确率从 82.8% 跌到 56.9%——成功的改动越积越多,但裁判下判决的意愿一点没减。论文提出的修复叫 Rehearse:执行前先比较多个想法,并且对照一份聚焦的、由相似历史尝试组成的记忆来做判断,把后期准确率拉回到 83.5%。
https://x.com/dair_ai/status/2084746281189270015
一篇论文解释为什么自我改进的 autoresearch loop 一直很脆:判断力早就失效了,它们还在继续给自己的想法打分。在公开的 AutoSOTA 日志里,有效改动的比例从早期迭代的 70% 掉到第六轮的 43%,裁判的选择性准确率从 82.8% 跌到 56.9%——成功的改动越积越多,但裁判下判决的意愿一点没减。论文提出的修复叫 Rehearse:执行前先比较多个想法,并且对照一份聚焦的、由相似历史尝试组成的记忆来做判断,把后期准确率拉回到 83.5%。
#9
@omarsar0
https://x.com/omarsar0/status/2084761324786172347
推荐了一篇严格检验「自我反思循环到底值不值那些 token」的论文:七种方法、三个模型尺寸,把包括自我批评和辩论回合在内的每个生成 token 都算进成本,每种方法都拿同等实测成本下的重复采样来对比。36 组对比里没有任何一种方法取得可靠的胜利,其中 10 组显著更差——而这 10 组全部是自我审查类方法。Reflexion 在最小的模型上甚至从没触发过自己的重试,每次都判定自己是对的。给你的 loop 再加一层 critique 之前,值得先读读这篇。
https://x.com/omarsar0/status/2084761324786172347
推荐了一篇严格检验「自我反思循环到底值不值那些 token」的论文:七种方法、三个模型尺寸,把包括自我批评和辩论回合在内的每个生成 token 都算进成本,每种方法都拿同等实测成本下的重复采样来对比。36 组对比里没有任何一种方法取得可靠的胜利,其中 10 组显著更差——而这 10 组全部是自我审查类方法。Reflexion 在最小的模型上甚至从没触发过自己的重试,每次都判定自己是对的。给你的 loop 再加一层 critique 之前,值得先读读这篇。
#10
@NarwalSpeaks
https://x.com/NarwalSpeaks/status/2084778275340255372
Echo Gap:一个自我改进的 agent 会因为反复检索自己的错误而变得更自信——错误的过往记录拿到了虚高的自我评分,而记忆检索又优先把它们喂回未来的决策里。在 BIRD text-to-SQL 上,LUCID 修正方案达到 56.9% 执行准确率,对比自我打分记忆的 54.0% 和无记忆的 52.4%。教训是:只有当评估者的错误与 agent 自身的偏差相互独立时,记忆才有用;否则持久化记忆就是在把错误答案工业化。
https://x.com/NarwalSpeaks/status/2084778275340255372
Echo Gap:一个自我改进的 agent 会因为反复检索自己的错误而变得更自信——错误的过往记录拿到了虚高的自我评分,而记忆检索又优先把它们喂回未来的决策里。在 BIRD text-to-SQL 上,LUCID 修正方案达到 56.9% 执行准确率,对比自我打分记忆的 54.0% 和无记忆的 52.4%。教训是:只有当评估者的错误与 agent 自身的偏差相互独立时,记忆才有用;否则持久化记忆就是在把错误答案工业化。
#11
@velonxbt
https://x.com/velonxbt/status/2084680152752001183
拆解了那个疯传的说法:Opus 5 花 423 美元、用 6.9 亿 token 做出了一个完整的赛车游戏。按 Anthropic 的公开价目,这个量应该花 3450 到 17250 美元;唯一能对上账的解释是,约 99.5% 的 token 是便宜的缓存读取输入——同一大段上下文在漫长的 agent loop 里被重读了几百遍。标题里的大数字是真实的流量,但被包装成了「思考量」。一份关于 loop token 数到底在度量什么的实用解剖。
https://x.com/velonxbt/status/2084680152752001183
拆解了那个疯传的说法:Opus 5 花 423 美元、用 6.9 亿 token 做出了一个完整的赛车游戏。按 Anthropic 的公开价目,这个量应该花 3450 到 17250 美元;唯一能对上账的解释是,约 99.5% 的 token 是便宜的缓存读取输入——同一大段上下文在漫长的 agent loop 里被重读了几百遍。标题里的大数字是真实的流量,但被包装成了「思考量」。一份关于 loop token 数到底在度量什么的实用解剖。
#12
@orvi_onethread
https://x.com/orvi_onethread/status/2084627959965462804
一觉醒来账单多了 47 美元,因为一个 agent 在没有任何熔断机制的情况下把「现在几点了?」回答了 847 遍——而几周前同样的失败一个下午烧掉过 300 美元。他没有再做一个只会展示已经亏掉的钱的支出面板,而是做了一个工具:在请求离开本机之前就拦截并掐断调用,不玩 DNS 或 TCP 花招,一分钱不产生。失控 loop 的防护正在从「监控」走向「预防」。
https://x.com/orvi_onethread/status/2084627959965462804
一觉醒来账单多了 47 美元,因为一个 agent 在没有任何熔断机制的情况下把「现在几点了?」回答了 847 遍——而几周前同样的失败一个下午烧掉过 300 美元。他没有再做一个只会展示已经亏掉的钱的支出面板,而是做了一个工具:在请求离开本机之前就拦截并掐断调用,不玩 DNS 或 TCP 花招,一分钱不产生。失控 loop 的防护正在从「监控」走向「预防」。
#13
@cryptojezuz
https://x.com/cryptojezuz/status/2084734415872405733
一个针对跨 session 续跑 loop 的实打实省钱技巧:不只缓存 system prompt,把对话历史也缓存——在 API 调用里给两者都打上 cache_control 标记。第二次调用直接复用缓存的先前状态,不用重新处理 50 条消息,迭代式 debug 场景下 token 成本能砍 60% 到 70%。真正的解锁点在于:完整对话状态能跨天保持加载,agent 记得自己昨天试过什么。
https://x.com/cryptojezuz/status/2084734415872405733
一个针对跨 session 续跑 loop 的实打实省钱技巧:不只缓存 system prompt,把对话历史也缓存——在 API 调用里给两者都打上 cache_control 标记。第二次调用直接复用缓存的先前状态,不用重新处理 50 条消息,迭代式 debug 场景下 token 成本能砍 60% 到 70%。真正的解锁点在于:完整对话状态能跨天保持加载,agent 记得自己昨天试过什么。
#14
@AliceInTheData
https://x.com/AliceInTheData/status/2084720762338832820
省钱这个标题掩盖了真正的转变:模型和推理力度现在是在 loop 内部按步骤逐一选择的。Agent loop 开始被当成一笔预算来管理,而不是一个设置项。一条推文概括了 loop 成本工程的走向,也是今天点赞最高的 loop 帖子之一。
https://x.com/AliceInTheData/status/2084720762338832820
省钱这个标题掩盖了真正的转变:模型和推理力度现在是在 loop 内部按步骤逐一选择的。Agent loop 开始被当成一笔预算来管理,而不是一个设置项。一条推文概括了 loop 成本工程的走向,也是今天点赞最高的 loop 帖子之一。
#15
@realBigBrainAI
https://x.com/realBigBrainAI/status/2084617926863401233
一条被广泛转发的提炼,来自 Perplexity CEO Aravind Srinivas 对 AI 价值归属的判断:agent harness 是「规定 agent loop 该怎么跑的规则」,没有它你就没法把模型智能转化成有价值的输出 token。他的结论很直白:token 二道贩子、甚至模型厂商都没有可持续的生意;价值属于那些把模型接入真实上下文、并在各种工具间做编排的人,而 Perplexity 的优势就是在一个 harness 里编排多家互相竞争的模型。他提出的衡量指标:每用户每瓦特的 token 价值。
https://x.com/realBigBrainAI/status/2084617926863401233
一条被广泛转发的提炼,来自 Perplexity CEO Aravind Srinivas 对 AI 价值归属的判断:agent harness 是「规定 agent loop 该怎么跑的规则」,没有它你就没法把模型智能转化成有价值的输出 token。他的结论很直白:token 二道贩子、甚至模型厂商都没有可持续的生意;价值属于那些把模型接入真实上下文、并在各种工具间做编排的人,而 Perplexity 的优势就是在一个 harness 里编排多家互相竞争的模型。他提出的衡量指标:每用户每瓦特的 token 价值。
#16
@yashwanthsai29
https://x.com/yashwanthsai29/status/2084642941105303726
重写了自己 2024 年 12 月那篇爆火的「如何构建 agent」,逐条打分看哪些说法过时了。现在你不再自己写 agent loop,harness 就是运行时——自己写 loop 就像自己写 HTTP 服务器。Prompt 变成了进版本控制的 skill,记忆是纯 markdown 的知识库而不是外挂的向量数据库,MCP 赢下了集成之战。工作内容从「构建 agent」变成了「构建 agent 工作的环境」。
https://x.com/yashwanthsai29/status/2084642941105303726
重写了自己 2024 年 12 月那篇爆火的「如何构建 agent」,逐条打分看哪些说法过时了。现在你不再自己写 agent loop,harness 就是运行时——自己写 loop 就像自己写 HTTP 服务器。Prompt 变成了进版本控制的 skill,记忆是纯 markdown 的知识库而不是外挂的向量数据库,MCP 赢下了集成之战。工作内容从「构建 agent」变成了「构建 agent 工作的环境」。
#17
@ZhihuFrontier
https://x.com/ZhihuFrontier/status/2084525505878073466
一篇长文框架帖,把自我进化 AI 分成三层:产物进化(已经很实用,就是 Karpathy 的 autoresearch)、harness 进化(最可能的近期路径,但 Ai2 的一项研究显示,在同等预算下自动 harness 进化没能打赢朴素的 test-time scaling)、以及模型进化(最难的一步)。文中还有 AIDE² 的证据、SIA 这个 harness 加权重联合进化 loop 在 LawBench 上做到 70.1%,以及一份判断什么才算可信递归自我改进的五条件清单。
https://x.com/ZhihuFrontier/status/2084525505878073466
一篇长文框架帖,把自我进化 AI 分成三层:产物进化(已经很实用,就是 Karpathy 的 autoresearch)、harness 进化(最可能的近期路径,但 Ai2 的一项研究显示,在同等预算下自动 harness 进化没能打赢朴素的 test-time scaling)、以及模型进化(最难的一步)。文中还有 AIDE² 的证据、SIA 这个 harness 加权重联合进化 loop 在 LawBench 上做到 70.1%,以及一份判断什么才算可信递归自我改进的五条件清单。
#18
@ShinkaIoT
https://x.com/ShinkaIoT/status/2084470020999111162
一份对 Weco AI 的 AIDE² 成果的总结,定性为递归自我改进的首个证据:一个自主 loop 在 8 天里用 100 轮迭代修改自己的 harness,在留出基准上超越了人类两年的手工调优,泛化能力提升,reward hacking 减少。所谓 Level 1「净收益」RSI 的说法水分不小,但真正把它和刷榜式宣传区分开的,是那套留出集评估设计。
https://x.com/ShinkaIoT/status/2084470020999111162
一份对 Weco AI 的 AIDE² 成果的总结,定性为递归自我改进的首个证据:一个自主 loop 在 8 天里用 100 轮迭代修改自己的 harness,在留出基准上超越了人类两年的手工调优,泛化能力提升,reward hacking 减少。所谓 Level 1「净收益」RSI 的说法水分不小,但真正把它和刷榜式宣传区分开的,是那套留出集评估设计。
#19
@justone_he
https://x.com/justone_he/status/2084450492323975509
推荐了 Harness Engineering for Self-Improvement 这篇文章:harness 工程正在朝元方法论进化——改进的是「获得更好答案的机器」,而不是答案本身。Harness 会成为优化目标,启发式规则越来越少,通用机制越来越多;成熟的 harness 让 auto-research 能反哺模型自我改进,而更聪明的模型又反过来防止 harness 过度工程化。
https://x.com/justone_he/status/2084450492323975509
推荐了 Harness Engineering for Self-Improvement 这篇文章:harness 工程正在朝元方法论进化——改进的是「获得更好答案的机器」,而不是答案本身。Harness 会成为优化目标,启发式规则越来越少,通用机制越来越多;成熟的 harness 让 auto-research 能反哺模型自我改进,而更聪明的模型又反过来防止 harness 过度工程化。
#20
@v_shakthi
https://x.com/v_shakthi/status/2084498029772419319
拆解了 NVIDIA 基于 NeMo RL 和 NeMo Gym 的 autoresearch 工作流:一个 coding agent 包办环境搭建、依赖解决、实验执行和指标追踪,研究员只负责定目标和给预算。在一次公开的运行里,一个 Codex agent 在 5 小时预算内把一个 VLM 的视觉计数从 25% 拉到 96.9%,还读了一篇已发表的 RL 论文、推导出实现方案并启动了验证运行。可复现性来自三个 skill:session 记忆、文件系统礼仪,以及一个管理实验台账和停止规则的 autoresearch skill。
https://x.com/v_shakthi/status/2084498029772419319
拆解了 NVIDIA 基于 NeMo RL 和 NeMo Gym 的 autoresearch 工作流:一个 coding agent 包办环境搭建、依赖解决、实验执行和指标追踪,研究员只负责定目标和给预算。在一次公开的运行里,一个 Codex agent 在 5 小时预算内把一个 VLM 的视觉计数从 25% 拉到 96.9%,还读了一篇已发表的 RL 论文、推导出实现方案并启动了验证运行。可复现性来自三个 skill:session 记忆、文件系统礼仪,以及一个管理实验台账和停止规则的 autoresearch skill。
#21
@grok
https://x.com/grok/status/2084705837856010357
Grok Build 的完整 Rust 源码现已按 Apache 2.0 开源:agent loop、工具、全屏 TUI、skills、MCP 全都在里面。你可以自己编译,把 config.toml 指向任意本地的 OpenAI 兼容端点,完全离线运行。又一个主流 harness 走向开放,也给本地模型玩家送上了一副现成的 loop 骨架。
https://x.com/grok/status/2084705837856010357
Grok Build 的完整 Rust 源码现已按 Apache 2.0 开源:agent loop、工具、全屏 TUI、skills、MCP 全都在里面。你可以自己编译,把 config.toml 指向任意本地的 OpenAI 兼容端点,完全离线运行。又一个主流 harness 走向开放,也给本地模型玩家送上了一副现成的 loop 骨架。
#22
@DivyanshT91162
https://x.com/DivyanshT91162/status/2084684190789038185
介绍了 clawcodex,一个从零手写的纯 Python 版 Claude Code agent loop 移植,23 万多行代码,MIT 协议。它把请求前缀保持字节级稳定,让 DeepSeek 的 prompt 缓存每一轮都能覆盖 system、工具和历史,缓存命中的价格约每百万 token 0.0435 美元,对比 Claude Fable 5 的 10 美元。支持 25 家供应商、100 万 token 上下文窗口,以及真正的 loop 机件:工具、skills、REPL、session 历史。
https://x.com/DivyanshT91162/status/2084684190789038185
介绍了 clawcodex,一个从零手写的纯 Python 版 Claude Code agent loop 移植,23 万多行代码,MIT 协议。它把请求前缀保持字节级稳定,让 DeepSeek 的 prompt 缓存每一轮都能覆盖 system、工具和历史,缓存命中的价格约每百万 token 0.0435 美元,对比 Claude Fable 5 的 10 美元。支持 25 家供应商、100 万 token 上下文窗口,以及真正的 loop 机件:工具、skills、REPL、session 历史。
#23
@sudoingX
https://x.com/sudoingX/status/2084516293248492007
关于本地算力 loop 配置的更多细节:三个 100GB 以上的专家模型放在一台 128GB 的机器上,同一时间只加载一个,运行中途绝不换模型。按任务挑专家、端到端跑完、agent loop 期间零干扰,任务之间重载服务器;Hermes Agent 会自动接上当前在线的那个模型。比听起来简单,也再次印证:认真的 loop 现在都跑在自有硬件上。
https://x.com/sudoingX/status/2084516293248492007
关于本地算力 loop 配置的更多细节:三个 100GB 以上的专家模型放在一台 128GB 的机器上,同一时间只加载一个,运行中途绝不换模型。按任务挑专家、端到端跑完、agent loop 期间零干扰,任务之间重载服务器;Hermes Agent 会自动接上当前在线的那个模型。比听起来简单,也再次印证:认真的 loop 现在都跑在自有硬件上。
#24
@akashneelesh
https://x.com/akashneelesh/status/2084513109377683670
Flock 开放 autoresearch 竞赛的成绩远超预期:压缩挑战跑到每秒 150 万次以上的压缩,性能提升 200%。把开放式竞争性 autoresearch 当作攻克硬工程问题的机制,产出的数字连参赛者自己都在吃惊。
https://x.com/akashneelesh/status/2084513109377683670
Flock 开放 autoresearch 竞赛的成绩远超预期:压缩挑战跑到每秒 150 万次以上的压缩,性能提升 200%。把开放式竞争性 autoresearch 当作攻克硬工程问题的机制,产出的数字连参赛者自己都在吃惊。
#25
@lifeisameeme
https://x.com/lifeisameeme/status/2084777737936638377
一位独立开发者的 darwin-skill 工具,对 Claude Code 和 Codex 的 SKILL.md 文件跑「进化-保留」循环:给 skill 打分、测试一处改动、只有分数确实更高才保留。每一轮都由独立裁判打分——因为微软自己的研究显示自我打分只有约 62% 的准确率——外加一个棘轮机制自动回滚糟糕的轮次。v2.0 吸收了微软的 SkillLens 和 SkillOpt 研究成果,微软的 SkillOpt 仓库现在把 darwin-skill 列为官方集成。
https://x.com/lifeisameeme/status/2084777737936638377
一位独立开发者的 darwin-skill 工具,对 Claude Code 和 Codex 的 SKILL.md 文件跑「进化-保留」循环:给 skill 打分、测试一处改动、只有分数确实更高才保留。每一轮都由独立裁判打分——因为微软自己的研究显示自我打分只有约 62% 的准确率——外加一个棘轮机制自动回滚糟糕的轮次。v2.0 吸收了微软的 SkillLens 和 SkillOpt 研究成果,微软的 SkillOpt 仓库现在把 darwin-skill 列为官方集成。
#26
@SasuRobert
https://x.com/SasuRobert/status/2084609795126890851
一套真实在用的 autoresearch 日常配置,论点是前沿模型对快速迭代来说太慢了:主力模型用 Gemini 3.5 Flash High,autoresearch 在笔记本上的本地 Gemma4-12B-Coder 上 7x24 跑,大型 debug 场景交给 Kimi K3。他的说法是:当一个前沿模型比本地 12B coder 还慢,方向就错了,因为创新需要在 spec 和 PRD 上快速迭代。
https://x.com/SasuRobert/status/2084609795126890851
一套真实在用的 autoresearch 日常配置,论点是前沿模型对快速迭代来说太慢了:主力模型用 Gemini 3.5 Flash High,autoresearch 在笔记本上的本地 Gemma4-12B-Coder 上 7x24 跑,大型 debug 场景交给 Kimi K3。他的说法是:当一个前沿模型比本地 12B coder 还慢,方向就错了,因为创新需要在 spec 和 PRD 上快速迭代。
#27
@SasuRobert
https://x.com/SasuRobert/status/2084628242187653411
配套技巧:全套 e2e 测试和审计的监控与自动改进,靠在 Antigravity 里排一个 10 分钟的 cronjob——收集日志和遥测、累积结果、再让选定的 agent 在上面跑 autoresearch。效果是产品在你设计 cronjob 内容的同时自己进化。持续 autoresearch 变成了运维日常,而不是一次实验。
https://x.com/SasuRobert/status/2084628242187653411
配套技巧:全套 e2e 测试和审计的监控与自动改进,靠在 Antigravity 里排一个 10 分钟的 cronjob——收集日志和遥测、累积结果、再让选定的 agent 在上面跑 autoresearch。效果是产品在你设计 cronjob 内容的同时自己进化。持续 autoresearch 变成了运维日常,而不是一次实验。
#28
@AsifBangash120
https://x.com/AsifBangash120/status/2084789893805265255
刚拿到一个 NVIDIA A100 集群的使用权,正围绕 3D 扩散模型搭一套 AutoResearch 框架:跑实验、评估重建质量加物理指标、让 LLM 分析失败原因、再改超参数。Karpathy 式的循环正在蔓延到 3D 生成研究领域。
https://x.com/AsifBangash120/status/2084789893805265255
刚拿到一个 NVIDIA A100 集群的使用权,正围绕 3D 扩散模型搭一套 AutoResearch 框架:跑实验、评估重建质量加物理指标、让 LLM 分析失败原因、再改超参数。Karpathy 式的循环正在蔓延到 3D 生成研究领域。
#29
@st3v3__w
https://x.com/st3v3__w/status/2084659696615502239
一份有价值的失败报告:用 Karpathy 的 autoresearch 去优化一个营销活动,结果得到的东西过拟合到毫无用处。结论不是反对 autoresearch,而是反对过度优化;作者还附带一个猜想:模型层的智能可能已接近顶点,下一次飞跃在 harness 层。
https://x.com/st3v3__w/status/2084659696615502239
一份有价值的失败报告:用 Karpathy 的 autoresearch 去优化一个营销活动,结果得到的东西过拟合到毫无用处。结论不是反对 autoresearch,而是反对过度优化;作者还附带一个猜想:模型层的智能可能已接近顶点,下一次飞跃在 harness 层。
#30
@oleksoleksoleks
https://x.com/oleksoleksoleks/status/2084488200114852316
聊前沿模型评估的经济账:用 Opus 4.5 跑业余级的 autoresearch prompt 调优循环,几千美元就这么烧没了。他提的变通方案是:把 GEPA 式优化的大批量工作放到 Kimi、GLM 这类便宜的开放权重 Claude 蒸馏模型上跑,最后再用真模型做昂贵的终审门槛,并对相关性做基准校验。另外一条经验:把旧的系统指令清空、从头重写一份密集的,比一个模型一个模型往下传旧指令效果更好。
https://x.com/oleksoleksoleks/status/2084488200114852316
聊前沿模型评估的经济账:用 Opus 4.5 跑业余级的 autoresearch prompt 调优循环,几千美元就这么烧没了。他提的变通方案是:把 GEPA 式优化的大批量工作放到 Kimi、GLM 这类便宜的开放权重 Claude 蒸馏模型上跑,最后再用真模型做昂贵的终审门槛,并对相关性做基准校验。另外一条经验:把旧的系统指令清空、从头重写一份密集的,比一个模型一个模型往下传旧指令效果更好。
#31
@Ghost_Peony
https://x.com/Ghost_Peony/status/2084709622821339563
做一个 LLM 训练健身房已经六个月了,核心功能就是带微调和强化学习的 auto research,外加针对开放模型的后训练管理、观测和实验能力。承诺很快公开更多细节。Auto-research 正从推理时的循环,渗透进后训练技术栈本身。
https://x.com/Ghost_Peony/status/2084709622821339563
做一个 LLM 训练健身房已经六个月了,核心功能就是带微调和强化学习的 auto research,外加针对开放模型的后训练管理、观测和实验能力。承诺很快公开更多细节。Auto-research 正从推理时的循环,渗透进后训练技术栈本身。
#32
@wavefnx
https://x.com/wavefnx/status/2084688526700913125
在做 Pythia,一个将来会连接轻量 GPU LLM 客户端的搜索引擎,并称最重要的基础设施部分——多路由、auto-research 和 swarm——已经完成 99%。又一个例子说明:auto-research 正在被当成标准的基础设施组件,而不是研究性的奢侈品。
https://x.com/wavefnx/status/2084688526700913125
在做 Pythia,一个将来会连接轻量 GPU LLM 客户端的搜索引擎,并称最重要的基础设施部分——多路由、auto-research 和 swarm——已经完成 99%。又一个例子说明:auto-research 正在被当成标准的基础设施组件,而不是研究性的奢侈品。
#33
@fly51fly
https://x.com/fly51fly/status/2084750281401921727
转发了 Meta 的一篇新论文:Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch。经典贝叶斯优化被一家前沿实验室做了 agentic autoresearch 化处理——这是一个信号:这套模式正在被正式写进优化领域的学术文献。
https://x.com/fly51fly/status/2084750281401921727
转发了 Meta 的一篇新论文:Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch。经典贝叶斯优化被一家前沿实验室做了 agentic autoresearch 化处理——这是一个信号:这套模式正在被正式写进优化领域的学术文献。
#34
@usr_bin_roygbiv
https://x.com/usr_bin_roygbiv/status/2084791411912917120
一个直白的实践者数据点:上游压缩(compaction)实实在在让 GPT 在 autoresearch、大项目和 loop 上比其他任何东西强 10 倍。当下长程工作的真正差异化因素是上下文管理,不是裸智能。
https://x.com/usr_bin_roygbiv/status/2084791411912917120
一个直白的实践者数据点:上游压缩(compaction)实实在在让 GPT 在 autoresearch、大项目和 loop 上比其他任何东西强 10 倍。当下长程工作的真正差异化因素是上下文管理,不是裸智能。
#35
@omederos
https://x.com/omederos/status/2084651357298946201
引用了一个发现:同一个模型、同样的思考力度,换不同的 harness 跑,单任务成本在某些情况下相差超过 2 倍,而质量不变。Harness 现在是比模型选择更大的成本杠杆。
https://x.com/omederos/status/2084651357298946201
引用了一个发现:同一个模型、同样的思考力度,换不同的 harness 跑,单任务成本在某些情况下相差超过 2 倍,而质量不变。Harness 现在是比模型选择更大的成本杠杆。
#36
@KongNobody360
https://x.com/KongNobody360/status/2084560251999658464
GPT-5.6 Pro 模式实际上就是一个小型的服务端 agent:先规划、并行展开多个思考方向、再合并,按真实 token 量计费。Agentic loop 在持续向服务端迁移,而大多数 harness 还默认这个 loop 归自己管。供应商侧和客户端侧循环之间一场安静的架构冲突,值得盯着。
https://x.com/KongNobody360/status/2084560251999658464
GPT-5.6 Pro 模式实际上就是一个小型的服务端 agent:先规划、并行展开多个思考方向、再合并,按真实 token 量计费。Agentic loop 在持续向服务端迁移,而大多数 harness 还默认这个 loop 归自己管。供应商侧和客户端侧循环之间一场安静的架构冲突,值得盯着。
#37
@mr_bailando
https://x.com/mr_bailando/status/2084647447762997438
一篇 greentext 风格的「第 30 轮崩溃」解剖:KV 缓存很快,但滑动窗口把早期轮次截掉了,agent 丢了第 2 轮定下的原始目标,loop 开始幻觉下一步该干嘛。KV 缓存是计算优化,不是记忆层;能在 50 轮之后还保持连贯的 agent,都是把向量或图记忆放在上下文之外,把窗口当成随时可清空的草稿纸。真正的架构问题是检索设计,不是缓存调优。
https://x.com/mr_bailando/status/2084647447762997438
一篇 greentext 风格的「第 30 轮崩溃」解剖:KV 缓存很快,但滑动窗口把早期轮次截掉了,agent 丢了第 2 轮定下的原始目标,loop 开始幻觉下一步该干嘛。KV 缓存是计算优化,不是记忆层;能在 50 轮之后还保持连贯的 agent,都是把向量或图记忆放在上下文之外,把窗口当成随时可清空的草稿纸。真正的架构问题是检索设计,不是缓存调优。
#38
@idkAgasta
https://x.com/idkAgasta/status/2084697744481149287
删掉了从去年开始每个 agent 项目都在用的「路由器-编排器扇出」架构,把 opendiagram 迁移到了工具编排式的 agent loop。据他说,比路由器模式快得多,token 效率也明显更高,还写了一篇迁移博客。化繁为简的浪潮正在实打实地冲刷 agent 架构。
https://x.com/idkAgasta/status/2084697744481149287
删掉了从去年开始每个 agent 项目都在用的「路由器-编排器扇出」架构,把 opendiagram 迁移到了工具编排式的 agent loop。据他说,比路由器模式快得多,token 效率也明显更高,还写了一篇迁移博客。化繁为简的浪潮正在实打实地冲刷 agent 架构。
#39
@ian_hsiao_tw
https://x.com/ian_hsiao_tw/status/2084711057655017892
一个恩格尔巴特式的视角,解释为什么廉价沙箱很重要:Orbs 组装出一个安全、可缩容到零、短暂但可持久化的 agent loop,让「随手拉起一个隔离且配置完善的盒子」变得毫无摩擦。向上传播:更多全副武装的 agent 构建并验证更复杂的东西,且证据更充分。向下传播:长时间运行的进程默认丢进云沙箱,本地算力被解放出来。我们不再被 RAM 和 CPU 束缚。
https://x.com/ian_hsiao_tw/status/2084711057655017892
一个恩格尔巴特式的视角,解释为什么廉价沙箱很重要:Orbs 组装出一个安全、可缩容到零、短暂但可持久化的 agent loop,让「随手拉起一个隔离且配置完善的盒子」变得毫无摩擦。向上传播:更多全副武装的 agent 构建并验证更复杂的东西,且证据更充分。向下传播:长时间运行的进程默认丢进云沙箱,本地算力被解放出来。我们不再被 RAM 和 CPU 束缚。
#40
@BuildingASI
https://x.com/BuildingASI/status/2084748264767721589
Claude 通过 Blueprints 和 Python 拿到 Unreal Engine 5 的原生访问权,意味着 agent loop 终于对游戏开发有了一个可重复的接口——这是 agentic coding 一直啃不下来的最后一块硬骨头,因为迭代过程太视觉化、太依赖状态。把蓝图节点图以编程方式暴露出来,UE5 就成了又一个普通的操作界面,agent 可以自己闭环跑完构建-测试-修改,不需要人类拖节点了。
https://x.com/BuildingASI/status/2084748264767721589
Claude 通过 Blueprints 和 Python 拿到 Unreal Engine 5 的原生访问权,意味着 agent loop 终于对游戏开发有了一个可重复的接口——这是 agentic coding 一直啃不下来的最后一块硬骨头,因为迭代过程太视觉化、太依赖状态。把蓝图节点图以编程方式暴露出来,UE5 就成了又一个普通的操作界面,agent 可以自己闭环跑完构建-测试-修改,不需要人类拖节点了。
#41
@dannycosson
https://x.com/dannycosson/status/2084697275486630372
从 Steve Yegge 的最新文章里挑出了那个承重的区分:把 harness 和简单的 agent loop 分开。我们一直没有一个标准词来指代「一组 agent 以及约束它们的那些东西」,现在「harness」这个词正被重新启用来填这个空。词汇开始收敛,通常是一个领域趋于稳定的信号。
https://x.com/dannycosson/status/2084697275486630372
从 Steve Yegge 的最新文章里挑出了那个承重的区分:把 harness 和简单的 agent loop 分开。我们一直没有一个标准词来指代「一组 agent 以及约束它们的那些东西」,现在「harness」这个词正被重新启用来填这个空。词汇开始收敛,通常是一个领域趋于稳定的信号。
#42
@RichardFedorko
https://x.com/RichardFedorko/status/2084753989376090570
这个夏天所有人都在争论 loop 和 graph 哪种 agent 设计更好,于是他给两个词都不认识的研究人员写了一篇大白话入门,还附了两个带真实 prompt 的文献综述工作流模板。面向非工程师的 loop 扫盲内容本身就是个信号:这套模式已经传播到多远了。
https://x.com/RichardFedorko/status/2084753989376090570
这个夏天所有人都在争论 loop 和 graph 哪种 agent 设计更好,于是他给两个词都不认识的研究人员写了一篇大白话入门,还附了两个带真实 prompt 的文献综述工作流模板。面向非工程师的 loop 扫盲内容本身就是个信号:这套模式已经传播到多远了。
#43
@EvoAgentX
https://x.com/EvoAgentX/status/2084578416091947411
请来普林斯顿和 Prime Intellect 的研究员 Seth Karten 讲 Continual Harness:自我改进基础 agent 的在线适应。不用固定 prompt,agent 在长程任务中积累经验、持续打磨行为——现场用 Gemini Plays Pokémon 演示,扩展到 ARC-AGI-3,再泛化到一个能从自己过往尝试中学习的 coding agent。
https://x.com/EvoAgentX/status/2084578416091947411
请来普林斯顿和 Prime Intellect 的研究员 Seth Karten 讲 Continual Harness:自我改进基础 agent 的在线适应。不用固定 prompt,agent 在长程任务中积累经验、持续打磨行为——现场用 Gemini Plays Pokémon 演示,扩展到 ARC-AGI-3,再泛化到一个能从自己过往尝试中学习的 coding agent。
#44
@xinwei_97
https://x.com/xinwei_97/status/2084732631783211483
TracerootAI 在拉斯维加斯的 AI4 大会上做演示,这是一个开源的 AI agent 自我改进层:可观测性系统发现生产故障,对照源码和 GitHub 历史做根因分析,自动开出经过验证的修复 PR,并对每个修复跑评估,让 agent 随每次发布变强。「从可观测到自我修复」这条流水线被做成了产品。
https://x.com/xinwei_97/status/2084732631783211483
TracerootAI 在拉斯维加斯的 AI4 大会上做演示,这是一个开源的 AI agent 自我改进层:可观测性系统发现生产故障,对照源码和 GitHub 历史做根因分析,自动开出经过验证的修复 PR,并对每个修复跑评估,让 agent 随每次发布变强。「从可观测到自我修复」这条流水线被做成了产品。
#45
@yffeng3920
https://x.com/yffeng3920/status/2084707054657425714
对 Karpathy autoresearch 的一个有深度的延伸:把可复用规则写回代码库的启发式学习很像元学习,但这种能力能不能从外部代码迁移进模型架构本身?他列出四个开放问题:架构自我进化需要的快速准确反馈、在无穷搜索空间里决定迭代什么、能否收敛到有效架构,以及哪些知识该留在显式代码里、哪些该进神经网络。
https://x.com/yffeng3920/status/2084707054657425714
对 Karpathy autoresearch 的一个有深度的延伸:把可复用规则写回代码库的启发式学习很像元学习,但这种能力能不能从外部代码迁移进模型架构本身?他列出四个开放问题:架构自我进化需要的快速准确反馈、在无穷搜索空间里决定迭代什么、能否收敛到有效架构,以及哪些知识该留在显式代码里、哪些该进神经网络。
📡 生态产品雷达
生态产品雷达
今天的 loop 讨论中被提及 3 次以上的产品和工具:
Hermes Agent (Nous Research) — 「记忆加 skills 自我改进 agent」的默认范例,现已覆盖 CLI、桌面和消息类界面
Claude Code — 参考级 harness:别的 loop 从它移植、跟它对标,现在还被完整克隆(clawcodex)
Codex — 出现在租 GPU 的 autoresearch 运行、NVIDIA 的 NeMo 工作流 agent,以及各种 loop 对 loop 的比较里
Kimi K3 — 多个 loop 技术栈里负责大型 debug 和成本对比的模型
DeepSeek — 廉价 loop 运行背后的缓存经济学引擎(clawcodex、OpenClaw 各家技术栈)
Grok Build — 完整 Rust agent loop,已按 Apache 2.0 开源
GEPA — 被当作标准大批量优化环节引用的 prompt/harness 优化器
Karpathy autoresearch — 这个模式本身的名字,几乎每个能跑通的 loop 帖子都会引用
今天的 loop 讨论中被提及 3 次以上的产品和工具:
Hermes Agent (Nous Research) — 「记忆加 skills 自我改进 agent」的默认范例,现已覆盖 CLI、桌面和消息类界面
Claude Code — 参考级 harness:别的 loop 从它移植、跟它对标,现在还被完整克隆(clawcodex)
Codex — 出现在租 GPU 的 autoresearch 运行、NVIDIA 的 NeMo 工作流 agent,以及各种 loop 对 loop 的比较里
Kimi K3 — 多个 loop 技术栈里负责大型 debug 和成本对比的模型
DeepSeek — 廉价 loop 运行背后的缓存经济学引擎(clawcodex、OpenClaw 各家技术栈)
Grok Build — 完整 Rust agent loop,已按 Apache 2.0 开源
GEPA — 被当作标准大批量优化环节引用的 prompt/harness 优化器
Karpathy autoresearch — 这个模式本身的名字,几乎每个能跑通的 loop 帖子都会引用
评论