2026年8月22日loop

Loop 日报: 2026-08-22

循环正在悄悄吞掉模型。这周有意思的帖子都不是在争哪个前沿模型最聪明,而是:有人让 agent 过夜对着自己的仓库跑,有论文在戳「自我改进到底是不是真的」这个泡泡,以及一个越来越强的共识——真正产生复利的是模型外面那层 harness。一条贯穿全周的主线是:所谓「变好」其实好得可疑地容易造假。好几位研究者证明,自我改进的 agent 报出来的提升可能只是噪声或任务顺序的运气,而最厉害的一批开发者的回应是:去量 agent 实际做了什么,而不是它说自己做了什么。与此同时,autoresearch 正从写代码溢出到后量子密码学、安全研究和持续学习实验室。
💡#1
@kaiostephens
https://x.com/kaiostephens/status/2090504636620808429
一次真正野的自主运行:他把 Qwen3.8 Max 放在一个项目上去改进 autoresearch 加 prime agent,它连续干了四天,甚至衍生出这个项目的子 agent 去改进它自己。它按自己描述的三个阶段跑:先拉 50 多篇论文学完持续 harness 的一切,再把测试套件硬化到 141 个任务——覆盖记忆增删改查、回滚、每种压缩模式、崩溃/损坏/双重崩溃恢复、并行会话,然后在浏览器操作、写代码、LLM 优化上抛出大量任务去找缺陷。目前跑到测试 #817,硬盘塞满了,代码里他也能看出明显错误。但要点成立:他建议复制一个旧仓库、把 Qwen3.8 指向一个 autoresearch 循环去修你所有的问题,因为它做得比你想的更接近。
💡#2
@sebmarion
https://x.com/sebmarion/status/2090516734318887356
一个循环完整闭合的漂亮例子。他现在在自己的本地服务器上跑着一个完全自主的 autoresearch 循环。每天它拉最新的 Hermes 版本、跟他自己的改动合并、拉他的日志、找出问题和技能改进点,然后自动改进、自动测试、自动上线。日常循环里完全没有人参与。这正是所有人都在描述的「过夜自我维护」模式,真实地跑在一个人的配置里。
💡#3
@HyveMindx1
https://x.com/HyveMindx1/status/2090549063615955152
一个来自搭建 Anvaya 持久记忆引擎的犀利教训:他不再去问模型「刚才哪些取回的记忆有用」。注入上下文然后问「哪些记忆帮上忙了」听起来合理,但这种自我报告不可靠、也太粗,改进不了取回。于是 Anvaya 改从可观察的行为里学:如果一条记忆指向某个符号、而下一次编辑正好落在那,它就得分;如果 agent 拿到摘要后立刻重读文件,那条摘要就掉信心;任务失败则给每条贡献记忆扣分。这些信号汇成一个 Beta-Bernoulli 后验,让信任逐步累积。关键设计:这套反馈是 agent 循环自己发出的确定性运行时遥测,所以没法被跳过、被幻觉、或被模型影响。量行为,别量系统对自己的说辞。
💡#4
@CognosR
https://x.com/CognosR/status/2090507766968303739
一个关于真实 autoresearch 用量能有多重的直白数据点:他公司每个员工每月烧掉大约 40 亿 token。他们晚上跑 autoresearch,好第二天早上给他们个惊喜,循环就是评测、评测、测试、测试、测试,再加上读日志。他半开玩笑的收尾「祈祷没有 agent 逃逸」,一句话道尽了整个过夜自主的焦虑。
💡#5
@emilsnotes
https://x.com/emilsnotes/status/2090716789583851898
他深挖了为什么 Stripe 现在有 83% 的人每周用他们的内部 AI agent,答案不是模型,是检索。Stripe 的 Kai 接了 1000 多个内部技能和工具,难点从来不是 agent 循环,而是对某个问题决定 agent 能看到什么。编码 agent 很少撞上这个,因为仓库已经帮它把一切组织好了;而知识工作没有这种结构,所以 Stripe 建了一个检索层,在 agent 动手之前先挑对上下文。他在 200 多家公司看到的规律:agent 很少因为模型不够聪明而失败,而是因为拉进来错的上下文、然后 agent 就照着跑了。
💡#6
@CoreyGallon
https://x.com/CoreyGallon/status/2090792400713105738
一份关于 Sara Hooker 讲无梯度持续学习、以及 Adaption 的 Autoscientist 的高密度总结——它把训练模型这件事本身自动化了,从数据到对齐把整个循环协同优化。承重的细节是:只有当他们控制了数据质量它才有效;她直言其他 autoresearch 项目把数据交给 agent 自行决定,就拿不到回报。它在广度上胜过研究员,因为它横跨架构、规模、大量超参一次性搜索,用的是人类会犯怵的方式,而那 60%+ 的胜率其实是被一个停止规则封住的,不是天花板。她更大的判断:预训练规模已不再是最值钱的 scaling 轴,这重新分配了谁有资格去造前沿智能。
💡#7
@Pencheff_
https://x.com/Pencheff_/status/2090506807412408353
一个关于「在 harness 里训练而不是在合成 gym 里训练」的干净结果:微软的 Agent Lightning v1.0 把一个 9B 编码模型在 SWE-bench Verified 上抬高了 14.6 分,而没重建 agent。Qwen3.5-9B 从 41.8% 涨到 56.4%,6000 个样本,约 3500 行 MIT 代码,对 agent 循环零改动。他那句话最好记:gym 是谎言,harness 才是环境。你没有 agent 问题,你有 gym 问题。他也点出显而易见的安全坑:能合 PR 的 harness 也能跑不安全的工具,所以在奖励 rollout 之前先把工具路径卡住。
💡#8
@arpit_bhayani
https://x.com/arpit_bhayani/status/2090062914841403843
一个对所有在做「会改写自己技能文件或 prompt 的 agent」的人都真有用的警告:你会撞上经典的忒修斯之船问题。每一次自我编辑都替换掉原始规格的一块木板,改到一定次数你就分不清 agent 还在不在干它被造出来要干的事了。失败模式是漂移,而且无声:什么都没崩,每个补丁单看都没问题。他的护栏:把不可变的核心规格跟可变部分分开,让 agent 能改例子和措辞但绝不改目标;每次编辑要跟原始规格对 diff,而不是只跟上一版,否则累积漂移会被藏起来;每次编辑像 commit 一样版本化,带回滚路径。别阻止 agent 改进,但要保证任务的身份还活着。
💡#9
@simplifyinAI
https://x.com/simplifyinAI/status/2090136271985463569
一盆对自我改进 agent 很必要的冷水:Salesforce AI Research 的一篇论文提示,所谓「变好」可能只是噪声。基于记忆的 agent 把学到的写进一个文本库、下个任务再从里面拉,而报出提升的论文通常只跑一次、把最终分数当证据。当研究者用多次运行、把任务打乱成不同顺序来正经重跑两种成熟方法时,那点表面提升大多站不住,而且提升严重依赖任务顺序——默认顺序悄悄充当了隐式课程表。结论:如果一个产品路线图押在「越用越好」的 agent 记忆上,这个说法该被认真审视,而不是靠一次 demo 运行。
💡#10
@Oluwaphilemon1
https://x.com/Oluwaphilemon1/status/2090240808205123806
同一个问题的具体版本:他们用 GPT-5.6 Sol 去优化两个已有的 SWE-bench agent harness——分析失败、诊断模式、重写 worker 指令。一处改动把验证集表现翻了倍,然后一碰到没见过的任务,净提升为零。另一处改动在验证集上看着更弱,却在隐藏测试上表现更好。这就是自我改进真正的难点,一个例子说清:提升是真的还是运气?agent 是修好了问题还是过拟合了评测?优化 agent 很容易,知道它到底有没有变好才是难的那一半。
💡#11
@JonTeets005
https://x.com/JonTeets005/status/2090809216927768942
一份 Yan Shoshitaishvili 在 Black Hat 2026 主题演讲的总结,讲自主 agent 在漏洞研究里的应用,是这周最强的非编码 autoresearch 案例。属性感知的多 agent 工作流(不是那种给维护者灌满幻觉噪声的无结构 LLM 找 bug)在 OpenHarmony 里挖出几十个 0day,在 Linux 内核里挖出 1000 多个本地提权漏洞。但自主 agent 现在发现漏洞的速度大约是人类分诊、打补丁、上报速度的 10 倍,这把整个负责任披露模型给击穿了。他那个反直觉的观点:限制开源权重模型伤到防守方远比伤到攻击方多,因为正是这套 agent 流水线让人类能专注于威胁建模和搭建自我改进的评测框架。
💡#12
@beamnxw
https://x.com/beamnxw/status/2090388376444719470
一篇配得上热度的论文:它把记忆 harness 工程自动化了,去优化 LLM agent 怎么存和取上下文。结果是一个被发现出来的记忆 harness,把分类准确率提升了 7.7 个点,同时把上下文 token 用量砍了 4 倍。精妙之处在于外层循环用文件系统里的轨迹记忆去重写记忆取回代码本身:一个 agent 检视执行日志、发现被标签引导的查询策略、用纯 Python 重写上下文管理函数。当大多数开发者还在手调向量查询和 prompt 窗口时,这个把端到端的记忆工程通过自我改进的代码搜索自动化了。
💡#13
@so_sthbryan
https://x.com/so_sthbryan/status/2090291484390240465
一个对付自我改进里「静态基准陷阱」的漂亮方案:剑桥的研究者提出红皇后哥德尔机,让 agent 和裁判一起进化,而不是对着一个冻结的基准。它放弃了收敛保证、换来现实世界的鲁棒性,逻辑是:一个自我改进的模型对着静态测试集进化,最终只会去钻测试的空子。论文在 arXiv,代码一并放出。这直接回应了这周好几个帖子提的「所谓改进只是过拟合评测」的问题。
💡#14
@ArchiveExplorer
https://x.com/ArchiveExplorer/status/2090100563383836968
一份对 DeepSeek harness 的完整架构拆解,发布六天后把全部 226 个包都画出来了,每个数字都是从仓库里数出来的、不是从 README 抄的。最亮的发现:没有核心。agent 循环只是 core/agent-loop,一个配置行,跟你今早写的插件同级;54 个包是客户端,只有 8 个是核心。一条硬不变量把它拴在一起:模型可见即被记录,所以任何到达模型请求的东西都必须能从日志里重建。而当插件卸载时,注册会干净地回退,这是你能放心做实验、不永久改变运行时的唯一原因。
💡#15
@_vmlops
https://x.com/_vmlops/status/2090767911623475436
一份对 Claude Code harness 到底怎么设计的清晰拆解,核心论点是:agent 循环本身(调模型、跑工具、观察、重复)非常小。可靠性几乎不来自那个循环,而来自围着它的五个子系统:分层的 CLAUDE.md 指令、带过压缩熔断的五层上下文压缩流水线、四条干净的工具通道(skills、MCP、hooks、subagents)、一个管权限的 ML 分类器,以及阻止过早宣称「完成」的 hooks。subagent 跑在隔离的旁路文件里,所以子任务的上下文不会撑爆父循环,而会话是仅追加的,好支持恢复和 fork。他的结论:可靠性来自可重放的存储,而不是模型「记得更牢」。
💡#16
@cherry_mx_reds
https://x.com/cherry_mx_reds/status/2090855778697584698
一个关于循环里廉价胜利的犀利小点:他展示了一个 OpenClaw 自动化,因为一个确定性的预检查说「没事可做」,所以有 168 次它根本没跑。那是 168 次 agent 运行、模型调用、工具调用,直接没有发生。他的论点:你的 agent 循环在花 token 之前应该有一个便宜的确定性检查,而他很惊讶还有多少 harness 没有。
💡#17
@pauliusztin_
https://x.com/pauliusztin_/status/2090778448419864970
一份关于 agent 循环里怎么付推理费的实用拆解:他处理 1000 篇文档只花了约 $14.30 而不是 $97,纯靠改变付费方式。他的判据是「有没有人在等」:像 Claude Code、Cursor 这种交互式 harness 应该按 token 付,因为 3-5 分钟冷启动会毁掉体验;没人盯着的远程任务(领个 ticket、起个沙箱、开个 PR)应该在 serverless 上按 GPU 小时付;而异步卸载则让交互式会话把昂贵的后台任务丢到更便宜的按小时算力上。前台优化延迟,后台优化吞吐和成本。一篇难得把「推理付费架构」当成 agent 一等设计决策来对待的帖子。
💡#18
@stretchcloud
https://x.com/stretchcloud/status/2090329484939432362
一份关于编码 agent 正变成常驻基础设施的清醒解读,拿 Cursor 8 月 19 日的更新当最清晰的例子。云端 agent 现在会一直守着一个 /goal 直到达成、从 Slack/Linear/GitHub/PagerDuty 的事件里接活,subagent 跑在隔离 VM 上、各带一份干净的项目副本。他点出的转变:agent 不再是你打开的一个会话,而是一个对着你代码库运行的服务,这跟 Copilot Workspace、Claude Code、Codex 走的是同一个方向。而 Cursor 自己工程团队合并的 PR 里,35% 现在是自主云端 agent 写的——这是规模化的内部吃狗粮,不是 demo 数字。
💡#19
@EidolonNight
https://x.com/EidolonNight/status/2090613434307985543
一瞥把 autoresearch 当成个人思考工具:他把自己的想法交给 Hermes,让它在他睡觉时用一个魔改版的 Karpathy autoresearch 反复咀嚼。到早上他就能跟它进行一场有见地的对话,回到一个已经就这个问题干了一整晚的伙伴面前。一个很好的过夜循环的非编码用法:不是在出软件,只是比你独自能想的想得更远。
💡#20
@ethereumfndn
https://x.com/ethereumfndn/status/2090485714660302877
autoresearch 以一场真实公开竞赛的形态出现,而不是 demo:以太坊基金会发起了一个开放的 autoresearch 挑战,去推进后量子以太坊。参赛者带自己的 agent、harness 和 prompt 去推进 hash-based SNARK 数学的前沿,提交由 Lean 4 证明验证。胜者可分得基金会 100 万美元 Proximity 奖金的一份,项目与 zkSecurity 和 Eigen 一起、建在 Yukon 上。一个具体的信号:持续的 agent 研究网络正被信任去在硬核安全边界上取得真实进展。
📡 生态产品雷达
生态产品雷达
今天被提到 3 次以上的工具、框架和项目:
DeepSeek Harness (dsh)、Claude Code、Codex、Cursor、Hermes、OpenClaw、Pi、Qwen(3.8 Max / 3.5-9B)、Kimi K3、GLM、Agent Lightning、Mem0、MCP。
← 上一篇
超级用户日报: 2026-08-22
下一篇 →
灵感雷达: 2026-08-22
← 返回所有文章

评论

加载中...
>_