2026年7月30日loop

Loop 日报: 2026年7月30日

autoresearch 这周不再停留在理论上。Eigen Labs 和 Poolside 把一个开源模型变成了一个公开的优化循环:把 agent 指向 Laguna XS 2.1 在 Mac 上的推理,每一个被验证过的提速都会变成下一个人的新基线,agent 在第一天就找到了快 36.8% 的推理,还有一位参赛者做到了 41.3% 的提速。但更犀利的讨论发生在这场发布的底下,是关于循环到底会在哪里断掉。谁都能让 agent 过夜跑,可整件事只有在验证比生成更便宜、指标又没法被钻空子时才会收敛。人们也终于开始把三样以前混为一谈的东西分开:会重复的那个循环、循环外面那张 agent 组成的图、以及真正去碰现实的那层 harness。
💡#1
@eigenlabs
https://x.com/eigenlabs/status/2082121770413576225
Eigen Labs 与 Poolside 联合推出了 MLX.fast,这是一场开放的 autoresearch 竞赛,把 Laguna XS 2.1 在 Apple Silicon 上的推理变成了一个共享的优化循环:任何人都可以提交一个优化方案,每个结果都会被基准测试,而每个被验证的加速都会成为下一轮的新基线。他们称,在竞赛正式开放之前的头 24 小时里,智能体就已经找到了让推理快 36.8% 的方案。这是一个具体而公开的例子,展示了众包 autoresearch 如何在一个开放权重模型上运行。
💡#2
@zeeshan_utd
https://x.com/zeeshan_utd/status/2082204915804590350
作者称自己登上了 MLX.fast 排行榜,在 Mac 上为 Laguna XS 2.1 实现了 41.3% 的推理加速。他把这套机制描述为一场公开的 autoresearch 竞赛:让智能体对准 MLX 推理引擎,测试各种优化,再拿到共享基准上去提交。每一个新的基准都会成为供下一个人继续叠加的公开基线,于是整件事就不断复利式增长。
💡#3
@SasuRobert
https://x.com/SasuRobert/status/2082192589713797598
作者在一台笔记本上跑着一个持续运行的 autoresearch 循环:一个定时的 cron 任务把 autoresearch 和遥测的日志取出来,交给编排智能体去阅读日志、寻找对被审计代码的改进,如此周而复始。他表示在一边写代码、一边跑 Docker 和测试的同时,Gemma 4 12B coder 仍能稳定保持 80 tokens/sec,每天处理数百万 token,并具备完整的 RAG、上下文管理以及多个智能体之间的共识机制。这生动地描绘了一个自运行的自我改进循环。
💡#4
@zirkelc_
https://x.com/zirkelc_/status/2082025839915593943
作者借鉴 Karpathy 的 autoresearch 思路,用一种迭代方法来提升一个名为 chunkdown 的工具的性能。智能体自行收集数据集、搭建了基准测试框架,并围绕小而独立的改动迭代了约 1.5 小时,把初始结果提升了 13.6%。作者随后反思是否应该丢弃这些改动,换一个模型、用多子智能体的工作流重新跑一遍实验,把它当作一次真正的实验而非一锤子买卖。
💡#5
@omarsar0
https://x.com/omarsar0/status/2082161529600741441
作者认为编码智能体非常适合科学计算,但目前你还没法单靠 autoresearch 就一路自动得出有用的发现。实际操作中,他们仍然发现自己要密切地引导、并与研究智能体紧密协作,而不是任由循环无人看管地跑下去。核心结论是:要让 autoresearch 产出真东西,领域专业知识依然至关重要。
💡#6
@banteg
https://x.com/banteg/status/2081963364058567040
作者把匹配式反编译描述成一个非常契合 autoresearch 形态的编码智能体问题:把二进制切成一个个函数,判断出确切的编译器版本,把每个函数当作独立的谜题去解,解决链接问题,最后再回环生成出完全相同的可执行文件。这大约要多花 10 倍的时间,但能得到一个可信、可验证的原始源码形态,并且能百分之百确信反编译结果完全正确。这是一个带有强验证信号的具体 autoresearch 式循环。
💡#7
@Sebfox1
https://x.com/Sebfox1/status/2082122252544290900
作者做了一个叫 iterate 的工具,把它称为面向文本的 autoresearch:Karpathy 的 autoresearch 是针对验证损失来优化代码,而 iterate 对策略备忘录、提案、文章之类的文档做同样的事,只是它不用一个数值指标,而是用一组有着相互冲突立场的具名评审角色。它是一个很小的单文件 Python 程序,作者把它定位为把 autoresearch 循环带进写作领域。
💡#8
@hugobowne
https://x.com/hugobowne/status/2082228457367589040
作者把长时间运行的智能体的核心问题概括为:在你让一个智能体连跑数小时之前,它能否篡改那个给它打分的东西?如果它能改写测试、改动指标,或者只挑它能通过的例子,那么迭代越多只会让结果看起来更好,却并没有让它更正确。这是一堂关于 autoresearch、Ralph Wiggum 式循环、长时间运行的智能体,以及让它们真正有用的验证边界的课。
💡#9
@goon_nguyen
https://x.com/goon_nguyen/status/2082166007863668930
作者反驳那种鼓吹编码智能体能在你睡觉时跑上 100 轮迭代的炒作。如果你连停止条件都说不清、无法审阅 diff、也解释不了为什么测试就能证明成功,那你自动化的其实是抽卡,而不是工程。关键洞见是:只有当验证的成本比生成更低时,这个循环才会收敛。这是一条犀利、值得引用的规则,用于构建可信赖的 autoresearch 循环。
💡#10
@elune0x
https://x.com/elune0x/status/2082133200386555918
作者认为循环其实是智能体系统里最小的一环,并厘清了团队常混为一谈的三件事:loop engineering 掌管重复(重试、预算、退出、无进展检测);graph engineering 掌管拓扑(节点、边、分支、检查点);harness engineering 掌管现实层面(工具、权限、记忆、沙箱、评测、追踪、人类介入)。他勾勒出这种嵌套关系:提示词位于循环之内,循环位于图之内,而图又位于 harness 之内。
💡#11
@Sprytixl
https://x.com/Sprytixl/status/2082141082708578660
作者把 Anthropic 的智能体指南提炼成一套把循环变成可靠多任务助手的原则。他指出大多数任务其实根本不需要智能体(一次调用、一个工作流、还是一个智能体要分清),约 60% 的失败源于工具写得含糊不清,在上下文里给三个相关工具胜过塞五十个,以及在没有轮次上限的情况下,一个智能体可能一夜之间就烧掉 $10,000 而你毫无察觉。这是一份关于循环设计与停止条件的高密度方法论总结。
💡#12
@chrsaravia
https://x.com/chrsaravia/status/2081950259501035595
这是作者构建个人 AI 智能体 Sara 的第 67 天,梳理了从 prompt 到 context 再到 loop、graph engineering 的演进路径。他把 loop engineering 解释为让单个智能体去做事、自检、改进并反复循环;再把 graph engineering 解释为针对一个商业决策,把工作拆分给多个并行的专家智能体(客户问题、竞争对手、定价、风险、一个合并步骤、一个独立评审、外加人类审批)。这是来自逐日实践、脚踏实地的动手方法论。
💡#13
@NFTMansa
https://x.com/NFTMansa/status/2082083242254147699
作者分享了一个安全地循环运行智能体的具体配方:给每个生成的函数设定 token 上限,在隔离的子进程里测试它,只把通过测试的部分拼装起来。他称在一台 8GB 内存的笔记本上,用一个 1.5B 模型以这种方式搭出了一个 CLI 应用七个部件中的六个。这是一个小巧、可复现的循环模式,并附带了在普通硬件上量化出来的结果。
💡#14
@Egnyte
https://x.com/Egnyte/status/2082150848805622085
作者讲解了他们如何通过教智能体少做事来让生产环境中的 AI 智能体更快:把 ReAct 循环压平,按需加载领域知识而非一次性全部塞入,并且用 bash 动词来给工具命名以便模型更快挑选。这被定位为让智能体式搜索变快的生产经验。这是对一个真实的、运行在生产环境中的智能体循环所做的具体工程优化。
💡#15
@arseniycodes
https://x.com/arseniycodes/status/2082134550788948292
作者上线了一个 Sentry 集成,让一个 bug 智能体自动修复每一个新出现的问题。噪声会被打上标签,而每一次 PR 评审都会提升准确率并产生新的智能体记忆,于是这个循环不断复利式增强。这是一个真实的、能自我改进、持续积累记忆的调试循环,直接接入了生产环境的可观测性,而不是一个演示。
💡#16
@MikkoH
https://x.com/MikkoH/status/2082108445885366295
作者描述了一个日常使用的简单智能体循环:一个守护进程盯着他们的 PR,自动把评审者的评论变成修复 PR。他们只花一点时间审查这些修复,而把更多精力放在合并前对整个 PR 的把关上。这是一个开销很低、却真正在运转的自我改进代码工作流。
💡#17
@sudoingX
https://x.com/sudoingX/status/2082218585821475075
作者对比了 LangGraph 与一个 harness(Hermes Agent):用 LangGraph 你得自己搭建并盯着循环,而用 harness 你只需给它一个 /goal,让 harness 自己掌管循环、把它跑在一个 tmux 会话里,之后再回来查看即可。他的结论是,这意味着更少的控制权,但要操心的东西也少得多,而且 harness 处理循环的效果比手工接线更好。这是对不同循环管理方式的一次具体对比。
💡#18
@borakaizen
https://x.com/borakaizen/status/2081981330774978573
作者讲述了他们的第一个智能体写出了一份方案,却没发现发布某个 API key 会暴露每一位用户的邮箱。而在一个全新会话、没有任何共享上下文的情况下,第二个智能体只跑了一遍就抓到了这个问题——它把方案对照实际代码读了一遍。这是一个具体的例子,说明多智能体评审循环能抓出单次执行漏掉的致命缺陷。
💡#19
@zhangzhixin2333
https://x.com/zhangzhixin2333/status/2082250487848472925
作者分享说,在他们的 factor agent(量化因子发现)里,保留失败的尝试以及确切的被拒原因,比单纯生成更多点子更有用。他抛出一个问题:在反复失败之后,这个循环是否应该允许智能体自行改变搜索方向。这是一个具体的 autoresearch 循环洞见,讲的是对失败的记忆如何引导探索。
💡#20
@flyingpetal472
https://x.com/flyingpetal472/status/2082120049914232928
作者称自己刚把 Kimi K3 接入了他们的 autoresearch 流水线,并且很想加入进来,只是工作还没完成、论文也还不能公开。这是一个简短却具体的信号,表明有人把一个新模型换进了既有的 autoresearch 循环里用于研究工作。
💡#21
@FLYingBanger
https://x.com/FLYingBanger/status/2082070214410215859
作者详解了基于 Karpathy 的 gist 搭建的 LLM Wiki 方案:Obsidian 以纯文件形式保存所有内容,Claude 通过 MCP 一次性接入,而六条每日命令中包含一个针对某个主题的 /autoresearch,外加一个用于检查矛盾和过时论断的 lint 步骤。回报是一个早上 7 点的自动驾驶流程,会在你醒来之前检查这个知识库、归档新笔记并标出过时内容,每周还会做一次完整审计来揪出矛盾之处。这是一个具体的、跑在知识库之上的个人 autoresearch 循环。
💡#22
@khoi_danny
https://x.com/khoi_danny/status/2082175288532955338
作者正在公开构建 agentic-browser,一个从零打造的开源智能体浏览器。里程碑 M1 已上线,采用 Playwright Chromium 后端(goto 加 extract_text)并打通了一条实时的端到端路径,如今他们正在推进 M2 的规划器工作:目标分解、利用观察得到的可交互目标、对被拦截的步骤做软失败处理,以及更丰富的执行凭据。这是一个真实且公开发布的浏览器智能体循环。
💡#23
@wilsonguenther0
https://x.com/wilsonguenther0/status/2082162718530830632
作者描述了一套个人化的配置:多个 research-base 循环把结果馈入一个 CI/CD 智能体循环,所有研究成果都落进一个 labs 仓库,供未来的智能体式构建参考取用。这是一个具体的链式循环架构,随时间把 autoresearch 的产出与构建流水线连接了起来。
💡#24
@elvissun
https://x.com/elvissun/status/2082240188252852421
作者认为修复营销最快的办法是受众模拟,而把智能体放进反馈循环正是解锁长时间运行智能体的方式。营销没有编译错误,但有各种代理指标,最简单的循环就是派生子智能体,针对你的 ICP 类型在任意营销素材上跑受众模拟。这是一个应用于营销、非编码的 autoresearch 循环。
💡#25
@brevis_zk
https://x.com/brevis_zk/status/2082073565751656906
作者称他们近期的大部分收益都来自 AutoEng,这是一个于 7 月推出的自主工程智能体,能独立跑完整个优化循环:对线上 prover 做性能剖析、重写热点路径、测量结果,只保留跑得更快的那些。这是一个具体、已部署、并带有量化成果的自我优化循环。
💡#26
@Schornack
https://x.com/Schornack/status/2082163665986335167
作者宣布推出 Colombo,一个集成式的 AI 贷款委员会材料准备与政策审查智能体。这是一个具体的、非编码的、面向业务运营的智能体工作流部署,落地于银行与信贷领域,展示了 autoresearch 式的自动化被应用到软件工程之外的场景。
💡#27
@ChangHao564792d
https://x.com/ChangHao564792d/status/2082233110394216672
作者介绍了 STACX,把智能体强化学习定位为一个系统工程问题,而不仅仅是一个训练算法。一个智能体训练循环必须把多轮 rollout、在真实沙箱中的工具执行、任务专属的验证器与奖励,以及分布式训练串联起来。STACX 把这一切解耦成三个模块化引擎(Rollout、Environment、Trainer),它们可以各自独立替换,同时又共同构成一个端到端的学习循环。
💡#28
@scholarpulse
https://x.com/scholarpulse/status/2082009167011647629
作者报道称蚂蚁开源了 LLaDA2.2,称其为首个 agent-native 的扩散式 MoE 大语言模型,旨在解决扩散模型无法胜任闭环智能体任务的短板。据称它通过全 Levenshtein 编辑和 Block Routing,相较自回归对手实现了 1.64x 的吞吐,同时在智能体基准上表现相当。这是一个与智能体循环相关的新模型。
📡 生态产品雷达
生态产品雷达

Karpathy 的 autoresearch 仍是所有人都在迭代的参照范式,如今正从代码被搬到文本、文档和知识库上。
Hermes(NousResearch)是大家丢给它一个 /goal、让它自己掌管循环、而不用手工接线的 agent OS。
LangGraph 是人们在决定要不要自己搭并盯着循环时拿来对照的框架。
MLX.fast(Eigen Labs x Poolside)是那场优化 Laguna XS 2.1 在 Apple Silicon 上推理的开放 autoresearch 竞赛。
STACX 是把 rollout、environment 和 trainer 解耦成可替换引擎的 agentic-RL 栈。
← 上一篇
超级用户日报: 2026年7月30日
下一篇 →
灵感雷达: 2026年7月30日
← 返回所有文章

评论

加载中...
>_