2026年7月23日loop

Loop 日报: 2026年7月23日

autoresearch 今天彻底跑出了代码。大家分享的循环不再是修 bug、跑仓库,而是去发现一种超导材料、训练一个打牌高手、在对局间隙重写万智牌卡组。demo 底下反复冒出来的还是那句让人不安的话:现在循环本身已经不难了,真正崩的地方是评估器。另外有两条互不相关的硬件观察落到了同一条线上——一块便宜显卡上跑的小本地模型,已经足够让一个 agent 无人值守地跑起来。
💡#1
@WrongNebula
https://x.com/WrongNebula/status/2079617327856070708
两个 pi agent,各自关在独立沙箱里,用一个私有 Obsidian 库当记忆、配一套 Karpathy 式 autoresearch 循环,互相打万智牌,无限循环下去。每局之间它们复盘自己的败局、重写卡组、重新排队。有一个连输两次给同一张飞行威胁后,给自己写了条笔记:我们的卡组打不过 Sengir 这类带吸血的飞兵,下次排队前优先升级直伤。没人教它去侦查对手,这是它从自己的失败里自己想明白的。
💡#2
@alxai_
https://x.com/alxai_/status/2079604813403206103
前沿模型能解人类解不出的数学题,却打不过一个普通人的金拉米,于是 goodstartlabs 做了个叫 Arkadium 的小专家,十把赢九把,服务成本大约便宜一千倍。一套定制的 auto-research 循环决定跑哪些实验、训练新专家、留下最好的那个,而这个「学生」最后反过来去教更大的模型。Arkadium 既给玩家一个更好玩的游戏,又开了条新收入线——把训练数据卖给大模型公司。定义好、量化它、达成它、拿它赚钱。
💡#3
@mp_engine
https://x.com/mp_engine/status/2079506673031368911
这条说法是那种会让你停一下的:微软的 Majorana 1 量子芯片,据说之所以存在,是因为一个自主 agent 循环一步步迭代出了背后那种全新的拓扑超导材料。不管这个归因站不站得住,它就是大家现在给这类循环讲的故事的形状——有意思的产出不再是一个 PR,而是一种以前不存在的材料。材料搜索几乎是 autoresearch 的完美靶子:空间巨大、评分清晰、实验又能让 agent 自己提出并排序。
💡#4
@Lummox_eth
https://x.com/Lummox_eth/status/2079559537552495064
Karpathy 把 Codex 指向一个外联销售仓库,把 700 次实验变成每周一个 PR,而不是又一个仪表盘。700 次跑,20 个胜出,快了 11%,零条自动发出的消息。诀窍是把发送和合并都留在循环外面,Codex 只干一件事:读结果、改一条评分规则、跑评估、开 PR。仓库让整个 go-to-market 变得可检视——scoring.yaml 装的是判断,outcomes.jsonl 装的是市场真实的反应。
💡#5
@Mnilax
https://x.com/Mnilax/status/2079632365002117542
每个人的自改进 agent 都在删掉自己最有用的数据,而斯坦福一篇新论文偏偏留住大家扔掉的那部分:失败。标准循环只在成功的跑上训练,可弱点恰恰暴露在失败里。于是他们反过来做——让一个 LLM 读失败的轨迹、给失败模式命名、生成一个推理时的补丁来升级 agent,不重训,只需人快速过一眼。这个 agent 从别人都删掉的那些跑里变强。
💡#6
@free_ai_guides
https://x.com/free_ai_guides/status/2079659164876558375
Langfuse 的 Annabelle 讲清楚了为什么你的自改进循环烧了一堆 token 却原地踏步,根子在目标函数。代码循环之所以好使,是因为它永远有一个干净信号——能不能编译,而大多数领域根本没有这么锋利的信号。他们在一个论文分类任务上搭的极简循环,第一次迭代就从 68% 跳到 78%,然后就平了,一次高信号的迭代几乎干完了所有活。解法是:把模糊的 0 到 1 质量分换成一个是或否的问题,再给循环留一个逃生口,让它该停就停,别一直往墙上撞。
💡#7
@vartekxx
https://x.com/vartekxx/status/2079608205072531649
Kimi CEO 杨植麟说,有个团队让自改进 agent 连着跑了两三天、全程没有人介入,模型自己一直在找更好的解。他们的 token 量每两周翻一倍、几个月十倍,这个速度他拿早年 3G 上线来类比。他真正的警告是接下来的事:一个 agent 是玩具,一群 agent 是没人解决过的上下文噩梦,当你手里是一个 swarm 而不是一个 agent 时压过来的负载,才是那个悬而未决的难题。
💡#8
@mr_r0b0t
https://x.com/mr_r0b0t/status/2079539983702991313
腾讯基于 Karpathy 的 autoresearch 放出了 Hyra-1.0,一个通用的递归自改进脚手架,配一条多 agent 异步的生产者-消费者流水线。一个 Context Agent 维护着过往解法、日志和产物的经验库,并合成新鲜的「灵感」上下文;提案 agent 把这些拉进完整的解法目录,在沙箱里跑、打分、再把结果喂回去。关键在那个双层循环:它既改进解法、又进化评估器本身——而这正是随着 agent 越来越强、用来对抗奖励作弊的那一环。
💡#9
@superalesha
https://x.com/superalesha/status/2079558889222382030
一个直白的提醒:自主会放大错误。七个 agent 组成一个 auto-research 团队,在四块 RTX 3090 上烧了 900 万 token、90 分钟,完美地执行了一个错误的实验,三个审查 agent 还全都签字通过。整件事是被一个人的一句话叫停的——为什么要把一个 3.6GB 的模型拆到四块 24GB 的显卡上。循环运转得完美无缺,只是被指向了废话,而审查者一个都没看出来。
💡#10
@simplifyinAI
https://x.com/simplifyinAI/status/2079701548830261598
一个叫 AutoResearch 的开源工具,想用一条 CLI 命令自动化整个科学方法。它建在 Karpathy 的 autoresearch 实验循环之上,你丢给它一个粗糙的点子,它就去 arXiv 和 Semantic Scholar 上做文献综述、带一道过滤挡掉假论文,从零写代码,再把成果结构成一篇五千字的报告。你可以设成停下来等人批准,也可以设成自动通过、直接走人。
💡#11
@agihouse_org
https://x.com/agihouse_org/status/2079628107540267055
十八支队伍在 AGI House 花了一个周六,攻的是 autoresearch 真正的瓶颈——不是跑实验,而是点子的多样性、研究品味、以及知道什么值得一试。获胜的有 AutoDesign(一个自改进的设计 harness)、BetaChip(给芯片设计做实时 RL)、还有一个把人的判断带进科学 auto-research 的 Vibes Lab。这个主题很说明问题:一旦实验循环被商品化,稀缺的东西就变成了决定把它指向哪儿。
💡#12
@sudoingX
https://x.com/sudoingX/status/2079651157753106444
一个 27B 的模型现在能在 8GB 显存上舒舒服服跑起来,而且不只是聊天,它跑的是完整的 agent 循环——工具、多步、无人值守。这就是这一周大家反复围着转的那条线:便宜的本地显卡从「聊天机器人」变成「你可以扔着让它干活的东西」的临界点。再配上他另一条——同一个模型的权重在磁盘上只有 3.9GB——结论就是,跑一个无人值守 agent 的硬件门槛已经悄悄塌了。
💡#13
@MadhurPras81001
https://x.com/MadhurPras81001/status/2079571292882124866
如果你做了一个专门用来改进其他 agent 的 agent,那你也得评估这个 agent,这条讲的正是 LangChain 怎么用 IssueBench 给他们的 LangSmith 轨迹分析引擎做这件事。做法是 15 个合成任务,每个带一批轨迹,有的干净、有的注入了故障,覆盖 15 类失败(静默的工具错误、agent 打转、上下文爆炸等),跨三个领域跑,确认它学到的是抽象的失败模式而不是表层特征。核心是:一个轨迹级的标签还不够,输出必须是一组团队真能拿去分派、去修的问题。
💡#14
@AAAzzam
https://x.com/AAAzzam/status/2079648322667626609
Devin Outposts 跑在 Modal 上,让你给 agent 一个带 GPU、为它的活量身定制的沙箱,然后在你自己掌控的基础设施里丢给它 auto-research 任务。这是循环执行到底落在哪儿的一个小而实在的转变——规划留在 Devin 的云端,跑则发生在你自己的机器上。给一个自主研究 agent 配一套专属算力环境,正是让过夜实验循环变得实用的那种不起眼的管道活。
💡#15
@SasuRobert
https://x.com/SasuRobert/status/2079496205915046264
一个把一切都放在家里跑的理由:如果你在做真东西,你需要脚本自主运行——autoresearch agent、代码审查、审计,一直跑、一直更新,而这些成本对着前沿额度加起来涨得很快。每秒 30 个 token 听着低,其实干得了一大堆活,需要速度时还能切到更小的 flash 模型。他的观点是:一旦你反正要在 token 上花真金白银,本地开源模型就是那种持续、无人值守后台循环的最佳配置。
💡#16
@bitwjg
https://x.com/bitwjg/status/2079384257882202327
一个用 GPT-5.5 和 5.6 当协作者的完整端到端 auto-research 项目,从假设设计一路跑到远程实验、产物审计和写作。他们测的问题本身就很锋利:更大的推理模型是不是真的用更少的 token 在推理。这是把 autoresearch 指向模型本身——用一个 agent 循环去研究跑这个循环的那类系统的某个属性。
💡#17
@vinicius2prg
https://x.com/vinicius2prg/status/2079631177225322600
一个自进化 harness 的漂亮生产模式:当一个错误符合某些条件时,一个 agent 在 Linear 上自动分诊、去重,然后交给一个子 agent,让它走一遍轨迹、找出上下文混淆或工具错误,用 skillopt 加 autoresearch 再加一个 LLM 陪审团去优化,而不是全都内联硬做。这是把「失败驱动的循环」接进了一条真实的 bug 流水线,而不是一个 benchmark。那个夹在诊断和修复之间的陪审团,正是大多数人跳过的一环。
💡#18
@code_hiyouga
https://x.com/code_hiyouga/status/2079583404170113522
PenguinHarness 被定位成任何 agent 都能用的自改进引擎,它的 skill 让 agent 自己生成数据、跑评估、分析失败、更新技能、并验证每一次改进。这就在一个包里闭合了从数据到评估再到 harness 迭代的完整循环。它是这一周「把会学习的东西当成 harness 而不是模型」这个模式里的又一个案例。
💡#19
@trishbuilds
https://x.com/trishbuilds/status/2079539759957909577
一个自维护的 Obsidian 库,agent 写每一条笔记、在你读之前先把概念链好,而且关键是——当搜索没命中时,它会自己修搜索。一次搜索空手而归,agent 就把那次查询存成一个永久的评估测试,修好背后的摘要,还必须通过这个新测试、同时不破坏任何旧的。它从自己的漏检里变得更准,这跟研究者在追的「把失败当信号」是同一个想法,只是用在了个人知识工作上。
💡#20
@luongnv89
https://x.com/luongnv89/status/2079523319955783801
一个真在跑的自改进循环,一个修复 agent 配一个审查 agent(跑在 GPT-5.6 Sol high 上),后面还挂着一句实在的抱怨:每周的用量上限变成了每天的上限。这是一扇看清这类循环真实成本的小窗——一个双 agent 配置烧得够多,以至于「审查者值不值这个价」成了要不要保留它的问题。token 都花在审查者身上,绕回来又撞上了这一整周的评估器难题。
💡#21
@runpensar
https://x.com/runpensar/status/2079610261674049809
把持续对抗测试框成一个单一的 agentic 循环,在整个攻击面上去发现、利用、修补漏洞。这是把 autoresearch 指向安全——一个 agent 自己跑「红队再修复」的循环,而不是人去驱动每一轮。循环结构特别适合安全,因为「被利用没被利用」很接近代码循环里那个干净的「编译没编译」信号。
💡#22
@abossy
https://x.com/abossy/status/2079393880143696172
一个自己写了 agent harness 的开发者,因为现成的太受限了——Claude agents SDK 是闭源的,OpenAI agents SDK 又不成熟。这是这一周「harness 即产品」叙事的一股逆流,有人判定那些商品化的原语不合用、干脆自己撸一个。当大家开始因为现成的 harness 束手束脚而自己写 harness 时,harness 就已经成了那个真正要紧的东西。
💡#23
@richkuo7
https://x.com/richkuo7/status/2079634010800570558
一套值得抄的当下 agentic 循环配置:用 fable-medium 创建并校验 issue,复杂的就给这个 issue 加上 fableplan-high,然后用 sol-high 或 medium 去干这个 issue。这是把不同档位的模型路由到循环不同阶段、而不是全程用一个模型的一个干净示例。有意思的一步是:用便宜的模型把活理顺,只在推理真需要的地方才上更强的那个。
💡#24
@alex_verem
https://x.com/alex_verem/status/2079540627247964601
一篇新论文定义了把一个语言模型变成编码 agent 的四个条件,而大家抓住的点是:没有一个是关于模型本身的。全是 harness——模型外面的那层脚手架,而不是权重,这正是支撑这一整周循环和 harness 讨论的理论骨架。如果让一个东西成为 agent 的不是模型,那模型就真的正在变成那个可替换的零件。
📡 生态产品雷达
Eco Products Radar

Devin / Outposts —— Cognition 主推的、把 Devin 的 agent 循环跑在你自己掌控的基础设施上,反复出现(AAAzzam、cognition、markfenner、TrevorHikes)。

Karpathy's autoresearch —— 所有人都在其上搭建的参考实现,从 Hyra-1.0、AutoResearch CLI、打万智牌的 pi agent 到 AGI House 黑客松都在引用。

pi —— 用来搭自己的编码 agent 和 autoresearch 循环的开源工具包,SedraLab(pi-textbook)、沙箱里的 pi agent、以及多份 harness 盘点都提到了它。
← 上一篇
超级用户日报: 2026年7月23日
下一篇 →
灵感雷达: 2026年7月23日
← 返回所有文章

评论

加载中...
>_