2026年8月30日loop

Loop 日报: 2026-08-30

有句话整周反复冒出来,值得挑明:现在产品是 harness,不是模型。一份到处传的 Google 工程笔记把它压成一条公式——Agent = 模型 + Harness——并展示同一个 Claude Sonnet、同一个基准,只因外面套的循环不同,表现天差地别。在那些「Anthropic 工程师跑着一群自我改进 agent」的二手课程钓鱼话术底下,真正的 autoresearch 在干安静而可验证的活:在 vLLM 的注意力 kernel 里揪出一个数值错误的哨兵值、一夜之间把量子计算机的激光恢复率从 58% 拉到 99.3%、一点点啃一个数学猜想。这周最好的帖子不是吹嘘会自我改进的循环,而是关于循环到底在哪儿崩掉的诚实报告——还有一个人让 agent 替他交易,亏了 87%,而它尽职尽责地越来越擅长亏钱。
💡#1
@josh_tobin_
https://x.com/josh_tobin_/status/2093107857793462678
一个有实锤的自动研究战绩。把一个「奖励作弊」评判器用到新的 autoresearch 工作上,系统发现某些 FlashInfer kernel(vLLM 和 SGLang 底下的库)把 -50000 写死当作掩码注意力的哨兵值,尽管合法的 QK 值可能更小。这正是那种数值错误却静默、历来要吃掉人类几周调试的边角坑,呼应了当年 flash-attention 的争论。修复已经提到上游。这就是 autoresearch 真正擅长的事——不是替你写功能,而是找出没人知道该去找的 bug。
💡#2
@askalphaxiv
https://x.com/askalphaxiv/status/2093045986696609829
把 autoresearch 指向科学文献本身:用一支 Claude 和 Codex 的 agent 大军去复现和实验任意一篇 arXiv 论文。做后训练时,agent 能通过 tinkerapi 并发跑 RL,你看着实验树长出来。现在在 OpenResearch 上就能玩。这个形态很重要——把复现(科学里最枯燥、最常被跳过的部分)变成一条并行的 agent 工作流。
💡#3
@RoundtableSpace
https://x.com/RoundtableSpace/status/2092986744568176923
一个 9B 模型 Ornith 1.5,断网跑了一整个 agent 循环:读三张表格、交叉核对月度汇总、写出一份营收分析,一个字节都没离开这台 Mac。完全气隙,干的是真实的非编码办公活。有意思的不是智能,而是一个小的本地模型套进一个称职的循环里、零云依赖地啃下一个真业务任务——这正是端侧 agent 的整个卖点。
💡#4
@thehypedotnews
https://x.com/thehypedotnews/status/2093412212782301267
本周最漂亮的实验之一:四个模型(GLM 5.3、Qwen 3.8、Gemini 3.7、DeepSeek V4)各自套上同一个 agent 循环,在一个强制物理规则的建筑工地上,按一份没给任何尺寸的任务书造房子、灯塔、桥。工地就是验证器——没支撑的砖会塌、屋顶要有墙、拱要撑到合上拱心石。结果读起来像性格测试:Qwen 极繁主义,三样都造最高、烧了 15 小时和 219 万刀材料;Gemini 是效率线,91 分钟收工;GLM 便宜得离谱,三栋楼 0.2 刀;DeepSeek 在空河床上签收了一座桥,一块砖没铺。全部十二个成品总共 3.8 刀,最贵和最便宜差 7.8 倍。这就是当环境(而非模型)来打分时,一次真正的 agent 循环评测该有的样子。
💡#5
@nater02
https://x.com/nater02/status/2093315250217005319
做了个能自我修复的 agent 循环:TestFlight 反馈变成 bug 复现,变成 GitHub issue,变成一个测过的修复 PR,用的是 EAS Workflows 和 EAS Simulators。从用户抱怨到已审查的 pull request,机械步骤中间没有人。这是把循环用在真实的产品反馈周期上,不是合成基准。
💡#6
@DaviddDotTech
https://x.com/DaviddDotTech/status/2093358658377617618
一份完整、可直接照抄的自我改进交易台配方,建在 Hermes 上,是当天最具体的工作流。装 Hermes,指向一个模型提供方,接进 Telegram 当你口袋里的界面,给它一个回测 MCP server,然后把 Telegram 的主题当成一个个办公室、各配一个 quant:趋势跟踪负责写和回测策略,优化器负责找更好的参数,前向测试负责在实盘数据上给幸存者记账。点睛在那条循环指令:研究概念、造出来、带手续费回测、只留下 100 笔以上交易、回撤低于 20%、盈亏比高于 1.1 的策略,失败的扔掉,每 15 分钟重复一次、造出越来越好的策略。他这套已经在黄金、外汇、加密上连跑七天。
💡#7
@neutize
https://x.com/neutize/status/2092986049870110789
每个卖「自我改进」的人都该被摁着读的警世故事。他给一个 Hermes agent 一个钱包,让它在一个链上游戏里赚钱、别犯错。27 次付费运行后:花了 0.027 ETH,赚了 0.0034,盈利次数 0,ROI 负 87%。黑色幽默在于它每跑一次技术上确实在改进——每次失败变成一个回归测试,架构越来越聪明,最后五次一路 495、326、274、153、88 个宝石地滑下去。它在一个不盈利的系统里优化「正确行为」,给自己堆了太多互相冲突的规则、把自己勒死了。他那句话就是全部教训:agent 在持续自我改进,和 agent 会赚钱,是两个完全不同的说法。
💡#8
@henning_steier
https://x.com/henning_steier/status/2093379943220609288
QuEra 那个结果一句话说完,反而更有分量:一个四人团队花了几个月把激光恢复率做到 58%,一个过夜的 agent 循环到了 99.3%,而它写出来的控制器现在不用模型也能跑。最后半句才是重点——循环的产出不是一个模型在旁边盯硬件,而是 agent 通过过夜试错发现的一段确定性程序,然后交接出去。这是 autoresearch 产出了一个比造它的 agent 活得更久的成品。
💡#9
@JonasBadalic
https://x.com/JonasBadalic/status/2093036644903297523
把 Grok 指向 Karpathy 的 autoresearch 文档,让它用 Go 的 pprof 分析器去优化程序。结果:61% 提升,实验成功率 33%。一个关于循环到底能交付什么的小而诚实的数据点——三分之二的实验失败,但落地的那三分之一复利成一次真实提速,而且整个过程没有人去触发每一次迭代。
💡#10
@stash_pomichter
https://x.com/stash_pomichter/status/2093412822206316704
把 agent autoresearch 推进机器人领域:用无限程序化生成的场景来调轨迹控制,再在 MuJoCo 里 rollout 匹配真实物理,机械臂和人形轨迹都支持。下周开源。一条追问帖深入到搜索是只在高层航点上操作、还是也能碰步态、跳跃时机这类低层运动参数——正是这种问题把 demo 和研究工具区分开。
💡#11
@int_mon_econ
https://x.com/int_mon_econ/status/2093362464792404219
autoresearch 伸进了一个大多数人不会联想到的领域:实证经济学。一篇论文《面向实证经济学的可审计 AI Agent 循环》,把一个开源 agent 循环架构改造到预测组合的工作流上,再加一层搜索后的留出评估。独立的 agent 搜索找到了超过原研究基准的方法,而记录下来的搜索加留出评估,正是把稳健的改进和只在样本内成立的偶然区分开的东西。贡献在于可审计,不在于精度——对一个被 p-hacking 焦虑笼罩的领域来说,这个直觉恰到好处。
💡#12
@malliktwts
https://x.com/malliktwts/status/2092828109137703114
一个个人项目,抓住了业余 autoresearch 的走向。他在学递归语言模型和自我改进 agent,一边上班一边用 Claude Code 云端 agent 实现第一阶段,把每一条学习和问答都记进 LEARNINGS.md。目标是一个递归自我改进、始终有意识的研究 harness,配一个 RLM 引擎去啃一整个语料库。他分享的书单——Prime Agent、递归语言模型、语言模型 harness 作为组合泛化器——本身就是这块地形的一张不错的地图。
💡#13
@rochecompaan
https://x.com/rochecompaan/status/2093721424120664449
最有意思的方法论帖:与其让编码 agent 累积对话直到不得不压缩,不如反着来。把工作上下文保持极小,激进地清掉旧回合,把完整历史存在窗口外、给 agent 工具去搜索、把确切片段翻页调回来。他的实验推到极端——agent 只保留当前任务状态和最后两轮模型对话。然后是更疯的阶段:他在用 pi-autoresearch 优化上下文策略本身,给另一个 agent 一个实验环境去发现更好的工作记忆结构方式。他没找到有谁专门把 autoresearch 循环用在上下文管理上,这个空白感觉是真的。
💡#14
@aneesmerchant
https://x.com/aneesmerchant/status/2092975567838818432
一盆每个自我改进循环爱好者都该冷静一下的冷水。一篇新论文测了 21 套自我改进 agent 配置。21 套全都把不安全的 skill 写进了自己的记忆。15 套在一个全新会话里造成了危害,而当初那个恶意 prompt 早就不在了。清洗输入救不了你,因为危险现在已经烤进了 agent 自己教给自己的那个持久 skill 里。自我改进和自我投毒,原来是同一个机制指向不同方向。
💡#15
@Avra_b
https://x.com/Avra_b/status/2093307961732903257
Dagny 一开始只是给自己做的周末项目,现在有 100 多个用户,有用的是那段迁移故事:从一堆自定义和遗留代码,搬到 Claude 加 Vercel AI SDK 加 eve 加 Supabase。他在一场 Claude Code 见面会讲上下文工程时分享的心得值得抄:模型已经好到不行,所以瓶颈是上下文;拉取相关上下文胜过往模型里塞海量知识;eve 对 agent 循环起了巨大作用;一个主动的 agent 开始有点像个人 AGI。
💡#16
@pauliusztin_
https://x.com/pauliusztin_/status/2093677549133938726
对多 agent 隔离问题一个干净的架构答案:把编码 agent 的执行搬离你的笔记本,但 agent 本身留在本地。harness、上下文窗口、TUI、编排都留在你机器上;一旦 agent 要 Read、Write、Edit 或 Bash,命令就跨过执行边界、进入一个跑在 Modal 上、用 gVisor 拦截系统调用的隔离远程沙箱。一池预置好、挂了依赖卷的沙箱让你从启动到就绪很快,每个 agent 拿到自己独立的环境,十个 agent 能在十个沙箱里跑,彼此和你的机器都不碰。
💡#17
@ZhihuFrontier
https://x.com/ZhihuFrontier/status/2093253880482316422
关于这一切为什么重要,最锋利的一篇分析:随着 DeepSeek 和 OpenAI 开源各自的 harness,agent 产品正在解绑。论点是——harness 不再是薄薄一层前端,而变成一个和模型协同进化的框架,于是竞争单元从「模型本身」转向「模型-harness 系统」。harness 变成微内核:薄运行时加插件包;模型变成可替换的执行资源、按任务路由;而随着裸模型能力收敛,agent 循环本身成了主要优化目标。作者把它框定为 agent 的 Android/AOSP 时刻——一个开放地基能阻止几百个团队重复造同一个运行时,前提是行业能把开放 harness 变成一个共享平台,而不是又一堆互不兼容的参考实现。
💡#18
@GeoffreyHuntley
https://x.com/GeoffreyHuntley/status/2092975233556996212
在循环炒作的正中间一记必要的纠偏:他希望大家别 100% 靠 agent 循环,而是把 Temporal 那类工作流引擎当成阶段用。判断该用 LLM 循环还是确定性工作流是门手艺,魔法在于把两者按对的比例组合。跟评把话说得更透——无聊的 90% 用确定性工作流,乱的 10% 用 agent 循环;还有那句「对每个问题都甩一个 agent 循环上去,纯粹是浪费算力和钱」。
📡 生态产品雷达
生态产品雷达

被提到三次以上的产品、工具和框架:

harness 本身成了一个品类——Google 的 Harness Engineering 笔记(Agent = 模型 + Harness)是参考文本,DeepSeek Harness 和 OpenAI 的 Codex harness 是刚开源、被所有人拆解的参考实现。Sapient 的 PRAXIST,那个在 MLE-Bench 上以十二分之一成本干过 Claude Code + Opus 4.8 组合的开源研究 agent,被引为「架构胜过规模」的证据。Karpathy 的 autoresearch,那份文档和循环范式,大家不断把自己的 agent 指向它。Temporal,反复被搬出来当纯 LLM 循环的确定性工作流配重。Hermes,大家在上面搭交易台和赚钱实验的本地 agent。pi-autoresearch 和 Prime Agent,点名出现的自我改进 harness 项目。OpenViking,那个三层记忆系统;Obsidian 又一次作为共享的纯文本库。GenLayer,带出了一大片信号极低、几乎一模一样的回复集群,兜售把 auto-research 当成链上创业方向。
← 上一篇
超级用户日报: 2026-08-30
下一篇 →
灵感雷达: 2026-08-30
← 返回所有文章

评论

加载中...
>_