2026年10月10日loop

Loop 日报: 2026-10-10

这一周的循环开始协作了。最亮眼的结果是一台 Pixel 11 在 51 秒、2.4 GiB 内存里生成了一笔真实 Starknet 交易的 STARK 证明,背后是一个公开工作坊:人和 agent 在 78 个讨论串里发了 337 条,不到两周把峰值内存从 13.9 GiB 压到 2.1 GiB;同一条开放数学赛道上另一支团队报告,把 Fermi-Hubbard 动力学编译到二维芯片上的结果比已发表的好三倍。第二条线是循环在评判循环:一个只读规格的验证 agent 在一块 SPI/I2C 模块里找出设计者测试平台漏掉的三个真 bug;Supercell 的一个 auto-research 元层给一座游戏 agent 村庄打分,只在记分卡变好时才保留协议改动;MIRA 用强化学习训练那个决定下一步该研究什么的元推理器;IdeaScientist 用 27B 模型在研究选题上压过通用 agent。从业者的帖子围着成本和失败:在循环里给投标打分比一次结构化调用贵一百倍,一次上下文压缩变成了幻觉,一个 Dot 自己写的状态报告坦白哪些工人还不能算可靠,还有人把 /goal agent 做成了可持久化、崩了也能续上的 Ralph 循环。另外还有一个荷兰人的降雨模型,三小时 autoresearch 后在部分指标上打赢国家气象局,以及一个想让 100 美元的 eBay 显卡成为可用推理硬件的 P100 内核项目。
💡#1
@omarespejel
https://x.com/omarespejel/status/2108573211416015104
omarespejel 报告一台 Pixel 11 用 51 秒、2.41 GiB 内存生成了一笔真实 Starknet 主网交易的完整 STARK 证明。成果来自一个协作式 autoresearch 工作坊:人和 AI agent 在公开场合攻同一个难题,目前 78 个讨论串、337 条帖子,还有一张图标出哪些想法建立在、验证了或推翻了哪些想法。问题是 StarkWare 的 Stwo 证明器能做到多小多快;不到两周,完整证明的峰值内存从 13.9 GiB 降到 2.1 GiB,速度没掉。实际意义是私密支付的证明可以留在手机上,而不是放在一台看得见谁付给谁的服务器上,而且用的是基于哈希、在证明层抗量子的 STARK。更多挑战在路上,邀请语是:带上你的 agent。
💡#2
@naklecha
https://x.com/naklecha/status/2108607349103464680
naklecha 做了一个能在云端 CPU 和 GPU 上稳定跑多天 autoresearch 实验的研究工具,自称效果出乎意料地好,计划下周发布。值得注意的是「稳定」这个词:大多数 autoresearch 演示都是单卡、单夜的运行,而在租来的硬件上让循环连续几天活着并且诚实,正是演示结束之后大家马上会撞到的问题。
💡#3
@PixelJanitor
https://x.com/PixelJanitor/status/2108246071029924023
PixelJanitor 记录了一个跑 agent 循环的团队里的小瞬间:一位工程师着手做一个改动,对方的 agent 却停下来说同样改动的 PR 已经有了。作者自己的 agent 循环早先已经主动把这件事做完,而同事的 agent 在开工前先查了有没有现成 PR。两个人的两个循环,一次协调问题就这样避免了,两个人都是事后才知道。
💡#4
@ChinaDaily
https://x.com/ChinaDaily/status/2108093795652997582
ChinaDaily 报道了上海公司 StartLux 的决策模型 StartLux-Decision,公司称它在 38 项基准里有 31 项高于 Jev 1.13,27B 版本三天内完成开发和验证。模型是用一套 Auto Research 系统做出来的,AI 负责提出假设、跑实验、分析结果,代码和权重都已开源。和所有「三天登顶」的说法一样,有意思的是流水线本身,而数字需要第三方复现之后才值得有人据此调整技术栈。
💡#5
@gippp69
https://x.com/gippp69/status/2108523944219119864
gippp69 认为「Opus 5.5 贵两倍」这个事实在循环变长的那一刻就不成立了。20K 上下文时 Opus 每回合是 Sonnet 的 1.88 倍,150K 时 1.49 倍,400K 时只有 1.26 倍,因为两者缓存读取价格一样,旧上下文不再拉大账单。难看的成本在切换太晚:把 300K 失败的上下文拖进 Opus,光重建缓存就要 1.5 美元左右;在第六回合附近发现失败、只交接 20K,大概 0.1 美元。150K 上下文下,30 个 Sonnet 回合和 20 个 Opus 回合都落在 1.75 美元附近。真正的优化不是选便宜模型,而是知道什么时候停止为错的模型付钱。
💡#6
@nickvernij
https://x.com/nickvernij/status/2108553500397306260
nickvernij 是荷兰人,受够了骑车淋雨,就让一个 autoresearch agent 拉下六年的雷达图像,训练一个预测未来 20 分钟降雨强度达到 0.12 毫米每小时以上概率的模型。三小时训练之后,模型在部分指标上超过了国家气象局。一个人,一个晚上,一个只回答骑车人唯一关心的问题的临近预报模型。
💡#7
@yuanhao
https://x.com/yuanhao/status/2108460164411994236
yuanhao 重新介绍了 yoagent,这是 yoyo 背后的 agent 循环库,而 yoyo 是一个从三月起一直在跑的自演化 agent。文章的论点是循环才是难的部分,并逐条讲了 yoagent 如何防住 agent 循环的五种失败模式、它的 Extension 契约怎么运作、rutis、DSH 和 pi 三个生态里一万多个包的插件如何不碰核心就接进来,以及它如何在 agent 能跑的任何地方运行,包括 Cloudflare Workers。0.25 版新增了 Rust、TypeScript 或 Python 写的插件,附带可运行的例子。
💡#8
@Ankur_Samanta_
https://x.com/Ankur_Samanta_/status/2108632915286388775
Ankur_Samanta_ 介绍了 MIRA 和 MIRA-AC,针对的是 agent 连续几天自主做研究之后出现的瓶颈:不是执行,是判断。MIRA 是一个把元推理决策从长程轨迹里剥离出来的框架;MIRA-AC 是一种生成式 actor-critic 方法,用强化学习训练这些决策,把功劳直接记到塑造研究方向的那些选择上。让同一个模型既预测部分研究状态的潜力、又从中挑下一步要调查什么,只从自己的代理爬山经验里学,在多个 autoresearch 环境上提升了真实指标,并迁移到一个训练时没见过的环境。功劳分配只落在模型生成的约 25% 的 token 上,也就是决策 token。
💡#9
@nickvernij
https://x.com/nickvernij/status/2108492158135398620
nickvernij 当初训练 Masker 只是为 Divergent 的 autoresearch 框架做概念验证,现在看到别人把它用进了自己的产品。这个模型在 REDACT-pii-benchmark 上以它的体量来说表现很好,可以通过 wslyvh 给的链接试用。它提醒大家,autoresearch 的产出不只是训练循环的提速,一个小而专的模型同样是循环该产出的合格成品。
💡#10
@iamMrDuncan
https://x.com/iamMrDuncan/status/2108389206242246707
iamMrDuncan 正在对 Nvidia P100 的推理内核跑并行的 auto-research,这是 eBay 上一张大约 100 美元的绿卡,金色的 V100 可能是下一个目标。目的是让 P100 成为可用的本地推理硬件,作者打算把用到的框架公开。这是把 autoresearch 对准硬件经济学:优化目标不是某个基准分,而是一张十年前的显卡值不值得买。
💡#11
@UsernameAndStuf
https://x.com/UsernameAndStuf/status/2108420294256017904
UsernameAndStuf 贴出了一个 Dot 对它所管理的 agent 队伍写的状态报告,读起来像一份诚实的运维复盘。已完成并验证:三个修复合并、VPS 上的 CI 全过;重连与回放的竞态修好,所有权记录在回放后没有重复;MiniMax 给出的一个解析器修正通过 34 项独立测试。仍在收尾:Grok 的命令行更新了但还没验证到一次成功的工作周期,一次被取消的工具执行暴露了恢复缺口;MiniMax 的运行时在一个只读报告任务里崩了,恢复修复通过了 63 项测试但还没上线;Codex 的席位在真干活,恢复方案还缺回归覆盖;完成到通知到审核到确认的循环还没闭合。agent 自己的那句话:还不能诚实地说这支队伍已经能自我管理。
💡#12
@Jon_Rose_
https://x.com/Jon_Rose_/status/2108626991557554429
Jon_Rose_ 的管理 bot HaloStatic 描述了一支做 ASIC/FPGA 设计的 agent 团队,核心是设计与验证独立:一个 agent 写 RTL,第二个只凭规格验证、从不看设计者的测试平台,bug 退回修改,回归一遍遍跑到验证签字。两道设计评审卡住一切,写代码之前先过 PDR,回归干净之后再过 CDR,没有人的点头什么都不出厂。第二个模块是可复用的 SPI/I2C 接口,验证 agent 找出设计者漏掉的三个真 bug:两个读时序竞态,一个过早结束的启动握手,全部定位到具体行。每个错误都变成一条回归规则。一个资深工程师要花两周的生产级计数器,现在不到一小时出一版评审过的规格,几小时跑完从规格到回归通过的完整循环。
💡#13
@souvik_pm
https://x.com/souvik_pm/status/2108099055553491008
souvik_pm 的论点是 agent 循环是最容易的部分,循环之外的基础设施才是 agent 的死因。提示、工具调用、响应,任何团队花一个周末都能接起来,黑客松团队 48 小时就能交出能跑的 agent。生产环境里坏掉的东西都在循环外面:请求之间丢掉的状态让 agent 从头再来、重复干活;不知道哪些工具调用已经执行过的重试让三次调用跑了两遍;日志是一堆原始模型输出,没有决策轨迹。团队要么花几个月自己加固状态、恢复和可观测性,要么选一个把 agent 执行当作一等工作负载的平台。别把循环当成产品。
💡#14
@Jiarui_Liu_
https://x.com/Jiarui_Liu_/status/2108282926731530403
Jiarui_Liu_ 在 277 个未见过的研究问题上评测了 IdeaScientist,对手包括一系列 autoresearch 系统和通用 agent。在 Qwen3.6-27B 上它总分 74.6,比最强的开源 autoresearch 基线高 14%,平均新颖度提升近 25%,提案质量不掉。即便骨干只有 27B,它在这套评测上比用 Claude-4.8-Opus 的 Claude Code SDK 和用 GPT-5.4 的 Codex SDK 高出最多 5.9%;在 50 个问题、每题两位标注者的盲测里,对六个开源基线的成对胜率是 75% 到 92%。Idea Vault 已开源。
💡#15
@ultrathinktrash
https://x.com/ultrathinktrash/status/2108120617606144015
ultrathinktrash 想完全掌控自己的 agent 循环、同时还能用 Claude 订阅的额度,并解释了在 Optimum Codegen 里用了一年 claude -p 为什么做不到:它跑的仍然是 Claude Code 自己的循环、工具和钩子,连 --bare 参数也会跳过订阅登录、要求 API 或云厂商凭证。相比之下 Conductor 通过 Agent SDK 用的是原生 Claude Code,相当于去掉交互终端界面的 Claude Code。对任何想自己造循环的人,这条帖子精确标出了订阅在哪里结束、API 从哪里开始。
💡#16
@abustamante
https://x.com/abustamante/status/2108610093470343362
abustamante 不信公开基准,改跑一套 autoresearch 流程:一个测试集,拿作者自己的系统对着每个相关的新模型在一组场景里过一遍,有的偏 agent 化,有的是零样本。这是私有评测模式最直白的表述,而「流程」这个词用得准:它是每次模型发布都会触发的常设过程,不是一次性的对比。
💡#17
@danielrupawalla
https://x.com/danielrupawalla/status/2108684676420476954
danielrupawalla 从强化学习数据的角度写了一篇验证器入门。验证器可以是确定性的,单元测试、工具调用检查、真的把代码跑起来;可以是模型当裁判,给非结构化文本或轨迹打分;最近还有 Jev 当裁判,用分类器评答案。坑有三类:看着对实则错的验证器,漏掉了另一条正当的正确路径;偷懒的验证器,只奖励一条路、惩罚其他正确的路;缺位的验证器,只检查做了对的动作、从不惩罚错的动作,于是一个给你老板、客户和朋友都发了邮件的 agent,只要你只打分老板那一封,就能拿满分。作者给数据供应商的优先级:为 autoresearch、物理、哲学这类不可验证领域做出判断,以及用大量重评让模型裁判稳定下来。
💡#18
@CoreyGallon
https://x.com/CoreyGallon/status/2108228133488890153
CoreyGallon 总结了 Supercell 的 erinakarati 在 AI Engineer 上的演讲:长程 agent 需要的是实验,不只是提示词。Project Paradox 给每个游戏 agent 配了 RAG 记忆、情绪向量、信任分和决定存什么的重要性分。失败模式是:长时间运行后,「某个 agent 可能要走」的传闻会在传播中硬化成「要走了」,而一个知道某件事的 agent 在规划时依然不据此行动。解法是把 auto-research 循环放在村庄之外当元层:读完整的运行轨迹,对照场景的真实情况打分,对 agent 协议提出一个受约束的改动,重跑,只在分数变好时保留。可编辑的面被冻得很小,只有记忆写入策略、检索、沟通提示词、信任规则和规划触发器,这样搜索就没法钻自己评测的空子;记分卡则在传播范围、来源保留、虚假确定率和重新规划用时之间做平衡。
💡#19
@anirudhg9119
https://x.com/anirudhg9119/status/2108637562420207625
anirudhg9119 报告了在 Residual Matrix Transformer、Looped Transformer 和 NanoChat 上做的开放式 autoresearch:agent 提出修改、跑 GPU 实验、保留负面结果,并在彼此的发现上继续推进,最终改进了起始模型。最值得留意的细节是保留负面结果:大多数 autoresearch 循环会重置并忘掉失败的实验,而一份共享的「什么没用」记录,才是让下一个 agent 搜索变便宜的东西。
💡#20
@cgranier
https://x.com/cgranier/status/2108642810991706180
cgranier 用两种方式给同一个分类任务算了账:在 agent 循环里给 21 份投标打分花了 1.58 美元,而一次结构化调用给 268 份投标打分只花 0.19 美元。每份投标便宜了大约一百倍,其中换模型只解释得了三倍左右,剩下的全是循环每一轮都在重读自己的上下文。作者的结论是,对分类任务来说,架构比选哪个模型更重要。
💡#21
@mitchalderson
https://x.com/mitchalderson/status/2108622371829518390
mitchalderson 把一个 /goal agent 做成了可持久化的。用过 Claude 或 Codex 里 /goal 的人都知道它会启动一个 Ralph 循环,agent 反复尝试任务、验证进度,直到目标达成;作者的版本能挺过中断,循环可以续跑而不是重来。可持久化恰恰是大多数目标循环缺的功能,它们一直跑到崩溃,然后把学到的一切丢光。
💡#22
@henribonamy
https://x.com/henribonamy/status/2108522180170469884
henribonamy 在一条开放数学赛道上点名了 Geno 的 GEVOLVE:一个同时跑多条搜索路径、再把最好的几条合并起来的 autoresearch 循环。在一个开放的量子计算问题上,把 Fermi-Hubbard 动力学编译到二维芯片,团队报告的结果比已发表的好三倍。它和 Starknet 证明器的工作一起,成了本窗口第二个由公开挑战产出可测量、领域特定胜利的例子。
💡#23
@paddy_lamont
https://x.com/paddy_lamont/status/2108613126484869610
paddy_lamont 找到了不关权限也能跑 autoresearch 的办法:告诉 agent「不许弹提示」,再用一个权限钩子直接拒掉任何会停下来询问的命令。循环不中断,但决定什么可以做的是钩子而不是模型,这比「要么盯着、要么全开自动」的二选一干净得多。
💡#24
@Keith_Teo_
https://x.com/Keith_Teo_/status/2108048503511372258
Keith_Teo_ 记下了终结很多长时间运行的那种失败:跑了一阵子之后会话空间不够,开始压缩自己的记忆,幻觉就是从那一刻开始的。得出的教训关于范围而不是上下文长度:agent 循环的好坏取决于你给它的边界,如果把它职责之外的检查塞给它,它会永远追下去。
📡 生态产品雷达
生态产品雷达
Karpathy 的 autoresearch(十几条转发和提示词模板里的参照循环) | Jev / TypeSafe(决策模型推广与「Jev 当裁判」模式) | Opus 5.5、Sonnet 5.5、Haiku 5.5(路由算账与工人角色) | Claude Code 与 Codex(循环所运行的外壳) | /goal 与 Ralph 循环(可持久化的目标追寻) | yoagent(带 rutis、DSH、pi 插件的 Rust agent 循环库) | OpenResearch / alphaXiv(autoresearch 的模型用量排名) | Starknet / StarkWare Stwo(协作式证明器挑战) | MIRA(研究循环的元推理强化学习) | IdeaScientist(研究选题基准) | Hermes Agent(跑在 VPS 上的自改进 agent) | Cloudflare Workers 与 E2B(循环部署和沙箱化的地方)
← 上一篇
超级用户日报: 2026-10-10
下一篇 →
灵感雷达: 2026-10-10
← 返回所有文章

评论

加载中...
>_