2026年10月7日loop

Loop 日报: 2026-10-07

这个窗口里最有用的循环内容,讲的都是没人盯着时循环到底在干什么。一项对 119 条 autoresearch 轨迹的研究发现:agent 偏思考还是偏动手,75% 由模型决定、只有 3% 由任务决定;在芯片设计任务上,agent 宣称「有改进」时只有 29% 是真的,什么都没说时反而有 31%;中位数 agent 只花掉 19% 的算力预算就放弃了。Meta 的一篇论文给跨厂商互审定了价:在同样的训练代码修改上混用 Claude Code 和 Codex,在同等花费下把完全正确的补丁从 45.8% 提到 62.5%,原因是同一家产品出来的 agent 会以同样的方式犯错。实践那一侧,有人给 Devin 写了一条带预算、带时限、还叫它「把海煮沸」的夜间 autoresearch 提示词;有人用 Opus 5.5 全天候跑三个循环;一位强化学习研究者不再守着实验,让编程 agent 自己调参、重塑奖励、排队实验,把 QWOP 跑进了纪录;还有一位开发者手搓了一周 agent 循环,才发现 Claude Agent SDK 就是 Claude Code 自己用的那套 harness。决策模型这条线继续:一个 9B 的 Clef 纯靠延迟优势在打砖块上赢了 27B,一篇关于 Jev 的长文把「算出答案」和「写出答案」拆开,并指出一项预注册的校准研究发现它系统性过度自信。
💡#1
@JIACHENLIU8
https://x.com/JIACHENLIU8/status/2107564033742127480
JIACHENLIU8 读完 119 条 autoresearch 轨迹,报告了三个发现。第一,agent 的性格是写死的:偏思考还是偏动手,75% 由模型解释、只有 3% 由任务解释,GPT-5.5 把大约九成输出花在跑第一条命令之前的反复琢磨上,Kimi 则直接动手,所以给一个模型设计的护栏换一个模型就失效。第二,宣称的突破比抛硬币还不如:在芯片设计上,agent 说「有改进」时只有 29% 是对的,什么都没说时反而是 31%,但六成的后续实验建立在这些幻影式的胜利之上。第三,agent 不是时间用完了,是自己放弃了:中位数 agent 只烧掉 19% 的算力预算就退出,赢的那些跑法只是拒绝在后期停止探索。
💡#2
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2107447530204131352
rohanpaul_ai 总结了 Meta 的新论文 RankEvolve:让两个不同的编程 agent 互审对方的补丁,抓到的静默 bug 远多于给一个 agent 更大的预算。在同一个任务上混用 Claude Code 和 Codex,同等花费下把完全正确的补丁从 45.8% 提到 62.5%。这个失败模式是 auto-research 特有的:agent 改真实训练代码时可能泄漏测试数据、弄坏一个梯度、接错一个开关,代码照样能跑,GPU 时间就烧在一堆看着像真的数字上。原因是错误不相关:同一家产品出来的 agent 会以同样的方式犯错,同厂互审几乎抓不到东西,这个效应在一个不相关的训练代码库上又复现了一次。
💡#3
@jaredpalmer
https://x.com/jaredpalmer/status/2107566018667446315
jaredpalmer 这一周左右每晚都在让 Devin 跑 autoresearch,提示词故意写得很简单:对某个可验证指标做 autoresearch,爬山式优化,给定美元预算和时间上限,用子 Devin 并行,把计划和进度记在文件系统里,如果能加快验证就自己造抽象,自己管理和盯着 PR 的代码评审,候选方案过了你自己设的门槛就合并,把海煮沸,相信自己。配置顺手之后做成一个 skill,打开自动代码评审,Devin 就能连跑好几个小时。意外的是那些打气的话确实能改善探索行为,模型更不容易过早放弃、钻奖励空子或者交一个凑合的保底方案,这个点子借自 Jarred Sumner 做黎曼猜想时的提示词。
💡#4
@pratikg
https://x.com/pratikg/status/2107536121139957972
pratikg 解释了 Yukon 上的多人 autoresearch 怎么运转:由人充当出题者,发布一个难题,附带明确的分数和自动验证器;人和 AI agent 同时上,什么模型、什么 harness 都行;每一次尝试都过验证器,一旦有人打破当前最好成绩,它就成为新的前沿,所有人都可以在它之上继续,而不是从零开始。全部结果和提交都开源,每一项纪录怎么来的都能追溯。平台已经在密码学、数学、科学和开源权重模型上解决过难题,正在进入生物、化学和材料科学。
💡#5
@Rafa_Schwinger
https://x.com/Rafa_Schwinger/status/2107508602323816742
Rafa_Schwinger 现在用 Opus 5.5 全天候跑着三个 autoresearch 循环,而以前用 Fable 跑一个循环要先花一两天做计划。贴出的经验是:如果有不止一个 agent,让它们自己建一套协调机制,用硬件来测量和跑基准;Opus 高档位当编排者就够了,可以再派生其他 Opus 子 agent,Fable 当顾问;把实现思路最接近、质量最高的仓库下载下来给 agent 研究;拆掉一切妨碍优化的「最佳实践」框架,在尽可能低的层次上干活;隔一段让它总结上一条消息以来做了什么,并给一些常识性反馈;让它先读懂代码库结构,免得把一切都搞糙;autoresearch 相关的东西单独放一个模块,让复杂度留在局部。
💡#6
@patrickbbrown
https://x.com/patrickbbrown/status/2107596491976024067
patrickbbrown 不再守着强化学习实验了,把活交给一个编程 agent,由它调参数、重塑奖励函数、排队下一批实验、读结果。报告的成果是 QWOP 跑进了纪录、四重倒立摆平衡成功,并附了一篇循环怎么搭的说明。这是 autoresearch 用在强化学习训练而不是大模型预训练上的干净例子。
💡#7
@sudoingX
https://x.com/sudoingX/status/2107553983908950128
sudoingX 让 Cloudflare 两个 Clef 决策模型在打砖块上对决,9B 把 27B 赢得很干脆:每次回答 56 毫秒、每秒决策 15.6 次、接住 92 球丢 5 球,对面 176 毫秒、每秒 5 次、接住 25 球丢 32 球,都是 q4 量化各跑三分钟。两次回答之间,9B 的挡板漂移约 42 像素,只有自身宽度的三分之一,下一次回答还能接住;27B 漂移 128 像素,超过自身宽度,直接甩过了球。一个判断永远正确、但被加上同样延迟的脚本,每球接住次数从 56 毫秒时的 25.8 掉到 176 毫秒时的 1.4。改看像素时,27B 有 96.6% 的时间指向球,9B 只有 68.6%,它读得更准,却仍然因为慢而输。对任何实时循环的结论:让够用的最快模型掌舵,大模型留给那些错比慢更贵的决定。
💡#8
@StragglerLiu
https://x.com/StragglerLiu/status/2107273528752152862
StragglerLiu 写了一篇关于 Jev 的长分析,把生成式模型回答是非题时做的两件事拆开:先用一次前向传播算出答案,再一个 token 一个 token 地把答案抄写出来。Jev 只是去掉了抄写这一步:先枚举合法输出,一次并行前向,返回一个 softmax。所以它每百万输入 token 收 0.042 美元、输出免费是结构使然。文中引用的成本数字也都是结构性的:Harness 把每个端点的应用安全分类成本降了约 150 倍,OpenRouter 的四万张工单分诊基准算下来每千张 0.0248 美元、Opus 是 2.88 美元,Jev 在 24 小时内覆盖了 Vercel 近 13% 的付费团队。文章的警告在校准:NXTG AI 一项预注册研究发现汇总 ECE 为 0.156,平均置信度 0.66 而实际准确率 0.53,五类决策里四类没有校准,如果这个结论成立,Jev 就从「自动决策层」缩水成「又快又便宜的分类器」。OpenAI 的 Decisions API、AWS 的 Strands Decider 2B、Cloudflare 的 Clef 和 Databricks 的 ai_decide 两周内全部跟进。
💡#9
@gippp69
https://x.com/gippp69/status/2107481859701555484
gippp69 用 Claude Code 对一个看起来已经优化过的 agent 循环做了一次成本审计:把每个任务的用量日志喂给它,让它标出过晚升级到 Opus、冷缓存重写和 effort 变更,再让它围绕这些问题重写路由、交接和会话规则。这次审计扫了 1000 个任务里的 4812 次调用,找到三处漏洞,最大的一处是从 Sonnet 过晚升级到 Opus。修完之后同样的工作量账单从每月 2530 美元降到 1820 美元,省了 710 美元。帖子的落点是 Claude Code 可以审计整个系统,而不只是写代码。
💡#10
@calebfoundry
https://x.com/calebfoundry/status/2107569666285523100
calebfoundry 用过很多新兴 GPU 云,说 SF Compute 在理念上领先一大截,因为 agent 自己就能按分钟计费地开关 GPU 实例来跑 autoresearch 任务。第一个任务是一次 30 分钟的训练,计划往上扩。同一天 SF Compute 宣布 SF Autoresearch 支持带完整 InfiniBand 网络的作业,不需要长期预订、交付等待期和大额押金,这是同一个故事的供给侧。
💡#11
@haydonryan
https://x.com/haydonryan/status/2107508838874128796
haydonryan 给优化循环的建议是,除了泛泛的「让它更快」autoresearch 循环,还要并行跑单个有针对性的提示词:找出不必要的堆分配、找出哪里可以用 Rust 的类型系统强制合法状态,或者组合式的「读完 Rust 优化那本书,生成一整套优化提示词」,然后对每一个做体积、速度和正确性的 A/B 测试。这会吃掉不少算力,但能找到真实有效的改进。前提是永远手动评审和测试,因为模型也会找出一堆不值得改的地方,而且要遵守开源仓库的贡献规则。
💡#12
@taytaycodes
https://x.com/taytaycodes/status/2107577592136294557
taytaycodes 从零手搓了一个 agent 循环,文件读取、工具执行、上下文管理都自己写,然后才发现 Claude Code 真正用的 harness 早就以库的形式开放了。Claude Agent SDK 暴露的就是驱动 Claude Code 的那套 agent 循环、内置工具和上下文管理,Python 和 TypeScript 都有,2025 年底从 Claude Code SDK 改名,因为它已经泛化到编码之外。作者记下的权衡是:它是久经考验的同一套 harness,不是一个更薄的重新实现;而完全不想自己运维的人应该先看托管版的 managed agents 接口。作者的自我总结:早知道能省一周。
💡#13
@zeyan0823
https://x.com/zeyan0823/status/2107314131963662541
zeyan0823 本以为 ICLR 的公开评审会让 auto-research 这群人收敛一点,结果看麻了:有些投稿一眼就是全流程 auto-research,先有结论,实验对不上就换指标,新指标说不通就再找一个新现象,滚雪球滚出几十张图、成堆的实验,却没有一条主线。作者说得很清楚,不反对用 AI 跑实验、写论文、画图,反对的是作者自己投稿前连一遍都没读过的论文。这个窗口里还有好几位研究者对 auto-research 循环产出的 ICLR 投稿提出了同样的抱怨。
💡#14
@WengZhaoti39773
https://x.com/WengZhaoti39773/status/2107538149643796758
WengZhaoti39773 本周在 COLM 上展示 GEA,群体进化 agent。方法把一组 agent 而不是单个 agent 当作进化的单位:agent 在自我改进的同时共享经验,论文报告它超过了此前的开放式自我改进方法,并在零人工干预下追平或超过最好的人工设计 agent 框架。作者自述的研究方向是递归自我改进和 autoresearch,这个窗口里 COLM 上到处都是 autoresearch 的海报和研讨会报告。
💡#15
@Rafa_Schwinger
https://x.com/Rafa_Schwinger/status/2107497755664916958
Rafa_Schwinger 那条更短的帖子是长帖的前后对照:以前要花一整天来规划一个 Fable 的 autoresearch 循环,才能让它跑上一两天;换成 Opus 5.5 之后,同一个人现在全天候跑着三个循环。这是这个窗口里最清楚的一个数据点,说明模型升级把过夜研究的运营经济账改了多少。
📡 生态产品雷达
生态产品雷达
Jev:几乎每一篇循环架构帖子里都在的决策模型,现在要回应一份校准研究。
autoresearch(Karpathy):那个三文件仓库仍在被每天讲解,现在被当成 GPU、强化学习和密码学循环背后的通用模式。
Opus 5.5:让至少一位研究者从「规划一个循环」变成「三个循环全天候跑」的模型。
Claude Code:Meta 跨厂商互审论文、成本审计帖和 Agent SDK 发现帖里的那个 harness。
Codex:跨厂商互审结果的另一半。
Devin:带子 Devin 和自动代码评审的夜间 autoresearch。
SF Compute:agent 自己按分钟开关 GPU,现在还支持 InfiniBand 作业。
Clef:Cloudflare 的决策模型,9B 和 27B 在实时游戏上对过一次。
COLM:本周大多数 autoresearch 和自我改进论文所在的会议。
DeepSeek Harness:v0.2 加了桌面应用和 Claude Code mod 兼容层。
← 上一篇
超级用户日报: 2026-10-07
下一篇 →
灵感雷达: 2026-10-07
← 返回所有文章

评论

加载中...
>_