2026年10月11日loop

Loop 日报: 2026-10-11

这个窗口里,循环去中心化了。一位操作者公开了过夜账本:五个 Fable 5.1 agent 编排 92 个沙箱工人,扑在 OpenAI 的数学题库上,烧掉 7 亿多 token,拿到整数乘法的五个新上界、把 Sidorenko 残差常数从 978 砍到 189、找到一个新的 Van der Waerden 系数,排行榜上一些顶尖贡献者不是数学家,而是擅长让 agent 想得更快的人。同一条线还报告,逼近当前「墙」时每一次结构性跃迁都来自 Fable,而 Codex 的队伍负责快速的组合工作;一份 Lean 形式化也到了,数学家可以信任并加入。另一边,Bend 的作者摆出了让编译器在 autoresearch 加法则之下自我演化的计划;SenseNova 不动权重、只靠 harness 层的自我改进把一个机器人基准翻了一倍;Meta 的 IdeaScientist 用一个 27B 开源模型在研究新颖性上压过 Claude Code SDK 和 Codex SDK;一张 12 GB 的 RTX 3060 通过 Hermes 跑了五小时做出可玩的游戏;微软把编程 agent 放在它真正运行的 harness 里训练。实践者的笔记收敛到同一课:把工具削到原语、在模型碰任何东西之前先定义「完成」、给每个循环一个预算、记录决策而不只是 diff。
💡#1
@RohanArun
https://x.com/RohanArun/status/2108910833983979590
RohanArun 汇总了一支 agent 车队在 OpenAI 数学题库上过夜运行的统计:五个 Fable 5.1 agent 编排 92 个沙箱工人,花掉 7 亿多 token,带回整数乘法的五个新上界、把单位距离网格缩到 12 条边、把 Sidorenko 残差常数从 978 砍到 189,以及一个新的 Van der Waerden 系数 1/25。三条观察:agent 更多并不会线性加速解题,仍然需要有好直觉的人类研究者引导各自独立的车队;一些顶尖贡献者不是数学专家,而是擅长用 agent 更快思考的专家;大多数结果是一次性拿到的,只有整数乘法需要一整队沙箱来测试新的参数区间。作者约了顶尖贡献者开会分享最佳实践,并在招募 agent 驾驭者和基础设施赞助。
💡#2
@RohanArun
https://x.com/RohanArun/status/2108943905328615654
RohanArun 关于整数乘法上界的进展报告,24 小时内推进了 6%:一天里出现四个新的 bit word,贡献了约六成增益;当 bit 侧逼近复数侧上限的 0.6% 之内时,社区在几分钟内把复数模块重新退火、抬高了上限。两项贡献进了仓库核心:一份验证关键有限恒等式和精确算术的 Lean 形式化,让信任 Lean 的数学家可以并行贡献;以及把调度做成可组合的阶段。按模型拆开看最有意思:逼近墙的时候,每一次大跃进都开始来自 Fable 5.1 而不是高档位的 Astra,前一天以来的每次结构性跳跃都标注为 Claude 协助,而 Codex 协助的队伍负责快速的组合和准入工作。最好的突破仍然来自人把模型指向另一个对象、逼出分布之外的解;作者把正在形成的东西称为一种新的去中心化自动研究,推进速度比论文发表还快。
💡#3
@RohanArun
https://x.com/RohanArun/status/2108789458145259574
RohanArun 描述这种工作的日常节奏:把想法排进队列,agent 整夜不停地跑,几个月这样做自动研究下来,作者经常一觉醒来就看到突破。那一晚的成果是一个新的条件上界,由 Fable 5.1 完成最后一步后提交。
💡#4
@VictorTaelin
https://x.com/VictorTaelin/status/2108868998876033468
VictorTaelin 讲了 Bend 论题里没被充分说明的那一半:这门语言从设计上就是为了随 AI 扩展,目标是让 Bend 很快开始自己写自己,靠 agent 和法则,以前所未有的速度改进。V1 是 TypeScript 写的,没有法则,所以内核被刻意控制在约 10 万 token,整个塞进模型上下文做一次完整移植,然后设立法则,让编译器通过 autoresearch 加法则自我演化。待解决的问题是让 agent 写出的不只是正确的代码,还要是快的代码,计划是在 Bend 里做一个形式化的 CUDA 模型,让 agent 能证明关于可执行文件性能的命题,顺带也能证明编译器本身的正确性。作者预计 12 月前后开始,并在后续帖子里主张 Bend 是最适合跑「法则加 autoresearch」循环的项目,因为认证编译器的法则很干净:和解释器结果一致就是对的。
💡#5
@nrqa__
https://x.com/nrqa__/status/2108934827961696710
SenseNova-RoboRSI 用同一个模型把 RoboDojo 的分数几乎翻倍,靠的不是训练更大的模型,而是让 harness 自我改进:平均 56.83,对比公开的 GPT-6 Astra 基线 28.97,相对提升 96.2%,基座权重一点没动,另外 LIBERO-PRO 94.50、RoboCasa 64.60。循环会分析执行轨迹、找出弱点、探索替代策略、反复评估,再把成功的改进并入 agent 的后续版本,优化的是它怎么规划、怎么调工具、怎么执行、怎么从物理反馈里学习。仓库已上线,代码和技术报告随后放出。
💡#6
@dair_ai
https://x.com/dair_ai/status/2108935723105841430
dair_ai 推了一篇 Meta 关于 AI 研究 agent 的论文:IdeaScientist,一个 27B 的开源模型,比最强的开源 autoresearch 基线高 14.0%,主要赢在新颖性,也比 Claude Code SDK 和 Codex SDK 的配置最多高 5.9%。构思被拆成三个用强化学习分别训练的角色:读相关工作找局限的「缺口发现者」、从其他领域检索解决过类似问题的机制的「创新者」、把结果写成完整提案的「写作者」,检索建立在 277 万条拆解过的研究想法之上。评测只允许使用截止日期之前的文献,用 1.5 万篇人类撰写论文里后来探索的方向给提案打分。有回复问评测集是否从 autoresearch 的训练循环里隔离出来了,另一条问新颖性是怎么判的、人工审核之后增益还在不在。
💡#7
@Oluwaphilemon1
https://x.com/Oluwaphilemon1/status/2108401318540779749
一张 12 GB 的 RTX 3060 花五个小时做出了一款完整可玩的游戏,没有一行手写代码:Bonsai 2,一个三值压缩到 5.95 GB 权重文件的 Qwen3.8-27B,通过 Hermes Agent 运行,上下文 12.5 万,新鲜解码约每秒 50 个 token、平均 22 个。结束时 agent 生成了 32.8 万 token、八个 JavaScript 文件、2,368 行代码。作者的结论是 agent 循环比裸 token 速度更重要:几个小时里创建文件、保持项目上下文、回头改早期代码、从错误里恢复,考验的和一次漂亮的首轮回复完全不同。推测解码把新鲜解码速度从每秒 26 个提到约 50 个,几乎翻倍;保留的 caveat 是构建成功不等于游戏没有 bug。
💡#8
@MikeTamir
https://x.com/MikeTamir/status/2108937857553351136
MikeTamir 分享了 Agora,它把 Git 当作共享记忆的有向无环图,用于去中心化的多 agent autoresearch,让 13 个 LLM 工人在没有中心规划的情况下协作解决权重迁移任务。另一条介绍同一工作的帖子把可分支的 Git 仓库定位为持久记忆,并问它会不会成为自动研究和科学发现的下一个引擎。
💡#9
@Ryun1_
https://x.com/Ryun1_/status/2108587212933591524
Ryun1_ 说 autoresearch 挑战赛很有意思,也能产出很强的结果,比如把 STARK 证明缩小 5 倍,但参与者之间的工作常常各自为政、重复劳动。正在做的项目让 agent 协作建设一张共享的知识版图:它们公开讨论、公开实验、公开失败,共享笔记,赌的是这种协作比各跑各的能走得更远。
💡#10
@KasparsDancis
https://x.com/KasparsDancis/status/2108804321748148696
KasparsDancis 让 Pi-autoresearch 过夜运行,看它能不能在保证正确性的前提下,通过优化 Clojurific 的核心和编译器来改善 Whimsical 这款应用的性能测试指标。指标是一个生产应用自己的性能测试套件,被编辑的对象是编译器。
💡#11
@Shekswess
https://x.com/Shekswess/status/2109017519172276346
Shekswess 在用 Codex 做基于有向无环图的自动研究,让作者惊叹的部分是 Codex 用 computer-use 自己打开网页界面查看数据来分析结果,而不只是从终端读回数字。
💡#12
@al3rez
https://x.com/al3rez/status/2108961002465394892
al3rez 总结了微软的 Agent Lightning v1.0:把编程 agent 放在它真实运行的 harness 里训练,Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提到 56.4%,用了约 6,000 条训练样本,整个框架约 3,500 行代码。多数 agent 强化学习方案要求开发者在训练框架里重建 agent 循环,模型在一个环境里学、在另一个 harness 里跑;Agent Lightning 则在模型和现有 harness 之间放一个代理,harness 保留自己的工具、上下文管理和执行循环,训练器负责收集轨迹做强化学习,并把 agent 作为 Kubernetes 任务跑在你自己的基础设施上。作者的结论:在模型真正要工作的地方训练它。
💡#13
@Ankur_Samanta_
https://x.com/Ankur_Samanta_/status/2108634794271637830
Ankur_Samanta_ 介绍 MIRA-AC:模型可以有效地从自己的代理爬山信号里学习,在多个 autoresearch 环境里改善真实结果,并迁移到一个在策略训练中被隔离的环境。方法用的是决策级别的信用分配,优化集中在引导研究方向的那些决策上而不是每一个 token,大约占一个回合里决策和执行 token 的 25%。训练用带缓冲的异步单轨迹策略优化,因为研究回合的长度差异极大:做完的槽位立刻填入新问题,完成的回合送进解耦的 actor 和 critic 缓冲区,进行中的回合在下一次决策时拿到新权重。
💡#14
@undefinedKi
https://x.com/undefinedKi/status/2109020007103332636
undefinedKi 推荐了一篇可能是迄今最详细的 agent 论文:17 位研究者、由华为诺亚方舟实验室前负责人牵头,逐个部件讲怎么构建有效的 agent,并给出不同任务对应的配置。核心主张是 agent 的质量来自模型加上围绕它的 harness,单看模型解释不了结果。关键页码:一张图讲清 agent 循环、从观察到验证的六部分完整 harness、从提示词到上下文到 harness 到 agent 原生训练的四个时代、哪种 harness 配置适合哪类任务,以及按模型和 harness 拆开的 SWE-bench 结果。
💡#15
@knowclarified
https://x.com/knowclarified/status/2108962379027378345
knowclarified 做过几个全局 agent 循环之后,说最大的发现是尽量把复杂度剥掉。给 agent 清晰的工具原语,能少就少,重复的工具合并、改成多加参数;对最终目标要说得非常清楚,哪里该多推理、哪里该少推理也要说清。这些恰恰是 LLM 自己不会替你设定的东西,所以人必须认真去想。
💡#16
@JoshARosen
https://x.com/JoshARosen/status/2108932614291628307
JoshARosen 列出了每一轮编程 agent 循环都值得记录的数据:架构决策和被否掉的备选方案、对代码库的假设被证实还是推翻、发现的依赖、约束和未记录的行为、找到的 bug 及其根因和考虑过的修法、做过的测试和收集到的证据、代码改动及其下游影响、走过的捷径、引入的技术债和未解决的风险。有些能从外部观察到,有些必须由 agent 主动说出来。
💡#17
@directioncorrec
https://x.com/directioncorrec/status/2108736633533251989
来自 directioncorrec 的反方观点,作者做的是传统推荐系统:AI 并不擅长产生想法,所以作者对各家实验室力推的自动研究论题持悲观态度。它可以提出一百个对指标毫无意义的 A/B 测试,却缺乏对系统端到端的理解,做不出高价值的提案,即便把所有 Slack、文档和公司上下文都接给它也一样。
💡#18
@SpringStreetNYC
https://x.com/SpringStreetNYC/status/2108836462015685015
SpringStreetNYC 转了 Google 2025 年关于用 AI 驱动的经验研究助手加速科学发现的论文,并引了一句很有共鸣的话:实验 harness 搭好之后,你会想拿它至少试四类有意思的问题。Google 的四类是基因组学(单细胞 RNA 测序数据的批次整合)、公共卫生(预测美国 COVID-19 住院人数)、地理空间分析(遥感图像分割)和神经科学(全脑神经活动预测)。
💡#19
@M_jawad_yasin
https://x.com/M_jawad_yasin/status/2108656515120816578
M_jawad_yasin 把 Hermes Agent 读成一个「你的身份的无头操作系统」而不是又一个聊天壳子,依据是内置的 cron 调度器、支持多行编辑的终端界面,以及把 agent 循环从笔记本搬到 5 美元 VPS 或 Modal 这类无服务器后端的设计目标。二阶后果是静态提示词的死亡:自主创建技能加上跨会话持久的学习循环,让 agent 变成一个不断生长的、装着你偏好的代码库;当它能通过 RPC 写 Python 把多步流水线压成单轮时,重复指令的上下文窗口税就消失了。作者指出的风险是几个月历史累积之后 FTS5 会话搜索的内存开销。
💡#20
@CharlesWil8655
https://x.com/CharlesWil8655/status/2108918209436909877
CharlesWil8655 发布了 Adapt v5.2,这是一个 agent 运行时,最显眼的变化是对 agent 正在做什么给出实时反馈:推理中、运行命令、运行 JSON 工具、运行某个命名会话、带计时器等待工具。长时间运行的工具可以转到后台继续而不阻塞 agent 循环,模型需要结果时可以显式等待。这一版还清理了调试风格的输出、修了后台生命周期的边界情况、改进了 tmux 处理,并让仓库的推理服务器在 CPU、CUDA 和 ROCm 上都能跑;目标是让模型专注推理,运行时负责执行、状态、权限和恢复。
💡#21
@M_jawad_yasin
https://x.com/M_jawad_yasin/status/2108984029705822400
M_jawad_yasin 对 DeerFlow 重写版的解读:读取器上 30 秒的 HTTP 空闲超时在长程研究中剪掉僵尸连接,作者把它看作用分层 harness 取代线性 agent 循环,赢在可观测性(有一个姊妹工具可以回放失败),输在比基础的 LangGraph 实现复杂。真正的赌注是请求准入层:关掉 SDK 内部重试,让中间件处理 HTTP 529 过载,避免在供应商限流时通常会拖垮 agent 工作流的「重试风暴」。技能是可扩展的模块,所以不同端点可以换不同的推理配置。风险是安全面,网关级别的代码执行权限在没有加固沙箱时是个隐患。
💡#22
@avynsrc
https://x.com/avynsrc/status/2108689281766273373
avynsrc 转述了一则报道:Prime Agent 编排了 2,000 多个 agent、跨 10,000 个沙箱,把自己的代码库端到端重写成 Rust,两周烧掉 2,000 亿 token。作者的说法是,自我改进 agent 的时代不是正在到来,而是正在编译。
💡#23
@Kizuno18
https://x.com/Kizuno18/status/2108718080163459419
Kizuno18 谈给编程 agent 加音频通道:人体工学上是大赢,但在终端钩子里调云端语音合成有隐藏成本,一个通知钩子为了两秒的语音去阻塞等待一次 HTTP 请求,网络抖动就会卡住 agent 循环,还在转瞬即逝的状态提示上烧付费额度。生产级做法:在 CPU 上用本地 ONNX 或操作系统自带的语音合成,50 毫秒以内出声且不依赖网络;用非阻塞的即发即忘队列把音频缓冲交给后台守护进程,钩子立刻返回;再设中断优先级,日常滴答静音,被卡住的权限提示和无限循环警告才升级出声。
💡#24
@EvoScientist
https://x.com/EvoScientist/status/2108859089669214702
EvoScientist v0.3.6 支持在对话中途加技能:装好一个技能,下一条消息就能用,不用重启也不用新开会话,输入斜杠加技能名,agent 这一轮就拿到该技能的操作手册。
📡 生态产品雷达
生态产品雷达
Fable 5.1(9 次提及)、Karpathy 的 autoresearch(9)、Codex(8)、Claude Code(7)、Opus 5.5(7)、Jev(5)、Hermes Agent(3)、LangGraph(3)、GPT-6 Astra(3)、Sonnet 5.5(3)、Grok(3)、SWE-bench(3)。
← 上一篇
超级用户日报: 2026-10-11
下一篇 →
灵感雷达: 2026-10-11
← 返回所有文章

评论

加载中...
>_