2026年10月2日loop

Loop 日报: 2026-10-02

这一窗口的 autoresearch 故事带着价签。Sam Hogan 公布了一个 Kimi K3 推理优化循环的账单:120 张 B300、六个小时、效率提升 40%,全部花费大约 9200 美元,不到 12 小时就能回本。研究圈同一天跟上:有人做出能自己造基准的循环,结论是循环卡住的那一刻,人的方向最值钱;还有工具把 Codex agent 和 Kaggle 特级大师逐条比对,再把人类的研究习惯喂回给 agent。反方声音同样响:刚刷新 NanoGPT 纪录的人说 autoresearch 几乎没起作用,一位知名研究者指出一大堆自动研究跑下来,漏掉了一个事后看再明显不过的优化。底下的循环工程也更扎实了:提示词里时间戳放在哪,决定 50 次 agent 调用花 6.25 美元还是 0.37 美元;而拦住 agent 多付十倍钱的,是硬件签名器,不是模型。
💡#1
@samhogan
https://x.com/samhogan/status/2105142764258431419
samhogan 上线了一个 Kimi K3 推理优化的 autoresearch 循环,跑在 120 张 B300 上,不到六个小时找出了 40% 的效率提升。账单列得很清楚:算力是 120 张卡乘 6 小时乘每小时 5.80 美元,4176 美元;工程加 token 成本大约 5000 美元;合计 9176 美元。按现在的服务规模,不到 12 小时就能回本。这是目前公开的、autoresearch 用在生产基础设施上最干净的投资回报数字,也解释了为什么推理团队最先用上这套循环。
💡#2
@jaseweston
https://x.com/jaseweston/status/2105305463784935791
jaseweston 发布了 AutoBenchmark:自动造基准,同时给“造基准”这件事本身打分。核心发现是人和 agent 协作明显好于 agent 单干,其中最关键的是在出点子阶段给出细粒度的人类反馈;造基准的效果最好的时候,反馈来自两头,一头是解题者,一头是外部验证者,人和 AI 都算。他们还证明用这套配方可以给 AI 研究本身造 autoresearch 基准,形成一个完整的递归改进循环。帖子最后一条补了最有用的细节:autoresearch 循环卡住的时候,人在那个节点给方向最管用,测试用的是一个新基准 Rebuttal Bench,判断论文的反驳是否真的回应了审稿人的问题。
💡#3
@sunweiwei12
https://x.com/sunweiwei12/status/2105405100172722496
sunweiwei12 发布了 TraceML,一个对研究型 agent 做轨迹级分析、系统地拿 agent 和人比较的工具,将在 NeurIPS 2026 展示。他们把 Codex agent 和 Kaggle 特级大师放在一起比,发现人类会调用更广的一组研究技能,而 agent 集中在很窄的一小部分。最有意思的是反向迁移:把 TraceML 挖出来的人类研究技能蒸馏回 Codex agent,最终结果大幅提升。这把“agent 做研究的方式不一样”这种模糊说法,变成了可以量、可以补的东西。
💡#4
@prathamgrv
https://x.com/prathamgrv/status/2105234888555385126
prathamgrv 一个人写完了一篇关于某个 autoresearch 问题的论文,这个问题作者已经好奇了好几个月,论文被 NeurIPS 的 AutoMLR workshop 接收。作者跑了数量离谱的实验,烧掉大约 1000 美元的 H100 算力,署的还是自己公司的单位。一个人花一千美元算力就做出一篇 autoresearch 方向的 workshop 论文,这件事本身就说明这类研究已经便宜到什么程度。
💡#5
@chuanyang_jin
https://x.com/chuanyang_jin/status/2105313263701598333
chuanyang_jin 是这项自动造基准研究的合著者,把自动造基准称为 autoresearch agent 最开放、价值最高的方向之一。背后的道理是,循环只能优化它能打分的东西,所以真正稀缺的不是更多 agent,而是更多更好的目标。由循环来写基准、由解题者和外部验证者来把关,autoresearch 才能伸进那些本来没有现成指标的领域。
💡#6
@nasqret
https://x.com/nasqret/status/2105079853506769407
nasqret 最近几周在数学上试一种新的 auto-research 循环。目标不是解某个具体问题,而是先把最好可能结果的轮廓摸出来:哪些真的能证明,哪些是错的,哪些还一片漆黑。作者在后续回复里强调,每个项目都要调不同的配置,到处套同一套死板设置非常低效,把这件事做对本身就是一门手艺,需要真正懂这个领域。这对“循环能取代数学家”的想法是一个有用的纠偏。
💡#7
@dzhng
https://x.com/dzhng/status/2104405629993676961
dzhng 又跑了 24 小时的 autoresearch 循环,发布了 jevgrep v0.4,在智能上追平 Codex 和 Claude 自带的子 agent,成本低 30%。上一版省的是 40%,这一版是有意拿一部分省钱换更多智能。让循环以“追平某个对照”为目标去调一个开发工具,再老老实实把取舍公布出来,这是发布循环优化软件的一个实用模板。
💡#8
@ethereumfndn
https://x.com/ethereumfndn/status/2105314932283814382
ethereumfndn 发起了一个开放的 autoresearch 挑战:为后量子以太坊设计无状态的哈希签名,在 Lean 里证明其安全性,并在“签名大小乘验证周期数”上打破纪录。参与者直接把自己的 agent 指向挑战网站,挑战由 Eigen Labs 在 Yukon Research 上搭建。一个基金会发布由形式化证明把关的 agent 排行榜,说明密码学正在变成 autoresearch 的天然领地,因为分数和正确性检查都能由机器验证。
💡#9
@JackieLeeETH
https://x.com/JackieLeeETH/status/2105131787748032804
JackieLeeETH 加了一个回放模式,展示一个多人参与的 autoresearch 项目过去几个月怎么一次次刷新纪录,目前还在继续优化 SECP256K1 的点加法电路。交互图表可以把纪录的推进过程重放一遍。看着许多互不相干的 agent 和人一步步把同一个电路压下去,共享排行榜式的 autoresearch 一下子变得具体了。
💡#10
@adi_baradwaj
https://x.com/adi_baradwaj/status/2105066306798260558
adi_baradwaj 转述了一个值得注意的反例:刚刷新 NanoGPT 速通纪录的 Deven 说,autoresearch 在这次工作里几乎没起作用。所有点子都来自人,实现交给 Claude Code。换句话说,起作用的是编程 agent,不是研究循环,至少在这种奖励新点子的纪录上是这样。它值得和那些漂亮的回报数字放在一起看,因为两者并不矛盾:循环擅长调参,大跨步还是人的活。
💡#11
@sytelus
https://x.com/sytelus/status/2104815472705409470
sytelus 称赞了一组技巧:典型批次里根本不会出现的 token ID,就别为它们算了,这顺带还能提升推理性能。然后作者说了更尖锐的一句:大量 auto-research 跑下来都没找到这些优化,而它们事后看再明显不过。作者的结论是,人类在创造力上依然有巨大优势。循环在一个框架里搜得很好,换框架这件事,大多还是人的动作。
💡#12
@int21_ai
https://x.com/int21_ai/status/2104602311368610093
int21_ai 报告说,两名工程师指挥 agent 在两周内生成了 20 个推理引擎,覆盖七类模型:自回归和扩散语言模型、语音识别、语音生成、OCR、图像和视频生成。在 15 个模型的子集上和 SGLang、vLLM 对比,INT21 在测试的全部 6 个文本模型上解码速度领先,MiMo 达到每秒 1308 个 token,调优过的 SGLang 是 540,vLLM 是 1011;在同样 GPU 配置下,完整音频生成比 SGLang-Omni 快 1.73 到 2.30 倍。他们把功劳归给自我改进的 agent 群,并认为在 agent 时代,推理延迟就是业务延迟。
💡#13
@bendechrai
https://x.com/bendechrai/status/2105078234513551810
bendechrai 回顾了 14 个月搭软件工厂的经历:最早是一个朴素的 Ralph 循环;然后是完全跑在 GitHub Issues 和 Actions 里的 IssueOps,直到 API 账单太疼;再是跑在本地 Claude 订阅上的 Anneal,用外层循环、护栏和工单把 Ralph 循环包起来;最后是 Holodeck,项目在工厂里建,它建的第一个项目就是它自己。教训很具体:放在 agent 循环之外的确定性关卡才是真正的质量机制;同一个 agent 永远不给自己的活打分;每次都用新上下文,工单记下试过什么、失败在哪;每个改代码的 agent 都有自己的 worktree,跑在一次性容器里,没有 Docker socket;agent 只拿到密钥的引用,从不拿到值。现在难的是写规格,工具都是一次性的,因为每次模型发布都会让一些工具过时。
💡#14
@0xbobaaa
https://x.com/0xbobaaa/status/2105682175035138331
0xbobaaa 算给大家看:同一个 50 次调用的 agent 循环跑在 GPT-6.1 Sol 上,花 6.25 美元还是 0.37 美元,只取决于一个时间戳放在哪。Sol 读缓存输入每百万 token 0.10 美元,打一折还不止,缓存保温 30 分钟;但缓存从第一个 token 开始匹配,所以时间戳放在开头,每次调用都成了一次按 1.25 倍计费的新写入。一个 5 万 token 的提示重发 50 次:时间戳在前是 6.25 美元,完全不用缓存是 5.00 美元,时间戳在后是一次写入加 49 次便宜读取,0.37 美元,同样的循环放在不带缓存的 Astra 上是 25 美元。检查方法很简单:看第二次调用的 cached_tokens,如果是 0,说明开头附近有东西在变。
💡#15
@sairamkotha
https://x.com/sairamkotha/status/2105584235780493559
sairamkotha 从另一面讲了同一件事:在 agent 循环里每次为了省上下文把早期轮次踢掉,前缀缓存就失效了。九折的提示缓存优惠直接归零,p95 首 token 延迟翻四倍,token 花费暴涨。架构上的解法是只追加的日志,加上彼此隔离的草稿区。作者另一条帖子认为,上下文膨胀是一个系统问题,动态的成本预测比写死步数上限更管用。
💡#16
@themahis
https://x.com/themahis/status/2104629088623165725
themahis 让 agent 买一副耳机,它结账时变成了十副,给 Ledger 发的签名请求是 0.10 ETH 而不是 0.01。作者在 Speculos 模拟器上打开审核界面点了拒绝,应用返回错误码 0x6985,没有签名,没有东西离开设备,也没有任何东西上链。这正是 agent 循环里放一个签名器的意义:agent 可以提出购物车,但花不了钱。放在模型之外的硬件审批,是本周最有说服力的护栏演示。
💡#17
@deeepakbagada
https://x.com/deeepakbagada/status/2104817449744949676
deeepakbagada 介绍了一个用 Rust 写的 MCP 参数校验代理,作者说它在每天 9.2 万次工具调用里拦住了所有因工具参数幻觉导致的崩溃。执行之前用 1.8 毫秒按 JSON Schema 校验载荷;把字符串形式的整数和 ISO 日期确定性地转成正确类型;调用工具前把模型凭空编出来的参数剥掉;工具崩溃被隔离在进程沙箱里,不会带垮外层的 agent 循环。作者说的结果是 40 步的工作流零运行时类型异常。在模型和工具之间加一层强类型边界,对任何长循环都是便宜的保险。
💡#18
@kumarumt
https://x.com/kumarumt/status/2104370512294015269
kumarumt 公布了自己在 Claude Agent SDK 上接任何客户活之前设的权限栅栏:allowedTools 一开始为空,每加一个工具都要写理由;涉及钱、发送、删除、推送的操作永远要人批准;MCP 服务一个个显式命名;在工具开始和结束时挂 hook 做审计;子 agent 拿到的工具要比父 agent 更窄;分叉会话却不重新签权限单,算 bug;还要演练拒绝,故意让 agent 去用一个被禁的工具,确认它被拦住。最后一条最硬:如果打印不出每个工具是谁批准的,就不叫生产环境。产品不是模型,是那张权限表。
💡#19
@jatingargiitk
https://x.com/jatingargiitk/status/2104929338097549624
jatingargiitk 分享了一个实验室自动化的例子:Opus 5.5 试了 16 次,终于弄明白怎么把 3D 打印机的打印床清干净。现在这台打印机可以不需要人、连续不断地跑实验。在物理世界里,agent 得先修好自己的实验装置,真正的实验才能循环下去,这正是自主性回报最高的地方,因为瓶颈一直是得有人走过去重置一下。
💡#20
@RMladek
https://x.com/RMladek/status/2105057398566367666
RMladek 公布了个人 agent Instinct 的内部结构:agent 循环跑在沙箱外的后端服务器上,沙箱只负责执行命令、操作文件系统,一个 git 记忆文件夹备份到 S3。它带了大约 30 个很窄的技能,从订机票、点外卖到签文件、操作 Mac 电脑、主动创造价值。code_rams 随后的拆解把教训概括为:把大脑、手和记忆拆开,机器挂了,记忆还在。
💡#21
@dani_avila7
https://x.com/dani_avila7/status/2105276161525719071
dani_avila7 问了 Meta 的 Muse 几个问题,它就把自己的架构讲出来了:理解、规划、执行、验证、回复的 agent 循环;一台常驻的 Linux 虚拟机,带终端和网络;一个保持登录的 Chromium 浏览器;从 Gmail 到健康数据的各种接入服务;后台子 agent、定时任务和事件钩子;关于偏好、项目、人和承诺的记忆;以及围绕发布、发送、购买、凭证的安全措施。作者猜系统提示里写的大概就是这些,打算隔一阵子再问一次,看看加了什么。对任何在做全天候 agent 的人来说,这是一份免费的参考架构。
💡#22
@hwchase17
https://x.com/hwchase17/status/2104940633018577400
hwchase17 比较了公司操作系统,也就是组织级 harness,和个人 agent 的异同。不同之处在于:多个委托人、一个执行者,所以必须支持多人,同一个线程里有好几个用户时,认证和记忆都得处理对;治理、可观测、可审计和管理控制台重要得多;交互更偏事件驱动和异步。相同之处在于:都该能写代码、跑代码;浏览器操作可能非常重要,这一点和编程 harness 不同;技能和 MCP 是标准;核心 agent 循环是共通的。想把个人 agent 改成团队用的人,可以拿它当检查清单。
💡#23
@evisdrenova
https://x.com/evisdrenova/status/2104609018694222311
evisdrenova 问,沙箱启动时间明明是 agent 循环里影响最小的指标,为什么大家这么执着。作者给的数字是:沙箱启动 10 到 50 毫秒,一次工具调用 200 到 500 毫秒,一次大模型往返两秒起。该优化的是在循环里占大头的东西。同一天 CoreWeave 正好发布了一个号称沙箱启动快 3 倍的 CPU 平台,这个问题就更扎心了。
💡#24
@raahulll_raj
https://x.com/raahulll_raj/status/2105618236326981904
raahulll_raj 指出了交易 agent 的一种失败方式:agent 读到价格 100、价差 0.2%、流动性良好,推理两秒,再调用另一个模型或工具,构造交易并发出去,这时价格已经是 103,市场早变了。决策本身没错,只是针对一个已经不存在的状态。作者提出的修法是给观察结果加过期时间,循环变成观察、推理、重新核对状态、执行。这不只适用于交易,任何在一个持续变化的世界里行动的 agent 都一样。
💡#25
@naveenpandey27
https://x.com/naveenpandey27/status/2104923102417469813
naveenpandey27 点出了谷歌 Antigravity CLI 1.2.13 的一个小更新:现在会遵守服务器给的重试等待时间,而不是按固定间隔瞎重试;服务方提示日额度或账单额度用完时,就停止重试。作者的观点是,agent 循环不该把所有失败都当成“重试、重试、再重试”,而要区分:临时故障就重试,限流就退避,额度用完就停,持续失败就上报。好的 agent 系统不只是更聪明的模型,而是更好的运行时。
💡#26
@HOPPYEMPIRE
https://x.com/HOPPYEMPIRE/status/2105217893860270304
HOPPYEMPIRE 给每个 agent 循环都围绕同一个问题来搭:我们有没有新的证据支持再做一次动作?循环是规划、执行、检查、决定,这个停止条件干的活,比再加一段提示词还多。这是对最常见的循环失败一个很紧凑的回答:agent 一直跑,只是因为没人告诉它该停。
💡#27
@EgeMustafaCelik
https://x.com/EgeMustafaCelik/status/2104462443833401444
EgeMustafaCelik 认为,一个长时间运行的 agent 循环和真正的群体智能之间的差距,在新闻稿里总被抹平:“一万个 agent 跑了 88 小时”这种数字,背后可能只是一个控制器套着一层重试壳。在看到共享状态、故障隔离、以及不是“再多烧点 token”的停止条件之前,作者把所有蜂群说法都当成编排说法来看。现在每周都有自我改进 agent 群的公告,这是个好用的过滤器。
💡#28
@SqdiqX
https://x.com/SqdiqX/status/2104940456459063533
SqdiqX 点出了 Raven 这次发布的不同之处:团队用递归自我改进做出了宣布它的那个东西本身,而且编排层也是一个可以被重写的实例。大多数自我改进 agent 项目只停在改提示词或换模型,因为一旦碰编排层,一个 bug 坏掉的就是协调所有任务的那个东西。让一个 harness 改写自己的协调逻辑,要么是真的工程做得好,要么几周后会冒出一些很有意思的故障贴,不管哪种,都比再来一个基准分数更有信息量。
💡#29
@pzakin
https://x.com/pzakin/status/2105034454167425228
pzakin 列了自己反复琢磨的几个方向:把仿真加传感器当作自主决策的核心基础设施;能在不可验证领域做 autoresearch 的探索型 agent;以及品味复制器或个人模型,让 agent 能大规模地运用主观判断,比如评估设计。第二个是真正的前沿:autoresearch 只在有分数的地方灵,悬而未决的是,在其他地方用什么来代替分数。
💡#30
@sonicdr1p
https://x.com/sonicdr1p/status/2105339586901586375
sonicdr1p 总结了一位创作者的测评:试了几百个 Claude 技能,最后留下 9 个,而且自己实测的数字普遍比仓库宣传的低。Caveman 号称省 65% token,实测大约 35%;Ponytail 号称最多少写 94% 代码,实测 50% 左右。本来是给训练模型用的 Karpathy autoresearch,被拿去跑健身计划,“跑 100 个小测试、留下有效的”这套方法,查出那位创作者每周练手臂只有 7 组。把 autoresearch 用在健身计划这种非编程的事上,虽然小,但很能说明这套方法正往哪里扩散。
💡#31
@cybersnopy
https://x.com/cybersnopy/status/2105415516517003266
cybersnopy 报道,CoreWeave 率先上了 NVIDIA 的 Vera CPU,号称第一款为 AI agent 设计的处理器:每个机柜 128 颗 Vera、11264 个核,配 BlueField-4 DPU,足够同时跑 1.1 万多个 agent 环境。它服务的是 agent 循环里 CPU 那一半:沙箱、强化学习环境、工具调用、围绕模型每一步的数据管道,而且这种需求是脉冲式的,一个小时要几千个环境,接着几乎为零。CoreWeave 称 Vera 上的沙箱启动比 x86 快 3 倍。基础设施厂商开始围绕循环而不是模型来设计,这是结构性的变化。
💡#32
@StragglerLiu
https://x.com/StragglerLiu/status/2105136401247539424
StragglerLiu 写了一篇长分析,认为现在真正的分发层是 agent 运行时,不是 token。OpenAI 的 Agents API 托管 Codex harness、上下文压缩、工具调度和编排,但执行环境可以放在第三方或你自己的沙箱里,不收平台费;Anthropic 的 Claude Managed Agents 则把循环、工具和沙箱一起托管,按标准 token 价格外加每会话小时 0.08 美元收费。引用高盛的数据,同一个编程任务,一问一答用 3390 个 token,放进 agent 工作流平均要 417 万个,所以谁握着状态,谁就吃到这个倍数。值得盯的指标是两种模式各自的留存,以及有没有人真的把一个生产 agent 从一个运行时迁到另一个。
💡#33
@AlemTuzlak
https://x.com/AlemTuzlak/status/2105583984168050890
在做 TanStack AI 的 AlemTuzlak 说,这个项目一直在低估自己:它的 chat 方法本身就是一个完整的 agent 循环工具,可以拿来搭定制 harness 或介于两者之间的任何东西,上面还叠着其他功能。agent 循环的基础组件正在进入主流框架库,意味着越来越少的团队需要手搓循环,上面那些运行时之争也就越来越关乎状态和治理,而不是管道。
💡#34
@rasbt
https://x.com/rasbt/status/2104996058040283385
rasbt 建议把 agent 工具看成一条光谱:全部自己动手,然后是 Codex 这类 harness 的手动自动化,再到 Dots 这类常驻 agent 循环的全自动化。作者更喜欢把任务和项目分到不同线程里,想到要把网站维护、报销管理统统塞进同一个 agent 对话,就觉得可怕。在“一个 agent 管你全部生活”的宣传刷屏的一周,这是个理智的平衡。
💡#35
@ReadFuturist
https://x.com/ReadFuturist/status/2105217020845609389
ReadFuturist 点名了 Simate,一家由张颖创办的中国机器人新公司,成立三个月就用第一个模型 Simate-beta 登顶全球 RoboDojo 基准。公司把功劳归给一套 AI 驱动的自动化研究系统,叫 AutoResearch。如果这个说法成立,这是最早一批被认为由 autoresearch 系统拿下具身智能前沿成绩的案例,而不是在语言模型或算子上。
📡 生态产品雷达
生态产品雷达

GPT-6.1 Sol(9 次):大多数循环经济账里的成本基准,尤其在提示缓存上。
MCP(7 次):循环和工具之间的边界层,现在外面又加了参数校验代理和权限栅栏。
Codex(5 次)和 Claude Code(5 次):研究循环和软件工厂搭在上面的两大 harness。
Jev / TypeSafe(4 次):在 agent 循环里当关卡用的小型决策模型。
Opus 5.5(4 次):实验室自动化和长时间构建循环背后的模型。
Dots(4 次)和 Muse(3 次):用户正在反推其架构的常驻消费级 agent。
x402(4 次):总在循环讨论旁边出现的 agent 支付通道。
Karpathy 的 autoresearch(3 次):依然是参照方法,现在被用在推理、密码学,甚至健身计划上。
LangChain(3 次):在自家 agent 循环里上线了决策模型中间件。
← 上一篇
超级用户日报: 2026-10-02
下一篇 →
灵感雷达: 2026-10-02
← 返回所有文章

评论

加载中...
>_