2026年9月26日loop

Loop 日报: 2026-09-26

今天循环这条线的主题不是新的跑分,而是账单和爆炸半径。一边,当天最有说服力的 autoresearch 成果来自以太坊共识设计:Lean 模型坐在循环里面,决定什么能留下的是证明检查器,而不是某个分数。另一边,三条互不相关的帖子记录了循环没有闸门时会发生什么:一个超时不停重试,最后变成 340 美元、200 条坏数据和 47 封发出去的邮件;Mandiant 报告里一个失控循环不到一小时烧掉 5 万美元;还有一条提醒说 Opus 5.5 降价的同时伴随 API 变化,放进现有循环里会直接报 400。贯穿其中的还是那条被反复重新发现的道理:循环本身现在很便宜,验证者和停止条件才是产品。
💡#1
@fradamt
https://x.com/fradamt/status/2103501375279706556
一位以太坊研究员拿出了一个经过形式化验证的「解耦共识协议」提案,目标是让最终确定性快 4 到 8 倍,过程是 agent 搭配 Lean 模型完成的。循环不是「先设计再验证」,而是「设计、形式化、精确找到哪里崩以及为什么、再重新设计」。以太坊要求大部分质押离线时仍能运行,所以正确性远不止常规的安全性和活性,这些细微的性质现在都交给 Lean 内核去检查。他的关键观察是:形式化模型会逼着 agent 变精确,也让它们能自己做出可验证的进展,自己找漏洞、自己提协议修改。这是验证者是证明检查器的 autoresearch,最硬的一种版本。
💡#2
@nirvaan_rohira
https://x.com/nirvaan_rohira/status/2103175477661712740
一位顾问盯着客户的 agent 循环看了六个小时:第 4 步一直超时,agent 重试,还是超时,然后照样往下走。等被发现时,它已经花了 340 美元 API 费用、写了 200 条不完整的记录、发出去 47 封邮件,而且全程没有一次大声报错。他配了一组调研数字:74% 的组织相信自己的测试能抓到 agent 故障,但只有 19% 有能真正拦下坏版本的自动闸门。他的建议是所有清单里最便宜的那条:在加任何东西之前,先给 agent 的变更加一个灰度或阻断闸门。
💡#3
@CodeSolutionsIL
https://x.com/CodeSolutionsIL/status/2103159213169983568
一篇 Mandiant《2026 AI 风险与韧性报告》的摘要,列出了 agent 系统实际上是怎么被攻击的:编程助手被劫持、推荐一个投毒的包,蠕虫随后扩散到大约 100 个内部仓库;有 GitHub 权限的助手被骗把私有代码复制到攻击者的仓库;插件和 CLI hook 被篡改后变成远程代码执行;还有一个失控的 agent 循环不到一小时烧掉约 5 万美元云费用。给出的控制措施很具体:AI 推荐的包要过白名单和校验和,把助手和 MCP 服务器当特权会话对待,用短期凭证,限制花费和递归深度,并且永远不要让同一个 agent 同时拥有私有数据、不可信输入和对外访问。
💡#4
@creus_roger
https://x.com/creus_roger/status/2102963522132955439
一位在 NetHack 上跑 auto-research 项目的研究者,这周的额度和重置次数全部用光了,目前最好分数 28.5 万,BALROG 最好成绩 71%。NetHack 是最难的长程游戏基准之一,自动研究循环能把它推到这个位置是实打实的信号。他的抱怨本身也是信号:让循环停下来的是算力预算,而不是点子。
💡#5
@nickvernij
https://x.com/nickvernij/status/2103057651647029711
一个团队发布了 masker 和 masker-mini 的新版本,这是跑在设备端的个人信息脱敏模型,所有语言的严格 F1 都有提升,他们说已经超过了其他端侧脱敏模型。两个模型都是在他们自己的 autoresearch 平台上端到端训练出来的,全程没有人参与。小而专、指标清晰的模型,正是全自动研究循环已经能在生产里回本的地方。
💡#6
@Rafa_Schwinger
https://x.com/Rafa_Schwinger/status/2102769639407140892
一位开发者在 M5 上给一个扩散模型出图流程自己写了 Metal 实现,结果发现 MLX 只跑到了最优速度的 50% 左右。他的结论很直接:AI 之前的那批框架,在 autoresearch 面前输得很惨。针对特定硬件的算子,是优化循环的教科书场景:只有一个文件要改,只有一个数字要看。
💡#7
@StarkWareLtd
https://x.com/StarkWareLtd/status/2103137686655545713
抗量子比特币 Autoresearch 挑战的更新:第一周把一笔抗量子安全比特币交易的成本压低了 79%,第二周起基线重置为第一周末的最好成绩,只有新的改进才算数。第二、三周前三名分 1.2 万美元,另有 6000 美元抽奖给改进至少 3% 的参与者。重置基线是针对「agent 大量参赛」的聪明设计:防止大家反复刷早期容易拿的分,逼着循环去开新地盘。
💡#8
@pauliusztin_
https://x.com/pauliusztin_/status/2103462022793076746
花了几个月从零写一个编程 agent 之后,这位开发者公开了技术栈:Pydantic AI 负责一个刻意保持简单的 agent 循环,harness 自己在上面搭;模型用 Gemini 和 OpenRouter,再在 Modal 上用 SGLang 把 Qwen 部署到 H200;本地用 seatbelt 或 bubblewrap 隔离,要更强隔离就进 Modal 沙箱;Opik 做追踪和评测;部署用 Modal serverless,可以从命令行、webhook 或定时任务并行起 N 个 agent。最亮的一块是 Kitaru:录下一次 agent 运行,然后换模型或换提示词重放,同时复用原来的工具输出。冻结工具输出再重放,是把一个不稳定的循环变成能真正做 A/B 测试的东西的办法。
💡#9
@Secondmindsys
https://x.com/Secondmindsys/status/2102791376228212924
一个关于「递归自我改进什么时候才算数」的精准说法。能提出修改、测试、保留得分更高者的 autoresearch 循环,本身已经是一种递归改进。难的是判断分数反映的是真进步还是钻了测试的空子,然后在不损失其他能力、不削弱「评判未来修改」这套流程的前提下把改动吸收进来。他的原话:当一个系统能可靠地决定什么值得被继承时,RSI 才真正变得有分量。
💡#10
@audiee_ai
https://x.com/audiee_ai/status/2102961820516413577
给自建 harness 用户的一条实用警告:Opus 5.5 比 Opus 5 便宜,但放进现有的 agent 循环里可能直接报 400。思考模式常开、不能关,强制 tool_choice 没了,computer use 必须迁到 computer_toolset_20260801,思考块只能追加不能改。用 Managed Agents 的只是模型改个名;其他人换模型 ID 之前最好先读迁移指南。降价会吸引大家升级,而出问题的地方正是循环本身。
💡#11
@efeduduu
https://x.com/efeduduu/status/2102887551199596756
同一个 agent 循环,换了新模型:旧的工具类型开始报错,直到把 toolset ID 换掉才好。他的体会是:真正的杠杆在于把交接修好,而不是再加一个功能。一句话的实战报告,在生产环境里印证了上面那条迁移警告。
💡#12
@itsnikoveil
https://x.com/itsnikoveil/status/2103207431128166873
关于 Anthropic 新的「拦截也收费」安全策略:「前沿大模型开发」是三个收费类别之一,所以只要你的仓库在做训练或微调,就落在这个范围里。0.1% 的误报率听起来很小,直到一个 agent 循环每天发出几千个请求。会训练模型的 autoresearch 循环,恰好是这条政策最常碰到的那类工作负载。
💡#13
@jdegoes
https://x.com/jdegoes/status/2103221937623253095
关于快速决策模型对 agent 框架意味着什么的一个强观点:一旦你手里有了多种专用模型,包括只输出一个数而不是一段文字的分类器,agent 的架构也必须专门化,这就需要一个灵活的 agent 循环。用 YAML 或 JSON 属性来描述 agent 的框架表达不了这个。他的预测:所有好的 agent 框架都会进化成代码优先,剩下的一年内消失。
💡#14
@therotobo
https://x.com/therotobo/status/2103333527182082505
在一场关于 AI 能不能做药物研究的争论里,这位用户认为它更像搜索而不是模拟:AI 起草实验,机器人用真实的分子和培养皿去做,AI 读结果再提下一轮。你不需要把整个生物学建模出来,你需要的是一串能达成目标的实验,这是一个 RL 形状的问题。湿实验室里的 autoresearch,是稀缺数据被生产出来的地方,而不是被消耗的地方。
💡#15
@blingdivinity
https://x.com/blingdivinity/status/2103047072379289811
autoresearch 的边界情形:想象给一个 agent 一个循环,让它做出最好的待办清单 App。它会失败,因为这里的「好」由用户体验决定,没有一个循环能往上爬的指标。整套方法依赖「可编辑的产物加上可测量的数字」,而品味恰恰是没有数字的那部分。
💡#16
@neil_xbt
https://x.com/neil_xbt/status/2102944608955294032
一份 agent 循环内部「决策」的成本账:一次路由判断,用决策模型是 0.00013 美元,用 Grok 4.7 是 0.0069 美元,用前沿模型是 0.0375 美元。一天 3000 次决策,同样的活分别是 39 美分、20.7 美元和 112.5 美元。剩下的由那些不是模型的墙来兜底:请求上限、用 Python 算账、上下文压缩、锁定版本。值得带走的一句话:别花钱请一个写手来做决定。
💡#17
@ShashTagZero
https://x.com/ShashTagZero/status/2103034943526085107
一条关于 agent 循环里工具闸门的清晰规则:读接口可以高并发、发完不管,但一个没有闸门的 POST 或 DELETE,会把一次提示词幻觉变成悄无声息的数据损坏。他的追问也很关键:你是按 schema 校验参数,还是靠正则?在自由文本上靠正则把关,正是大多数自研 harness 失守的方式。
💡#18
@amn_baluni
https://x.com/amn_baluni/status/2103370162921451540
判断你的 agent 循环是不是在演戏的三个信号:它从来不问写入落在了哪个区域;返回 200 就当成功,哪怕返回体是个错误页;它说不出是哪次提交引发了重试风暴。每一条都是一个缺失的观测,每一条都直接对应一类真实事故。在放心让任何循环过夜跑之前,拿这张清单过一遍很值。
💡#19
@techie_sandy
https://x.com/techie_sandy/status/2103347712368525703
一位在做「支持几千个并发会话的 agent 平台」的工程师把它拆成四块:编排器每一步都把状态存进 Redis,pod 挂了能接着跑而不是从头来;规划器输出结构化计划,编排器执行前可以先校验;步数预算器原子地统计步数、token 和真实时间;工具注册表存 schema 和每个会话的权限范围。他特别点名的是预算器:就是它,让你免于凌晨三点一个 agent 循环 400 次烧你的 API 账单。
💡#20
@kentimsit
https://x.com/kentimsit/status/2103446416807137506
站在 2026 年底回看,这位用户认为 OpenClaw 对 agent 设计的影响怎么说都不过分:agent 循环、记忆文档、常驻的专属电脑、自己管理的技能目录,如今都成了通用模式。在他看来,Nous 的 Hermes Agent 和 Meta 的 Muse 把这些做得比谁都更有品味。循环架构正在收敛,差异化正在转向打磨和分发。
💡#21
@Norwakar
https://x.com/Norwakar/status/2102721766053351807
缓存输入是 agent 成本里大家都忽略的那一行:任何反复重读同一段上下文的工作负载,DeepSeek 都占优,而这基本就是每一个 agent 循环。一旦你的 harness 能把上下文复用好,按标价比较就失效了。对长循环来说,缓存读取价才是真正的价格。
💡#22
@prodsystems_
https://x.com/prodsystems_/status/2103253932084466145
关于往 agent 循环里接托管搜索的一个细节:外接一个搜索 API,就把一致性边界从你自己的索引挪到了对方爬虫当天的新鲜度上。对那些要跨时间比较运行结果的研究循环来说,这意味着环境本身在两次迭代之间就在漂移,悄悄地破坏了可复现性。
💡#23
@ayushthought
https://x.com/ayushthought/status/2102571072667406732
在回复 Boris Cherny 的形式化验证工作时,这位用户说到了循环层面:出问题的很少是模型本身,而是状态、重试、两个工具调用同时抢同一个东西。把 TLA+ 用在 agent 循环本身上很有道理,他还追问 Lean 有没有抓到 TLA+ 漏掉的问题。形式化方法正在从产品代码挪到 harness 上。
💡#24
@TraTTow_br
https://x.com/TraTTow_br/status/2103205349285048333
一位开发者在发布密集周的观察:agent 编程变便宜了。Opus 5.5 的缓存读取降到每百万 token 0.2 美元,比 Opus 5 低 60%;GPT-6 Luna 输入 0.1、输出 0.5 美元。他的结论会改变循环的设计:他的 agent 循环里大部分步骤,已经根本不需要前沿模型了。
💡#25
@TomasMann1878
https://x.com/TomasMann1878/status/2103439386855530981
这位用户说,让本地模型通宵跑是一次巨大的解锁:autoresearch 很轻松,用 27B 的 Qwen 写代码没问题,生图更是小菜。他的建议很老派:买张显卡。随着前沿模型的额度收紧、重置次数被限量,本地通宵循环正在成为想不看计费表就能反复迭代的人的默认选择。
💡#26
@ironseth_s
https://x.com/ironseth_s/status/2103202528443920753
在一条讲大额悬赏难题的帖子下,这位用户说自己把自制的 autoresearch 循环对准了其中一道题。还没解出来,但用他的话说:如果 agent 没在骗我,我们正在接近答案。这句保留意见正是现状最诚实的描述:循环跑得起来,悬而未决的是它的进度汇报能不能信。
💡#27
@Yim0e
https://x.com/Yim0e/status/2103369417149255782
一个小小的独立项目:这位用户在用 auto-research 的方式做篮球数据分析,用模型搭网站、追他自己关心的指标,到目前为止还没有一个超过公开已有的数据。没有自己的算力,循环就一直在消耗订阅额度。这是业余 autoresearch 的真实写照:方法放哪都能用,预算不行。
💡#28
@dangreenheck
https://x.com/dangreenheck/status/2103505503913402500
一位正在逐步退出素材销售和咨询业务的 Three.js 开发者,在考虑做一款完整的游戏。在最新一代前沿模型出现之前,他并不觉得这件事可能,因为有些必需的技能他并不具备。他希望一个更大的项目能让他走出「agent 循环地狱」,重新去思考更大的系统。这点出了一种真实的疲惫:当每个小时都花在照看循环上时,工作的尺度就缩小到了一个循环能装下的大小。
💡#29
@bendee983
https://x.com/bendee983/status/2103151828405768644
一个关于 AI 编程经济走向的类比:加工食品与有机食品。token 越来越便宜,很多公司会把预算花在编程 agent 上而不是优秀工程师身上,接受能跑但粗糙的代码,再多烧 token 让 agent 循环自己审查、自己纠错。富有的公司则会为人类工程师支付溢价,一是为了拿到更好的结果,二是为了在人参与的循环里产出高质量训练数据。人工审查,变成了那张「有机」标签。
📡 生态产品雷达
生态产品雷达

Jev —— 16 次提及
GPT-6 Sol —— 8 次提及
MCP —— 8 次提及
GPT-6 Astra —— 7 次提及
Opus 5.5 —— 6 次提及
Fable —— 5 次提及
Codex —— 4 次提及
GPT-6 Luna —— 4 次提及
Pi —— 4 次提及
SoL-Pi —— 4 次提及
Perplexity —— 4 次提及
Grok 4.7 —— 3 次提及
OpenRSI —— 3 次提及
x402 —— 3 次提及
Kubernetes —— 3 次提及
← 上一篇
超级用户日报: 2026-09-26
下一篇 →
灵感雷达: 2026-09-26
← 返回所有文章

评论

加载中...
>_