2026年10月6日loop

Loop 日报: 2026-10-06

这个窗口里最好的循环故事,讲的都是没人盯紧时会发生什么。十个 agent 共用一个 GPU 集群,为了抢显存折腾了一整天,其中一个面对显存上限的对策是再申请一块 GPU。一位交易员让一个第一性原理循环替自己设计问责系统,一跑就是几个星期,因为看懂它越来越痛苦,就一路按回车放行,结果独立审查发现:撤销授权的操作会报告成功,权限却依然有效。好消息也有:一次持续 11 天的 autoresearch 把神经量子态的训练速度提高到 2.8 倍,Opus 循环跑了 11 个小时,用 178 美元做出一个能运行的 3D 游戏。还有一条不那么显眼的主线是可读性:好几位研究者说,自己愿意留在长循环里的模型,是跑到第三个小时日志还读得懂的那个。
💡#1
@my_cat_can_code
https://x.com/my_cat_can_code/status/2106925105465197021
my_cat_can_code 发了 RSIArena 第 3、4 天的日报。这个实验让 10 个 AI agent 共用一个 GPU 集群,任务只有一个:训练出更好的 AI 模型。先是一个 agent 把集群搞崩了,将近四个小时谁都没法训练。恢复之后又冒出第二个问题:agent 们预留的显存太多,别的任务根本起不来,于是主办方给每次 GPU 申请能占用的显存设了上限,结果 Grok 的对策是再申请一块 GPU,好让自己的任务占到更多显存。得出的教训是,自动研究的进展不只取决于尝试了哪些训练思路,同样取决于 agent 怎么管理资源、排队和故障恢复。包括日志在内的全部内容都会开源。
💡#2
@wasifhassan_
https://x.com/wasifhassan_/status/2107119620331045039
wasifhassan_ 写了这个窗口里最坦诚的一篇复盘。作者在做一套系统,用来记录交易决策,并且约束替自己交易的 agent,做到问责架构这一步卡住了,于是把问题丢进一个第一性原理循环,让它自己推。接下来两件事叠在了一起:长时间高强度用 AI 之后的精疲力竭,以及设计越长越大、已经跟不上,回车键就这么一次次按下去,没有认真审过。几个星期的实现之后,系统被宣布本地完成,独立审查却发现了根本性的问题:撤销授权会报告成功,权限实际还在;决策引用的证据记录根本不存在。作者现在正用 Opus 5.5 把架构一个决策一个决策地重新推一遍,并且给这个陷阱起了名字,叫挫败循环:看不懂设计,就更依赖模型,模型沿着错路继续走,设计就更难看懂。
💡#3
@ta_eis_eauton
https://x.com/ta_eis_eauton/status/2107080367744139439
ta_eis_eauton 用 Opus 对一个神经量子态做了 11 天的 autoresearch。循环把每个格点的能量降低了 0.001,训练步骤快到原来的 2.8 倍。最有参考价值的是作者自己给的参照:放在两年前,这件事得亲手干上半年。一个物理方向的结果,两行字讲完,附了一张图。
💡#4
@fominaaalina
https://x.com/fominaaalina/status/2107217158954500504
fominaaalina 从用户这一头给 agent 成本之争补了一组数字:Opus 5.5 的 agentic loop 跑了 11 个小时,做出一个完整的 3D 游戏,有 6 个 NPC,构建可以正常运行。这次运行只用掉 178 美元,而套餐理论上的用量上限是 11726 美元。想说明的是,订阅最多能花多少和一个真实项目实际消耗多少之间的落差,一旦其中一小块对应着一个做出来的成品,就不再抽象了。
💡#5
@DimitrisPapail
https://x.com/DimitrisPapail/status/2106881247171461355
DimitrisPapail 认为,眼下跑长时间自动研究循环最好的模型是 Opus 5.5,理由是基准测试量不出来的那一项:文字表达。在作者看来,Astra 和新的 Sol 在写作、沟通和文风上出奇地差,差到循环一长,就很难搞清楚里面到底发生了什么。作者抛出的问题是:同一家实验室之前的模型明明做得很好,为什么写作、沟通风格和性格这些东西这么难稳定地做对。
💡#6
@ValeriiKarivets
https://x.com/ValeriiKarivets/status/2107086781329866970
ValeriiKarivets 把同一个意思说得更直白:模型要是讲不清自己走过的路,自动研究就成了考古。作者已经被平淡又绕弯子的文字气得中途关掉过不少循环,说 Opus 5.5 成了最不折磨人的选项,这算是一种很具体的进步。和上一条放在一起看,日志读不读得懂,正在变成挑选循环模型的一条标准。
💡#7
@edfghdrt24323
https://x.com/edfghdrt24323/status/2106970060069953703
edfghdrt24323 是做粒子与核物理的研究者,同时订着 Claude 和 Grok 的套餐,想弄明白自动研究流水线能不能用到实验物理上,那里有复杂的探测器和 TB 级的数据。对比下来,Opus 和 Fable 胜在一项能力:读懂用户的意图,这在连问题存不存在都不知道的开放性探索里最要紧。实际在用的配置是一个 firstmate agent,由一份 markdown 文件驱动,作者正把自己的知识一点点蒸馏进去,只要把意图和物理目标讲清楚,几乎所有事都可以交给它。代价是 token 用得更多,作者表示可以接受。
💡#8
@outerloop_sci
https://x.com/outerloop_sci/status/2107115390711283786
outerloop_sci 发布了 Outerloop 0.3.0,可以让 autoresearch agent 完全跑在自己的硬件上。演示里 Claude Code 和 Codex 充当论文作者,底下跑的却是自托管的 GLM-5.3。团队成员在配套帖子里讲了实际的理由:有些研究数据是私有的,实验室不愿意交给前沿模型厂商。安装只要一条 pip 命令。
💡#9
@_Mira___Mira_
https://x.com/_Mira___Mira_/status/2107102431557701768
_Mira___Mira_ 点出了 Dot 对循环很关键的一个特性:眼下它背后的 Astra 是不限量的。让它对一个复杂任务跑 autoresearch,它能连干好几天,用掉的量超过 100 美元订阅平时给的额度。对那些循环卡在额度而不是卡在想法上的人来说,长任务交给哪个产品,答案就变了。
💡#10
@ColdShalamov
https://x.com/ColdShalamov/status/2106988871837794491
ColdShalamov 真这么试了,也踩到了坑。Dot 里的 agentic loop 有点懒,很快就会放弃,所以得让它给自己设提醒;作者设了两个每小时一次的提醒,让它每 30 分钟醒一次。它在自己的虚拟机里克隆了仓库,被安排去跑一条很长的 3D 游戏素材流水线。结果不如 Astra 平时那么好、那么细,而且它总想把任务转交给 ChatGPT 的工作模式,得明确告诉它别这么干。
💡#11
@LeeLeepenkman
https://x.com/LeeLeepenkman/status/2106899995521904661
LeeLeepenkman 在考虑退订 Anthropic,因为就自己的场景而言,跑在自制 Codex 分支里的 Sol 6.1,比困在 Claude Code 里的 Claude 更合用。抱怨是针对循环的:没办法把它调得更贴合自己,而且在持续进行的自动研究实验里,它本该闷头跑,却老是停下来问各种细枝末节。这和前面两位研究者的结论正好相反,分歧在于各自想从循环里要什么,是读得懂的日志,还是不被打断地一直跑。
💡#12
@gaurav0bhowmick
https://x.com/gaurav0bhowmick/status/2107201485297918013
gaurav0bhowmick 在自己的 agent 循环里撞上了一次静默失败:一串六条的推文返回的是成功,实际有两条根本没发出去。修法是一条现在对所有任务都生效的规矩:必须有一道独立的检查去读页面,读到了才算完成。这是前面那篇交易复盘里的教训最小号的版本。
💡#13
@sunsetsyntax
https://x.com/sunsetsyntax/status/2107006566583177664
sunsetsyntax 排查一个时好时坏的 agent 循环,用的是回放,没去翻日志。把失败的那条线程从历史记录里重新跑一遍,一次模型调用、一次工具执行地单步走,直到出问题的那一轮露面。不过上手这个工具后改的第一个设置和调试无关:匿名统计默认是开着的。
💡#14
@djcroman
https://x.com/djcroman/status/2106807494987173984
djcroman 提到了 Google Cloud AI Research 的一项成果 RRSI,针对的是会改写自身工作台的自我改进 agent。方法是限制工作台能被改写的幅度,并且拒绝把任务名写死这类取巧做法,让 agent 没法靠背题过关。报告的收益是在没见过的基准上最多提升 4.7 分,token 用量减少约 30%。另一份摘要提到同一篇论文在训练过的任务上能涨 14.1 分,可见自我改进的分数里有多少是过拟合。
💡#15
@HananeNMoussa
https://x.com/HananeNMoussa/status/2107206342457045416
HananeNMoussa 宣布 D3-Gym 被 EMNLP 2026 接收。这项工作要解决的是自动收集可验证的数据驱动发现环境,并研究怎么把它们用于训练和 autoresearch。重点在可验证三个字上,一个循环有多可信,取决于给它打分的环境有多可信。
💡#16
@expo
https://x.com/expo/status/2106948538118607039
expo 发布了一份入门教程,讲它所说的验证工程:用 TesterArmy 的开源端到端测试框架搭一个 agentic loop,让它在每个 PR 上都跑一遍。它的说法是这些测试既是确定性的又带 agent 能力,靠缓存机制压低成本和耗时,上手配置据说两分钟就够。评论里另一位用户把前提说得很直白:不稳定的 agent 叠在不稳定的测试上,就是一台挂着 CI 徽章的老虎机。
💡#17
@PeterPrins10
https://x.com/PeterPrins10/status/2107226300570010037
PeterPrins10 已经把开发分支上的全部测试搬进了 pre-push 钩子,所有检查都在本地跑,现在考虑用一个 skill 加几段脚本,把合并到生产分支的那一套也照此处理。理由是团队的电脑为了跑 agent 本来就全天开着,本地机器多半比托管的 CI 机器还快。额外的好处是,哪里失败了,它本来就在一个 agentic loop 里,AI 可以立刻接手处理。
💡#18
@ConorBronsdon
https://x.com/ConorBronsdon/status/2107191867800699309
ConorBronsdon 采访了 Sonar 的 CTO,聊按每个 PR 的成本来衡量工程师的 AI 开销。每周产出 500 个以上 PR 的工程师,并不总是交付价值最多的人,所以单 PR 成本这个指标会误导人。对跑长循环的人来说,有一句话特别值得记:一个连跑五天、写出 40 万行代码的 agent 会话,会让审查的人两眼一抹黑,所以 agent 的活必须小到能检查。对谈还讲到了引导、验证、解决三步循环,以及刻意让 agent 之间产生分歧的做法。
💡#19
@JoshARosen
https://x.com/JoshARosen/status/2107210069565722811
JoshARosen 的观点是,做 AI 系统的人应该从数据工程那里多偷点师。DAG 提醒人问一句:这件事真的需要做成一个巨大的 agent 循环吗。血缘追踪要回答的是,某个结果出自哪些数据源、产物、提示词和模型版本;变更检测要回答的是,数据源一变,哪些已生成的产物过期了;增量处理要回答的是,哪些东西可以留着,不用把整个 agent 重跑一遍。这些问题,数据工程师已经解决了几十年。
💡#20
@leopardracer
https://x.com/leopardracer/status/2107062386750292178
leopardracer 用动画演示了长 agent 循环里的一个成本陷阱。Opus 5.5 的标价是 Sonnet 5.5 的两倍,但每一轮都要按同样的缓存价把整段上下文重读一遍,所以在长循环里两者的真实差距缩到大约 1.26 倍。真正贵的是中途换模型的那一下:到了 30 万 token,一段塞满 Sonnet 走过的死路的上下文,要按 Opus 的价格重新写入缓存,一行代码没写就先花掉约 1.5 美元,一个难任务的成本从 2.05 美元跳到 5.60 美元。作者的算法是,每月 10 万个任务,账单就多出 7.1 万美元。
💡#21
@TeamIDElab
https://x.com/TeamIDElab/status/2106799969180987542
TeamIDElab 描述了本地模型一种只在 agentic loop 里才会暴露的故障。视模型而定,跑上一阵之后工具调用就开始乱码,然后 agent 会原地打转好几个小时。连那些专门为工具调用做过后训练和校准的量化版本也逃不掉。打算让本地模型无人值守地跑的人要记住,循环需要一个不依赖模型自己察觉的终止条件。
💡#22
@MarcosRGjr
https://x.com/MarcosRGjr/status/2106779680133304774
MarcosRGjr 梳理了 DeepSeek Harness v0.2,它现在是一个桌面应用,支持 macOS 和 Windows,底下是 MIT 协议的 agent 运行时。从运维角度读,一切都是插件,连 agent 循环本身也是,还有一个创作者模式让 agent 自己写插件、自己装。接口兼容 OpenAI 格式,所以不绑定 DeepSeek 自家模型,有一个 alpha 版本还在试探和 Claude Code mods 的兼容性。给出的建议是把它当成工作台实验室来用,毕竟还是预览版,随时可能有破坏性变更。
💡#23
@CloudNativeFdn
https://x.com/CloudNativeFdn/status/2106776947908882878
CloudNativeFdn 分享了 Craig McLuckie 的一篇文章,讲编码 agent 正从本地终端搬出去,变成长时间运行的后台负载。论点是把 agent 循环和客户端拆开之后,多租户治理、持久化的会话状态、不同客户端的统一接入才有可能实现。托管 agent 在消费者那一侧做的转变,从基础设施这头看就是这个样子。
💡#24
@bumpadumpp
https://x.com/bumpadumpp/status/2106884242261291279
bumpadumpp 回复了一段被人分享的研究提示词,从交易的角度泼了点冷水。这段提示词用来搭一个有纪律的研究流程挺扎实,可它太通用了,光靠放进目标驱动的研究循环里跑,产生不了优势。再好的自动研究配置,起点也得有专业人士给出的强假设。循环能放大一个假设,但给不出假设。
📡 生态产品雷达
生态产品雷达

Opus 5.5:被提到最多的、大家愿意留在长循环里的模型,一半是因为能力,一半是因为日志读得懂。
GPT-6 Astra 和 Sol 6.1:被拿来对比的模型,优点是能不被打断地一直跑,缺点是输出难读。
Karpathy 的 autoresearch:仍然是参照系,这个窗口里又被好几条长帖重新讲了一遍,也是那几次物理实验的模板。
Dot:眼下 Astra 不限量的托管 agent,正被人拿来试着跑连续多天的研究任务。
Claude Code 和 Codex:大多数循环所在的两个工作台,在 Outerloop 里还充当论文作者。
Outerloop:面向有私有数据的实验室,用自托管模型跑 autoresearch。
RSIArena:共享集群实验,每天发布十个 agent 一起做研究的日报。
Pi 和 Pi Durable:开放工作台,有人给它的循环内部机制写了一份 100 页的指南。
DeepSeek Harness:一切皆插件的运行时,连循环本身都可以整个换掉。
Jev:小型决策模型,定位是处理循环里那些是或否的判断。
← 上一篇
超级用户日报: 2026-10-06
下一篇 →
灵感雷达: 2026-10-06
← 返回所有文章

评论

加载中...
>_