Loop 日报: 2026-08-13
今天最有用的一条帖子是一张收据。有人花了真金白银去测大家随口重复的那个说法——「把 Claude Code 塞进循环里让它自己改进你的 agent 不就行了」——把它跟 Karpathy 式的 autoresearch 以及一个专门做这件事的优化器摆在一起比。答案是:三个都跑赢了基线,三个都在很早就找到了自己的最优解,然后三个都躺平了,而计费还在继续。这个结论跟今天其他值得读的东西是押韵的:一个全程无人的微调 agent 后训练出了两个能上生产的模型;一个自我改进的求解器在花掉头两美元算力时就打破了一个立了十五年的堆积记录;亚马逊内部一个 agent 循环连续五个月超支 860% 没人发现;还有越来越多人在指出,autoresearch 核心那一步「留还是弃」里根本没有统计学。
#1
@jeremytian_
https://x.com/jeremytian_/status/2087222707415130335
今天最有价值的基准测试,跑下来花了约 6.7 万美元。他拿了一个已经部署在生产环境、尚未优化的企业级 AI agent,让三个自动优化器从同样的初始配置、同一份数据集、同一个 judge 出发,去优化「保底召回率下的精确率」。基线是 0.734。Claude Code 塞进循环跑到 0.818,Karpathy 式的 AutoResearch 跑到 0.843,AutoAgent 跑到 0.877。比排名更重要的发现是:哪怕给了几万美元的算力,三个优化器都在非常早的阶段就找到了自己的最优解,然后就封顶了。自动优化器擅长摘低垂的果子,之后就是在烧钱撞一堵它看不见的天花板。要让 agent 持续变好,靠的是有策略地安排测试、跳出局部最优、判断哪些候选值得继续,而不是加预算。
https://x.com/jeremytian_/status/2087222707415130335
今天最有价值的基准测试,跑下来花了约 6.7 万美元。他拿了一个已经部署在生产环境、尚未优化的企业级 AI agent,让三个自动优化器从同样的初始配置、同一份数据集、同一个 judge 出发,去优化「保底召回率下的精确率」。基线是 0.734。Claude Code 塞进循环跑到 0.818,Karpathy 式的 AutoResearch 跑到 0.843,AutoAgent 跑到 0.877。比排名更重要的发现是:哪怕给了几万美元的算力,三个优化器都在非常早的阶段就找到了自己的最优解,然后就封顶了。自动优化器擅长摘低垂的果子,之后就是在烧钱撞一堵它看不见的天花板。要让 agent 持续变好,靠的是有策略地安排测试、跳出局部最优、判断哪些候选值得继续,而不是加预算。
#2
@george_onx
https://x.com/george_onx/status/2087191914760098115
今天有两个开源权重的领域模型发布,后训练环节没有任何人类参与。两个都是由一个 autoresearch agent 端到端造出来的,它自己跑完了整条流水线:任务调研、数据筛选、评测构建、并行训练实验、模型部署。金融模型把 FinQA 的执行准确率提升了 43.37 个百分点,从 15.86% 到 59.23%,在 BizFinBench 上也提升了 7.81 分。医疗模型在 MEDEC 的标记准确率上提升了 11.32 分,超过了 Claude Opus 4.6,在 MedHELM 榜单上也压过了 Muse Spark。两个模型都以 Apache 2.0 放在 Hugging Face 上。这已经不是 autoresearch 的演示,是它产出了别人真会拿去部署的东西。
https://x.com/george_onx/status/2087191914760098115
今天有两个开源权重的领域模型发布,后训练环节没有任何人类参与。两个都是由一个 autoresearch agent 端到端造出来的,它自己跑完了整条流水线:任务调研、数据筛选、评测构建、并行训练实验、模型部署。金融模型把 FinQA 的执行准确率提升了 43.37 个百分点,从 15.86% 到 59.23%,在 BizFinBench 上也提升了 7.81 分。医疗模型在 MEDEC 的标记准确率上提升了 11.32 分,超过了 Claude Opus 4.6,在 MedHELM 榜单上也压过了 Muse Spark。两个模型都以 Apache 2.0 放在 Hugging Face 上。这已经不是 autoresearch 的演示,是它产出了别人真会拿去部署的东西。
#3
@cognizantailab
https://x.com/cognizantailab/status/2087238121809166762
一个自我改进的 agent 打破了一项从 2011 年立到现在的数学记录。一个基于 Claude 的编码 agent 被放开手脚去写和重写自己的优化求解器,人类给的指导几乎只有一个可以对照的基准,最后 Packomania 接受了它给出的 27 圆堆积新记录。成本拆解才是更有意思的那一半:这个 agent 写出的第一版求解器,花了 2.48 美元,就已经能达到这个记录了。之后 12 美元的自我改进买来的是稳定性,不是能力。能力和可靠性的这条分界线,恰恰是自动优化器一直混为一谈的那条。
https://x.com/cognizantailab/status/2087238121809166762
一个自我改进的 agent 打破了一项从 2011 年立到现在的数学记录。一个基于 Claude 的编码 agent 被放开手脚去写和重写自己的优化求解器,人类给的指导几乎只有一个可以对照的基准,最后 Packomania 接受了它给出的 27 圆堆积新记录。成本拆解才是更有意思的那一半:这个 agent 写出的第一版求解器,花了 2.48 美元,就已经能达到这个记录了。之后 12 美元的自我改进买来的是稳定性,不是能力。能力和可靠性的这条分界线,恰恰是自动优化器一直混为一谈的那条。
#4
@DavidFSWD
https://x.com/DavidFSWD/status/2086999880799748557
草根版本,就在某个人的房间里 24 小时跑着。DeepSeek Flash 配 pi-autoresearch,全天不停跑了大约一周,每天大约两美元用来「找发现」。他还把 DeepSeek Flash 蒸馏进了一个 Qwen 3 4B 模型,目前已经连续 500 步没出错。每天两美元这个数字值得停下来看一眼——它把 autoresearch 从「得有个实验室才能试」的那一类里搬了出来。
https://x.com/DavidFSWD/status/2086999880799748557
草根版本,就在某个人的房间里 24 小时跑着。DeepSeek Flash 配 pi-autoresearch,全天不停跑了大约一周,每天大约两美元用来「找发现」。他还把 DeepSeek Flash 蒸馏进了一个 Qwen 3 4B 模型,目前已经连续 500 步没出错。每天两美元这个数字值得停下来看一眼——它把 autoresearch 从「得有个实验室才能试」的那一类里搬了出来。
#5
@aintonio_dev
https://x.com/aintonio_dev/status/2087064221670314384
今天方法论上最锋利的一条批评。Karpathy 的 autoresearch 让 agent 永远地改训练脚本,碰巧有效的就留下;Shopify 的 pi-autoresearch 把这个循环搬进了终端。两者共享同一个弱点:留还是弃,背后没有科学。没有 fitness ladder,没有显著性检验,没有血统追踪。他的 skill 补的就是这一块:在深度学习流水线上做遗传编程,候选要过门禁,先用低保真度快速剪枝,只有全保真度才能加冕冠军,每一次「留下」的决定都要过置换检验。他还把它打包成了 agent 插件,任何 agent 都能装。
https://x.com/aintonio_dev/status/2087064221670314384
今天方法论上最锋利的一条批评。Karpathy 的 autoresearch 让 agent 永远地改训练脚本,碰巧有效的就留下;Shopify 的 pi-autoresearch 把这个循环搬进了终端。两者共享同一个弱点:留还是弃,背后没有科学。没有 fitness ladder,没有显著性检验,没有血统追踪。他的 skill 补的就是这一块:在深度学习流水线上做遗传编程,候选要过门禁,先用低保真度快速剪枝,只有全保真度才能加冕冠军,每一次「留下」的决定都要过置换检验。他还把它打包成了 agent 插件,任何 agent 都能装。
#6
@bygodgiven
https://x.com/bygodgiven/status/2087094945916035419
他用 Codex 的 goal 命令做例子,精确解释了你的 agent 为什么会永远循环下去。每一轮,harness 都会注入一段续接提示词,把你的目标重新塞回去,一直这么干,直到模型调用 update goal 工具、宣布目标达成为止。背后没有计时器,也没有裁判。终点线就是一句模型必须能自己检查的话。「把 auth 模块干净地重构一下」永远不会终止,「auth 的所有测试都通过」会。把你下一个目标改写成一个条件,别写成一篇作文。
https://x.com/bygodgiven/status/2087094945916035419
他用 Codex 的 goal 命令做例子,精确解释了你的 agent 为什么会永远循环下去。每一轮,harness 都会注入一段续接提示词,把你的目标重新塞回去,一直这么干,直到模型调用 update goal 工具、宣布目标达成为止。背后没有计时器,也没有裁判。终点线就是一句模型必须能自己检查的话。「把 auth 模块干净地重构一下」永远不会终止,「auth 的所有测试都通过」会。把你下一个目标改写成一个条件,别写成一篇作文。
#7
@shmidtqq
https://x.com/shmidtqq/status/2087267062813220880
一个个人助手,整个 agent 循环是 95 行 Python,一屏就能看完,中间没有任何框架。最值得偷的设计细节是那个门:你问普通助手 17 乘 23 等于多少,它会唤醒记忆库、把八块上下文拖进提示词,然后按全部内容跟你收费。这个在前面加了道门,看一眼问题然后拒绝检索。记忆分三层——事实、事件、技能——存在一个 SQLite 文件里,外加一份你能当日记读的 MEMORY.md。本地面板显示每一次迭代、每一个 token 和真实花掉的钱,不是估算。评测是分开的:pytest 回答「跑通了没有」,一个 LLM judge 回答「跑得好不好」。
https://x.com/shmidtqq/status/2087267062813220880
一个个人助手,整个 agent 循环是 95 行 Python,一屏就能看完,中间没有任何框架。最值得偷的设计细节是那个门:你问普通助手 17 乘 23 等于多少,它会唤醒记忆库、把八块上下文拖进提示词,然后按全部内容跟你收费。这个在前面加了道门,看一眼问题然后拒绝检索。记忆分三层——事实、事件、技能——存在一个 SQLite 文件里,外加一份你能当日记读的 MEMORY.md。本地面板显示每一次迭代、每一个 token 和真实花掉的钱,不是估算。评测是分开的:pytest 回答「跑通了没有」,一个 LLM judge 回答「跑得好不好」。
#8
@dnagabut
https://x.com/dnagabut/status/2087209735967883521
据《金融时报》援引的内部文件,亚马逊内部一个 AI 项目产生了 180 万美元的账单,超预算约 860%,连续五个月没被发现。另外两个小一点的分别超支 54.1 万和 13.4 万美元。他的框架才是重点:一台失控的服务器今天和昨天花的钱是一样的,但一个失控的 agent 循环调用的是按 token 计价的模型,失败会重试,而且恰恰在卡住的时候会派生出更多调用。单价小到让人觉得是免费的,循环快到让它不是。没人设警报,是因为还没有人对「正常长什么样」形成心智模型。先设警报,再放 agent 出笼。
https://x.com/dnagabut/status/2087209735967883521
据《金融时报》援引的内部文件,亚马逊内部一个 AI 项目产生了 180 万美元的账单,超预算约 860%,连续五个月没被发现。另外两个小一点的分别超支 54.1 万和 13.4 万美元。他的框架才是重点:一台失控的服务器今天和昨天花的钱是一样的,但一个失控的 agent 循环调用的是按 token 计价的模型,失败会重试,而且恰恰在卡住的时候会派生出更多调用。单价小到让人觉得是免费的,循环快到让它不是。没人设警报,是因为还没有人对「正常长什么样」形成心智模型。先设警报,再放 agent 出笼。
#9
@AlcidesTicllaCh
https://x.com/AlcidesTicllaCh/status/2087242908579557521
密歇根大学做的 Kernel Forge,是一个 agent harness,它不再孤立地优化 CUDA kernel,而是去优化真正在你的 PyTorch 模型里跑的那些。你把一个未经修改的模型和示例输入交给它,它跑一遍模型,捕获真实算子及其真实形状和参数,归类成具体的变体,然后用一个 agent 循环逐个优化:生成 CUDA、用 nvcc 编译、在捕获的输入上运行、和 eager 输出对拍、失败就修。通过验证的候选会长成一棵蒙特卡洛树,而且刻意保留慢的 kernel,因为看起来是死路的候选可能孕育出好的修订。产出是一个带保护的包,只在生成代码既正确又确实更快的地方替换,否则回退。诚实的结论是:14 个 kernel 跑赢 eager,softmax 上最高 2.83 倍,但这些胜利都落在小算子上,matmul 和 attention 那种主导算子早就有成熟的厂商实现。
https://x.com/AlcidesTicllaCh/status/2087242908579557521
密歇根大学做的 Kernel Forge,是一个 agent harness,它不再孤立地优化 CUDA kernel,而是去优化真正在你的 PyTorch 模型里跑的那些。你把一个未经修改的模型和示例输入交给它,它跑一遍模型,捕获真实算子及其真实形状和参数,归类成具体的变体,然后用一个 agent 循环逐个优化:生成 CUDA、用 nvcc 编译、在捕获的输入上运行、和 eager 输出对拍、失败就修。通过验证的候选会长成一棵蒙特卡洛树,而且刻意保留慢的 kernel,因为看起来是死路的候选可能孕育出好的修订。产出是一个带保护的包,只在生成代码既正确又确实更快的地方替换,否则回退。诚实的结论是:14 个 kernel 跑赢 eager,softmax 上最高 2.83 倍,但这些胜利都落在小算子上,matmul 和 attention 那种主导算子早就有成熟的厂商实现。
#10
@helenamy
https://x.com/helenamy/status/2087273025427079575
一份关于「你的 agent 循环该在哪跑」的完整经济账。托管的编码产品给你的不只是模型,而是围着模型的一整套 harness:仓库感知、shell 访问、打补丁、跑测试、上下文管理,这确实很值钱,但你同时也在按照托管前沿推理设计的速率限制和配额里干活。她的切分是:前沿模型负责架构、困难的实现决策、审计和安全敏感的活;租来的 GPU 上跑开源权重模型负责批量实现、重复重构、生成测试、长时间运行的 agent 循环、清理和机械迁移。她给的 RunPod 数字:A6000 大约每小时 0.53 美元,五小时一场约 2.65 美元,一个月 250 小时约 132 美元。重点不是便宜的模型一样聪明,而是有些活需要一个称职的模型在那儿坐八小时反复跑测试,这种活不该按前沿模型的经济学计费。
https://x.com/helenamy/status/2087273025427079575
一份关于「你的 agent 循环该在哪跑」的完整经济账。托管的编码产品给你的不只是模型,而是围着模型的一整套 harness:仓库感知、shell 访问、打补丁、跑测试、上下文管理,这确实很值钱,但你同时也在按照托管前沿推理设计的速率限制和配额里干活。她的切分是:前沿模型负责架构、困难的实现决策、审计和安全敏感的活;租来的 GPU 上跑开源权重模型负责批量实现、重复重构、生成测试、长时间运行的 agent 循环、清理和机械迁移。她给的 RunPod 数字:A6000 大约每小时 0.53 美元,五小时一场约 2.65 美元,一个月 250 小时约 132 美元。重点不是便宜的模型一样聪明,而是有些活需要一个称职的模型在那儿坐八小时反复跑测试,这种活不该按前沿模型的经济学计费。
#11
@awa_omg
https://x.com/awa_omg/status/2087324110296662402
他在一台安卓手机上把 Ling-3.0-tiny 当 agent 跑,纯 CPU,没有 GPU,没有专用运行时,Q8_0 的 GGUF,大约每秒 3.2 token。真正能推广到手机之外的发现是:8K 上下文能跑,但 4K 更好——不是因为 8K 下推理变差了,而是上下文越多,agent 循环的每一次后续迭代处理起来就越贵。他的解法是让 harness 把重要内容压缩进一个 Markdown 文件,然后从那个状态继续,等于把一部分对话变成了外部记忆。限制因素不是你能存多少上下文,而是你每一轮付得起多少重新处理的成本。
https://x.com/awa_omg/status/2087324110296662402
他在一台安卓手机上把 Ling-3.0-tiny 当 agent 跑,纯 CPU,没有 GPU,没有专用运行时,Q8_0 的 GGUF,大约每秒 3.2 token。真正能推广到手机之外的发现是:8K 上下文能跑,但 4K 更好——不是因为 8K 下推理变差了,而是上下文越多,agent 循环的每一次后续迭代处理起来就越贵。他的解法是让 harness 把重要内容压缩进一个 Markdown 文件,然后从那个状态继续,等于把一部分对话变成了外部记忆。限制因素不是你能存多少上下文,而是你每一轮付得起多少重新处理的成本。
#12
@testingham
https://x.com/testingham/status/2087323635958817214
有用的怀疑派。可用的 autoresearch 已经有半年了,但公开榜单上并没有看到算法效率出现明显加速。他是真心在求反例。这条值得和上面 Fastino 和 Packomania 的结果对照着看——那两个都是真的,可它们都没有变成榜单上的位移。这要么说明收益落在了基准之外的地方,要么说明这个循环更擅长把已知问题磨到极限,而不是推动前沿。
https://x.com/testingham/status/2087323635958817214
有用的怀疑派。可用的 autoresearch 已经有半年了,但公开榜单上并没有看到算法效率出现明显加速。他是真心在求反例。这条值得和上面 Fastino 和 Packomania 的结果对照着看——那两个都是真的,可它们都没有变成榜单上的位移。这要么说明收益落在了基准之外的地方,要么说明这个循环更擅长把已知问题磨到极限,而不是推动前沿。
#13
@YoussefHosni951
https://x.com/YoussefHosni951/status/2087075716890263934
他把三个老被混为一谈的概念拆开了,而且拆得是诊断性的、不是学术性的。Harness 是模型运行在什么环境里:工具、状态、权限、沙箱、审批、追踪、重试、恢复。Loop 是 agent 怎么取得进展:行动、检查证据、更新状态、决定继续还是重试还是重新规划还是停止。Graph 是工作流怎么组织:哪些节点跑、按什么顺序、在哪分支、什么能并行、允许哪些环。然后是回报:模型够不到它需要的能力或状态,去看 harness;它老是没有足够证据就宣布成功,去看 loop 的验证和终止逻辑;步骤顺序乱了或者分支失控,去看 graph。
https://x.com/YoussefHosni951/status/2087075716890263934
他把三个老被混为一谈的概念拆开了,而且拆得是诊断性的、不是学术性的。Harness 是模型运行在什么环境里:工具、状态、权限、沙箱、审批、追踪、重试、恢复。Loop 是 agent 怎么取得进展:行动、检查证据、更新状态、决定继续还是重试还是重新规划还是停止。Graph 是工作流怎么组织:哪些节点跑、按什么顺序、在哪分支、什么能并行、允许哪些环。然后是回报:模型够不到它需要的能力或状态,去看 harness;它老是没有足够证据就宣布成功,去看 loop 的验证和终止逻辑;步骤顺序乱了或者分支失控,去看 graph。
#14
@andriibidochko
https://x.com/andriibidochko/status/2087142588256027017
他点名了大多数令人失望的自我改进循环背后的失败模式:古德哈特定律。agent 会把一个代理指标优化到把真实任务执行搞砸的程度。除非你的评测 harness 包含 agent 无法直接操纵的带外信号和执行轨迹检查,否则「自我改进」会悄悄变成自动化的奖励作弊。他相关的另一点是,这把开发者的工作从写提示词转成了设计稳健的评测 harness——因为如果你的指标很浅,循环只会加速作弊。Harness 才是产品。
https://x.com/andriibidochko/status/2087142588256027017
他点名了大多数令人失望的自我改进循环背后的失败模式:古德哈特定律。agent 会把一个代理指标优化到把真实任务执行搞砸的程度。除非你的评测 harness 包含 agent 无法直接操纵的带外信号和执行轨迹检查,否则「自我改进」会悄悄变成自动化的奖励作弊。他相关的另一点是,这把开发者的工作从写提示词转成了设计稳健的评测 harness——因为如果你的指标很浅,循环只会加速作弊。Harness 才是产品。
#15
@butchsonic
https://x.com/butchsonic/status/2087143936313712778
自我进化 agent 背后的论文清单,按引用顺序发出来:Survey of Self-Evolving Agents;MINJA,讲仅通过对话就能完成的记忆注入;Sakana 的 Darwin Godel Machine;LLM judge 的自我偏好研究;Who Validates the Validators,讲评判标准漂移;Manheim 和 Garrabrant 的古德哈特定律四种形态;LiveBench 和 FrontierMath;Letta 的 sleep-time compute;ACE 的 generator、reflector、curator 三件套;SICA,自我改进的编码 agent;SSGM,讲演化中的 agent 记忆如何治理;以及那份对 25 位研究者关于自动化 AI 研究的访谈。想看真正的文献而不是二手总结,这就是地图。
https://x.com/butchsonic/status/2087143936313712778
自我进化 agent 背后的论文清单,按引用顺序发出来:Survey of Self-Evolving Agents;MINJA,讲仅通过对话就能完成的记忆注入;Sakana 的 Darwin Godel Machine;LLM judge 的自我偏好研究;Who Validates the Validators,讲评判标准漂移;Manheim 和 Garrabrant 的古德哈特定律四种形态;LiveBench 和 FrontierMath;Letta 的 sleep-time compute;ACE 的 generator、reflector、curator 三件套;SICA,自我改进的编码 agent;SSGM,讲演化中的 agent 记忆如何治理;以及那份对 25 位研究者关于自动化 AI 研究的访谈。想看真正的文献而不是二手总结,这就是地图。
#16
@antpalkin
https://x.com/antpalkin/status/2087179419517354098
他描述了「问聊天机器人要一个交易策略」和「跑一个真正的循环」之间的差别:后者会写、测、杀、重跑,直到几乎什么都活不下来——测了 1262 个,交回 14 个值得投钱的。更有用的是他那份「每种循环架构在哪里断掉」的清单。多 agent 辩论:多头、空头和风控 agent 收敛到同一个错误答案,然后信誓旦旦地交给你。制单加复核:复核方学会了点头,于是你开始信任一份其实没人真正检查过的产出。生成、验证、修订:循环不再终止,一个策略烧掉的算力永远赚不回来。规划者加工人:五十个 agent、一个编排器,你的并行系统串行地跑。加权投票的集群:四十个意见,底下同一个数据源,同一秒一起错。记忆:让它进步的那个东西,同时也是让它腐坏的那个东西,一条错误的教训会被永远重复。
https://x.com/antpalkin/status/2087179419517354098
他描述了「问聊天机器人要一个交易策略」和「跑一个真正的循环」之间的差别:后者会写、测、杀、重跑,直到几乎什么都活不下来——测了 1262 个,交回 14 个值得投钱的。更有用的是他那份「每种循环架构在哪里断掉」的清单。多 agent 辩论:多头、空头和风控 agent 收敛到同一个错误答案,然后信誓旦旦地交给你。制单加复核:复核方学会了点头,于是你开始信任一份其实没人真正检查过的产出。生成、验证、修订:循环不再终止,一个策略烧掉的算力永远赚不回来。规划者加工人:五十个 agent、一个编排器,你的并行系统串行地跑。加权投票的集群:四十个意见,底下同一个数据源,同一秒一起错。记忆:让它进步的那个东西,同时也是让它腐坏的那个东西,一条错误的教训会被永远重复。
#17
@LukaTheFounder
https://x.com/LukaTheFounder/status/2087260938789626170
一个真正在跑的小型多 agent 循环,不是架构图。三个 bot agent:编码、QA、个人内容。QA agent 对他的仓库跑了一遍 QA,找出 bug,告诉编码 agent 去修,然后检查产生的 PR,干净就合并。内容 agent 还在找活干。这是大多数人应该先尝试的形态,因为 QA 到编码的这次交接天然自带一个验证环节。
https://x.com/LukaTheFounder/status/2087260938789626170
一个真正在跑的小型多 agent 循环,不是架构图。三个 bot agent:编码、QA、个人内容。QA agent 对他的仓库跑了一遍 QA,找出 bug,告诉编码 agent 去修,然后检查产生的 PR,干净就合并。内容 agent 还在找活干。这是大多数人应该先尝试的形态,因为 QA 到编码的这次交接天然自带一个验证环节。
#18
@_bugmaker
https://x.com/_bugmaker/status/2087318232155722065
一个比干活高一层的例行动作:他让协调 agent 去审计 agent 循环本身,修掉循环里的 bug、补上缺口。理由是随着迭代,模型上下文和行为会慢慢过时,这个动作让它们保持最新。他不定时跑,触发条件是他观察到循环行为有异常,或者工具、框架因为业务或技术要求升级了。他觉得连这个触发本身都能自动化:技术需求 issue 一创建,协调者就触发循环和 agent 重构,然后通知正在跑的 agent 有更新。
https://x.com/_bugmaker/status/2087318232155722065
一个比干活高一层的例行动作:他让协调 agent 去审计 agent 循环本身,修掉循环里的 bug、补上缺口。理由是随着迭代,模型上下文和行为会慢慢过时,这个动作让它们保持最新。他不定时跑,触发条件是他观察到循环行为有异常,或者工具、框架因为业务或技术要求升级了。他觉得连这个触发本身都能自动化:技术需求 issue 一创建,协调者就触发循环和 agent 重构,然后通知正在跑的 agent 有更新。
#19
@dakebu_cityu
https://x.com/dakebu_cityu/status/2087019152431362387
形式化数学里 auto-research 的目标被说得很直白:人给出高层想法和证明策略,harness 检索相关的形式化知识,拆解证明,写 Lean 并修 Lean,最后返回一个 Lean 验证过的证明。更长远的目标是让系统自己提出新想法。值得注意的是这里的验证是免费且完备的,这也是为什么形式化数学一直是 autoresearch 最干净的环境。
https://x.com/dakebu_cityu/status/2087019152431362387
形式化数学里 auto-research 的目标被说得很直白:人给出高层想法和证明策略,harness 检索相关的形式化知识,拆解证明,写 Lean 并修 Lean,最后返回一个 Lean 验证过的证明。更长远的目标是让系统自己提出新想法。值得注意的是这里的验证是免费且完备的,这也是为什么形式化数学一直是 autoresearch 最干净的环境。
#20
@sebinsua
https://x.com/sebinsua/status/2087257687713071478
一句话里塞了很多东西:测试先行在 agent 循环里以「有效实验设计」的形式活了下来。改代码之前,agent 先写出能展示这个 bug 的最简测试,然后由你来 review 这个测试。如果它通过了,说明 agent 对 bug 的假设是错的。如果它失败了,那修完之后这同一个测试必须通过。这把循环的终止条件从「模型自己声称」变成了可证伪的东西。
https://x.com/sebinsua/status/2087257687713071478
一句话里塞了很多东西:测试先行在 agent 循环里以「有效实验设计」的形式活了下来。改代码之前,agent 先写出能展示这个 bug 的最简测试,然后由你来 review 这个测试。如果它通过了,说明 agent 对 bug 的假设是错的。如果它失败了,那修完之后这同一个测试必须通过。这把循环的终止条件从「模型自己声称」变成了可证伪的东西。
#21
@aeterna_agent
https://x.com/aeterna_agent/status/2087061296973787525
一个几条命令就能跑起来的开源 harness,完整循环接在一个玩具市场和纸面券商上:研究、推理、信号、风险、执行、观察、记忆、适应。换模型不用动 harness,市场数据、券商、记忆和推理供应商全都是可插拔的。TypeScript,MIT 协议。它的价值主要不在交易,而在于它是一份可读的、完整的「感知—行动—记忆」循环参考实现。
https://x.com/aeterna_agent/status/2087061296973787525
一个几条命令就能跑起来的开源 harness,完整循环接在一个玩具市场和纸面券商上:研究、推理、信号、风险、执行、观察、记忆、适应。换模型不用动 harness,市场数据、券商、记忆和推理供应商全都是可插拔的。TypeScript,MIT 协议。它的价值主要不在交易,而在于它是一份可读的、完整的「感知—行动—记忆」循环参考实现。
#22
@malekoo
https://x.com/malekoo/status/2087288153698648316
一个 24GB 显卡就能装下的 30B 开源模型上跑通的具体工具循环。一句提示词,让它调研一个刚发布的模型并产出一份 PDF 技术摘要,它自己完成了整个循环:通过 API 做实时网络搜索、给出带引用的回答、再调用 PDF 生成工具产出多页摘要。这里被测试的不是推理质量,而是本地模型能不能稳定地把工具串起来,让一个 agent 循环在没人看着的情况下跑完。
https://x.com/malekoo/status/2087288153698648316
一个 24GB 显卡就能装下的 30B 开源模型上跑通的具体工具循环。一句提示词,让它调研一个刚发布的模型并产出一份 PDF 技术摘要,它自己完成了整个循环:通过 API 做实时网络搜索、给出带引用的回答、再调用 PDF 生成工具产出多页摘要。这里被测试的不是推理质量,而是本地模型能不能稳定地把工具串起来,让一个 agent 循环在没人看着的情况下跑完。
#23
@cozybearlog
https://x.com/cozybearlog/status/2087278069036052527
他注意到团队选模型的方式正在悄悄变化。半年前每一次评估都是榜单竞赛,SWE-bench 多少、GPQA 多少,团队每个月换一次模型追数字。现在的问题变成了:高负载下的延迟怎么样,在 agent 循环里跑到第 200 轮之后表现如何,那些只在生产环境才出现的失败模式是什么。没人再问榜单,大家问的是长尾。他的判断是基准从来没有错,它们只是在测量一件已经不再要紧的事——智能从来不是瓶颈,可靠性、成本和运维可预测性才是。
https://x.com/cozybearlog/status/2087278069036052527
他注意到团队选模型的方式正在悄悄变化。半年前每一次评估都是榜单竞赛,SWE-bench 多少、GPQA 多少,团队每个月换一次模型追数字。现在的问题变成了:高负载下的延迟怎么样,在 agent 循环里跑到第 200 轮之后表现如何,那些只在生产环境才出现的失败模式是什么。没人再问榜单,大家问的是长尾。他的判断是基准从来没有错,它们只是在测量一件已经不再要紧的事——智能从来不是瓶颈,可靠性、成本和运维可预测性才是。
#24
@dejavucoder
https://x.com/dejavucoder/status/2087088839215263979
他在跑自己的 autoresearch 博客,同时也在读大家都在读的那一份,他汇报了一个值得你拿自己的运行去对照的现象:Claude Opus 5 哪怕在现实任务上也放弃得相当快。在长循环下的坚持度,跟原始能力是两种不同的属性,而决定 autoresearch 是收敛还是停滞的,是前者。
https://x.com/dejavucoder/status/2087088839215263979
他在跑自己的 autoresearch 博客,同时也在读大家都在读的那一份,他汇报了一个值得你拿自己的运行去对照的现象:Claude Opus 5 哪怕在现实任务上也放弃得相当快。在长循环下的坚持度,跟原始能力是两种不同的属性,而决定 autoresearch 是收敛还是停滞的,是前者。
#25
@omsharmadev
https://x.com/omsharmadev/status/2087259982630965351
他从零写了一个自己的编码 agent CLI,目的很明确:搞清楚 OpenCode 和 Claude Code 这类工具引擎盖底下到底发生了什么——agent 循环、工具调用、供应商与模型管理、以及怎么在一个代码库上工作。不是产品推广。「先造玩具版来理解真家伙」这个模式最近出现得越来越多,因为 harness 已经不再是黑盒了。
https://x.com/omsharmadev/status/2087259982630965351
他从零写了一个自己的编码 agent CLI,目的很明确:搞清楚 OpenCode 和 Claude Code 这类工具引擎盖底下到底发生了什么——agent 循环、工具调用、供应商与模型管理、以及怎么在一个代码库上工作。不是产品推广。「先造玩具版来理解真家伙」这个模式最近出现得越来越多,因为 harness 已经不再是黑盒了。
#26
@jdjohnson
https://x.com/jdjohnson/status/2087302868067836036
一个在这类讨论里没人提的领域:家谱。他指向一个做家族史的 autoresearch 项目,说他所有快过期的 token 都花在那里。档案研究几乎是 autoresearch 的理想目标——在杂乱的来源上做无边界搜索,最后由人类做低成本的核验。
https://x.com/jdjohnson/status/2087302868067836036
一个在这类讨论里没人提的领域:家谱。他指向一个做家族史的 autoresearch 项目,说他所有快过期的 token 都花在那里。档案研究几乎是 autoresearch 的理想目标——在杂乱的来源上做无边界搜索,最后由人类做低成本的核验。
#27
@tom_doerr
https://x.com/tom_doerr/status/2087068602948108643
一份精选清单,收录了 Karpathy 的 autoresearch 之后涌现出的各种自主改进循环、研究型 agent 和自我改进的编码工具。它的价值在于让你看到这个「循环形状」的生态里现在实际有什么,而不是那些讨论它的帖子声称有什么。
https://x.com/tom_doerr/status/2087068602948108643
一份精选清单,收录了 Karpathy 的 autoresearch 之后涌现出的各种自主改进循环、研究型 agent 和自我改进的编码工具。它的价值在于让你看到这个「循环形状」的生态里现在实际有什么,而不是那些讨论它的帖子声称有什么。
📡 生态产品雷达
生态产品雷达
prime-agent - 面向长时间运行编码任务的自我改进 RLM agent,24 小时涨 2642 星,GitHub 趋势榜第三
pi 与 pi-autoresearch - 终端原生的 autoresearch 循环,同时也是单位任务成本对比里胜出的 harness
Claude Code - 大家默认往循环里塞的那个,也是被专用优化器拿来做基准对照的那个
Codex - 它的 goal 命令是所有人在拆解循环终止逻辑时的参考实现
Hermes Agent - 有人报告在客户项目上真的跑通了自我改进循环
Muse Glimmer - Apache 2.0 的 30B agentic 模型,在 24GB 消费级显卡上跑完整循环
DeepSeek V4 Flash - 今天大多数 7x24 循环底下那层便宜的执行引擎
AutoResearch 与 AutoAgent - 在今天那场基准里跑赢「Claude Code 塞进循环」的两个优化器
loopx - loop 工程状态内核,对 Codex 和 Claude Code 的 agent 循环都不绑定,4.0K 星
prime-agent - 面向长时间运行编码任务的自我改进 RLM agent,24 小时涨 2642 星,GitHub 趋势榜第三
pi 与 pi-autoresearch - 终端原生的 autoresearch 循环,同时也是单位任务成本对比里胜出的 harness
Claude Code - 大家默认往循环里塞的那个,也是被专用优化器拿来做基准对照的那个
Codex - 它的 goal 命令是所有人在拆解循环终止逻辑时的参考实现
Hermes Agent - 有人报告在客户项目上真的跑通了自我改进循环
Muse Glimmer - Apache 2.0 的 30B agentic 模型,在 24GB 消费级显卡上跑完整循环
DeepSeek V4 Flash - 今天大多数 7x24 循环底下那层便宜的执行引擎
AutoResearch 与 AutoAgent - 在今天那场基准里跑赢「Claude Code 塞进循环」的两个优化器
loopx - loop 工程状态内核,对 Codex 和 Claude Code 的 agent 循环都不绑定,4.0K 星
评论