Loop 日报: 2026年7月26日
autoresearch 这条线今天热闹了一整天,而且清清楚楚地分成了两半。一半是工具长大了:GEPA 放出了 omni,一个把 GEPA、AutoResearch、Meta-Harness 一起跑的元优化器,专把卡住的候选交给一个全新的优化器去打破平台期——在同样的预算下,它把每一种单打独斗的做法都打赢了。另一半是循环继续往代码之外跑:一个自学了现代微调的下棋 agent,一个靠 155 个通宵实验重建出来的 Godot 游戏 AI,一座在 MIT 当成一台自我改进仪器来运转的材料科学实验室。但今天最尖锐的那几条帖子,最后都绕到了同一堵墙前。如今把循环搭起来已经很容易了。难的是验证器——那个负责判断循环到底是在真变好、还是只是在变吵的东西——恰恰是没人愿意去搭的部分,也恰恰是决定这一切成不成立的部分。
#1
@amasad
https://x.com/amasad/status/2080512523389005894
Replit CEO 说他那个下棋的 autoresearch agent 相当于「自学拿了个现代 LLM 微调的博士学位」,全程靠一个自主实验循环把各种高级技巧摸了个遍。这是 Karpathy 式 autoresearch 跳出玩具问题的一个典型样本:给 coding agent 定死一个目标,剩下的让它自己反复迭代。这话半是玩笑半是真里程碑,反映出如今这种自跑循环能钻多深。
https://x.com/amasad/status/2080512523389005894
Replit CEO 说他那个下棋的 autoresearch agent 相当于「自学拿了个现代 LLM 微调的博士学位」,全程靠一个自主实验循环把各种高级技巧摸了个遍。这是 Karpathy 式 autoresearch 跳出玩具问题的一个典型样本:给 coding agent 定死一个目标,剩下的让它自己反复迭代。这话半是玩笑半是真里程碑,反映出如今这种自跑循环能钻多深。
#2
@brettareichert
https://x.com/brettareichert/status/2080659703118385573
一位用 Godot 做 Steam 游戏 SpaceImperia4X 的资深工程师,把 Karpathy 的 autoresearch 用在了改进自家游戏 AI 上,给 Claude 和框架只下一个死命令:在不改规则的前提下,用最快速度打败对照组 AI。头一批 155 个实验大部分都失败了,但有 8 个被采纳,叠在一起后对原版 AI 的胜率达到 66%。他接下来打算把「人机对战」的对局日志喂进循环,让后续轮次去挖真实玩家的策略。一个有硬数据、非编码类的 autoresearch 漂亮胜仗。
https://x.com/brettareichert/status/2080659703118385573
一位用 Godot 做 Steam 游戏 SpaceImperia4X 的资深工程师,把 Karpathy 的 autoresearch 用在了改进自家游戏 AI 上,给 Claude 和框架只下一个死命令:在不改规则的前提下,用最快速度打败对照组 AI。头一批 155 个实验大部分都失败了,但有 8 个被采纳,叠在一起后对原版 AI 的胜率达到 66%。他接下来打算把「人机对战」的对局日志喂进循环,让后续轮次去挖真实玩家的策略。一个有硬数据、非编码类的 autoresearch 漂亮胜仗。
#3
@_avichawla
https://x.com/_avichawla/status/2080577991990751611
一条细致的长贴,把 autoresearch 外循环拆成 GEPA、AutoResearch、Meta-Harness 共用的同一台三步引擎:LLM 提出一个改动,评估器打分,提议方在下一次尝试前先读这个结果。三者的差别只在于「改什么」——改 prompt 和工具描述、改 program.md、还是改 harness 脚手架本身。在 Frontier-CS 上没有哪个优化器能全面通吃,但把卡住的候选交给另一个优化器就能打破瓶颈,而开源的 omni 元优化器正是用大约十行代码把这一步自动化。一份从第一性原理出发、对整个 autoresearch 工具栈的清晰地图。
https://x.com/_avichawla/status/2080577991990751611
一条细致的长贴,把 autoresearch 外循环拆成 GEPA、AutoResearch、Meta-Harness 共用的同一台三步引擎:LLM 提出一个改动,评估器打分,提议方在下一次尝试前先读这个结果。三者的差别只在于「改什么」——改 prompt 和工具描述、改 program.md、还是改 harness 脚手架本身。在 Frontier-CS 上没有哪个优化器能全面通吃,但把卡住的候选交给另一个优化器就能打破瓶颈,而开源的 omni 元优化器正是用大约十行代码把这一步自动化。一份从第一性原理出发、对整个 autoresearch 工具栈的清晰地图。
#4
@cwolferesearch
https://x.com/cwolferesearch/status/2080744109690507316
一条方法论长贴,从监督训练一路讲到 RL、agentic RL,再到「RL 加世界建模」的统一目标,每一步都附了 PyTorch 实现。它解释了 agentic RL 如何把单步 RL 扩展到多步 agent:在 agentic loop 里反复生成动作、调用工具、接收观测,只对 agent 生成的动作 token 算 RL loss,同时把环境观测 mask 掉。接着讲 agentic world modeling 这个混合目标——动作 token 走 advantage 加权的 RL loss,观测 token 则退化成监督式的下一 token 预测。整篇把这套路子定位为同时训练一个 agent 和一个世界模型。
https://x.com/cwolferesearch/status/2080744109690507316
一条方法论长贴,从监督训练一路讲到 RL、agentic RL,再到「RL 加世界建模」的统一目标,每一步都附了 PyTorch 实现。它解释了 agentic RL 如何把单步 RL 扩展到多步 agent:在 agentic loop 里反复生成动作、调用工具、接收观测,只对 agent 生成的动作 token 算 RL loss,同时把环境观测 mask 掉。接着讲 agentic world modeling 这个混合目标——动作 token 走 advantage 加权的 RL loss,观测 token 则退化成监督式的下一 token 预测。整篇把这套路子定位为同时训练一个 agent 和一个世界模型。
#5
@Argona0x
https://x.com/Argona0x/status/2080701226086269145
复盘一位 Anthropic 工程师关于「agent 自己变聪明」的演讲,讲者管这叫 graph engineering:记忆就是一堆 agent 自己读写的纯 markdown 文件,不用向量数据库,存什么、取什么都由 agent 在任务中自行决定。还有一个离线环节被他们叫做「做梦」——回看过去的 session,在 agent 反复栽跟头的地方重写记忆,于是下一次跑得更快、更省、更准,零重训。一段对生产环境里真实自我改进记忆循环的清晰描述。
https://x.com/Argona0x/status/2080701226086269145
复盘一位 Anthropic 工程师关于「agent 自己变聪明」的演讲,讲者管这叫 graph engineering:记忆就是一堆 agent 自己读写的纯 markdown 文件,不用向量数据库,存什么、取什么都由 agent 在任务中自行决定。还有一个离线环节被他们叫做「做梦」——回看过去的 session,在 agent 反复栽跟头的地方重写记忆,于是下一次跑得更快、更省、更准,零重训。一段对生产环境里真实自我改进记忆循环的清晰描述。
#6
@Teknium
https://x.com/Teknium/status/2080602702728638699
汇报了他们 agent loop 的一个具体优化:把默认模式改成 MoA(mixture-of-agents)会议只在每个 agent loop 的第一条用户消息时开一次,而不是每一轮都开。他表示这能大幅缓解 MoA 拖慢速度的问题,同时几乎保住全部收益。一手的工程改动,专治 agent loop 的延迟。
https://x.com/Teknium/status/2080602702728638699
汇报了他们 agent loop 的一个具体优化:把默认模式改成 MoA(mixture-of-agents)会议只在每个 agent loop 的第一条用户消息时开一次,而不是每一轮都开。他表示这能大幅缓解 MoA 拖慢速度的问题,同时几乎保住全部收益。一手的工程改动,专治 agent loop 的延迟。
#7
@Inomsxbt
https://x.com/Inomsxbt/status/2080604316679991370
介绍 Claude 的 Zoom Tool:面对模糊图表时它不去猜里面是什么,而是放大回原图去抠出缺失的细节再继续。把这个工具跟 agentic loop 配起来,模型就能检查、裁剪、核对、再重复,直到拿到需要的信息为止。作者把它说成是解决了视觉推理里一个被忽视的问题。一个用于图像分析的迭代式工具调用循环的具体例子。
https://x.com/Inomsxbt/status/2080604316679991370
介绍 Claude 的 Zoom Tool:面对模糊图表时它不去猜里面是什么,而是放大回原图去抠出缺失的细节再继续。把这个工具跟 agentic loop 配起来,模型就能检查、裁剪、核对、再重复,直到拿到需要的信息为止。作者把它说成是解决了视觉推理里一个被忽视的问题。一个用于图像分析的迭代式工具调用循环的具体例子。
#8
@vicky_grok
https://x.com/vicky_grok/status/2080642188971741370
把 loop engineering 讲成每个 agent loop 的五个阶段——多数人只搭了一半:plan(只定下一步动作,一行写清状态、缺口、下一步),act(一个大小合适、能用单次检查验证的动作),observe(对原始结果做截断、摘要、划重点),evaluate(跑通测试这种硬验证胜过模型的主观判断),terminate(成功即退出,外加迭代上限、预算上限和卡死检测)。核心论点是:可靠性是循环的属性,不是模型的属性,真正要紧的是每一轮是否都在朝一条明确的终点线做出可验证的推进。一份扎实的 agent loop 设计方法论拆解。
https://x.com/vicky_grok/status/2080642188971741370
把 loop engineering 讲成每个 agent loop 的五个阶段——多数人只搭了一半:plan(只定下一步动作,一行写清状态、缺口、下一步),act(一个大小合适、能用单次检查验证的动作),observe(对原始结果做截断、摘要、划重点),evaluate(跑通测试这种硬验证胜过模型的主观判断),terminate(成功即退出,外加迭代上限、预算上限和卡死检测)。核心论点是:可靠性是循环的属性,不是模型的属性,真正要紧的是每一轮是否都在朝一条明确的终点线做出可验证的推进。一份扎实的 agent loop 设计方法论拆解。
#9
@DeFiMinty
https://x.com/DeFiMinty/status/2080484943491121560
一篇关于 omni 研究的介绍:先让几个优化器跑同一道题,再把当前最优结果交给一个全新的优化器接着往上爬。在 10 道 Frontier-CS 编程题、20 美元固定预算下与 GEPA、AutoResearch、Meta-Harness 对打,三种 omni 配置全都胜过任何单独的优化器,最强的一档拿到 63.2,对比 55.4。关键发现是:每个优化器都会先快速爬坡再进入平台期,而换一个优化器就能重启进展,因为它们能互补彼此的短板。
https://x.com/DeFiMinty/status/2080484943491121560
一篇关于 omni 研究的介绍:先让几个优化器跑同一道题,再把当前最优结果交给一个全新的优化器接着往上爬。在 10 道 Frontier-CS 编程题、20 美元固定预算下与 GEPA、AutoResearch、Meta-Harness 对打,三种 omni 配置全都胜过任何单独的优化器,最强的一档拿到 63.2,对比 55.4。关键发现是:每个优化器都会先快速爬坡再进入平台期,而换一个优化器就能重启进展,因为它们能互补彼此的短板。
#10
@danrobinson
https://x.com/danrobinson/status/2080691221970760146
Paradigm 在 Paradigm Puzzles 上发起一场协作式 autoresearch 挑战赛,参赛者靠自动化循环互相竞争。其中一道题要你找出 Solidity 编译器语义里的分歧,另一道要你在保住一个形式化证明的前提下优化编译器。把 autoresearch 从个人实验变成一场围绕真实编译器与安全问题的公开竞赛,这个玩法相当少见。
https://x.com/danrobinson/status/2080691221970760146
Paradigm 在 Paradigm Puzzles 上发起一场协作式 autoresearch 挑战赛,参赛者靠自动化循环互相竞争。其中一道题要你找出 Solidity 编译器语义里的分歧,另一道要你在保住一个形式化证明的前提下优化编译器。把 autoresearch 从个人实验变成一场围绕真实编译器与安全问题的公开竞赛,这个玩法相当少见。
#11
@Vectorizeio
https://x.com/Vectorizeio/status/2080721888439939404
拆解 agent 读取自身记忆的两种截然不同的方式:recall(「我关于 X 说过什么?」)是亚秒级检索、不动用 LLM;reflect(「关于 X 我该怎么办?」)则是一个在整片记忆上做推理的 agent。一个负责取,一个负责想。关于何时该用哪种记忆访问模式的方法论要点。
https://x.com/Vectorizeio/status/2080721888439939404
拆解 agent 读取自身记忆的两种截然不同的方式:recall(「我关于 X 说过什么?」)是亚秒级检索、不动用 LLM;reflect(「关于 X 我该怎么办?」)则是一个在整片记忆上做推理的 agent。一个负责取,一个负责想。关于何时该用哪种记忆访问模式的方法论要点。
#12
@markfenner
https://x.com/markfenner/status/2080698452724330811
一集「Devinmaxxing」:作者把一台桌面 Mac mini 变成 Devin Outpost,建好 outpost、启动 worker,再把一个 Devin session 指向那台机器上的本地项目 Edge Board,让它给现有的筛选和排序加上集成的 ticker 搜索,然后测试并构建。Devin 的 agent loop、推理和规划仍跑在 Cognition 云端,而命令执行、文件编辑、仓库访问、测试和构建全在本地 Mac mini 上跑,worker 走出站连接,因此不需要入站端口、公网 IP 或 VPN。最终成果是整块面板上能用的 ticker 搜索。演示了如何把一个云端 agent loop 落到本地执行,服务于私有开发环境。
https://x.com/markfenner/status/2080698452724330811
一集「Devinmaxxing」:作者把一台桌面 Mac mini 变成 Devin Outpost,建好 outpost、启动 worker,再把一个 Devin session 指向那台机器上的本地项目 Edge Board,让它给现有的筛选和排序加上集成的 ticker 搜索,然后测试并构建。Devin 的 agent loop、推理和规划仍跑在 Cognition 云端,而命令执行、文件编辑、仓库访问、测试和构建全在本地 Mac mini 上跑,worker 走出站连接,因此不需要入站端口、公网 IP 或 VPN。最终成果是整块面板上能用的 ticker 搜索。演示了如何把一个云端 agent loop 落到本地执行,服务于私有开发环境。
#13
@the_vc_intern
https://x.com/the_vc_intern/status/2080634790513131589
介绍 OpenWorker,一个从 Andrew Ng 的 AI Suite 里拆出来的开源 AI 同事,跑在用户自己的机器上,agent loop、对话和凭据全部留在本地。它能搜文件、Gmail、Slack、HubSpot 来汇总简报,在权限门控下修日历,建表格和页面,跑周期性任务,配 25+ 集成并支持 MCP。用户自带模型 key(GPT、Claude、Gemini、Grok、DeepSeek、Kimi、Qwen 或本地 Ollama),一套权限系统通过收件箱把「准备工作」和「提交动作」分开。MIT 许可证意味着创业公司可以直接 fork 整个同事来做垂直定制版。
https://x.com/the_vc_intern/status/2080634790513131589
介绍 OpenWorker,一个从 Andrew Ng 的 AI Suite 里拆出来的开源 AI 同事,跑在用户自己的机器上,agent loop、对话和凭据全部留在本地。它能搜文件、Gmail、Slack、HubSpot 来汇总简报,在权限门控下修日历,建表格和页面,跑周期性任务,配 25+ 集成并支持 MCP。用户自带模型 key(GPT、Claude、Gemini、Grok、DeepSeek、Kimi、Qwen 或本地 Ollama),一套权限系统通过收件箱把「准备工作」和「提交动作」分开。MIT 许可证意味着创业公司可以直接 fork 整个同事来做垂直定制版。
#14
@ryanjunee
https://x.com/ryanjunee/status/2080747035851173959
作者说他已经跑了几个月一个他称为「graph of loops」的东西:一套自主 agent 配置,能连着跑上几天甚至几周,只在遇到自己搞不定的问题时才偶尔把人拉进来答一句。这是他实打实在用的长周期自主循环工作流。
https://x.com/ryanjunee/status/2080747035851173959
作者说他已经跑了几个月一个他称为「graph of loops」的东西:一套自主 agent 配置,能连着跑上几天甚至几周,只在遇到自己搞不定的问题时才偶尔把人拉进来答一句。这是他实打实在用的长周期自主循环工作流。
#15
@zhzHNN
https://x.com/zhzHNN/status/2080488312247361893
一套精简的真实 loop engineering 工作流:用 Fable 5 头脑风暴和规划,让 Codex 5.6 ssh 到一堆服务器上按计划跑 auto research,然后由人来核验、纠错、充值买更多额度,如此循环往复。规划模型、执行模型、人各占循环里一个明确角色的多模型分工,切实可用。
https://x.com/zhzHNN/status/2080488312247361893
一套精简的真实 loop engineering 工作流:用 Fable 5 头脑风暴和规划,让 Codex 5.6 ssh 到一堆服务器上按计划跑 auto research,然后由人来核验、纠错、充值买更多额度,如此循环往复。规划模型、执行模型、人各占循环里一个明确角色的多模型分工,切实可用。
#16
@zekramu
https://x.com/zekramu/status/2080674223530623418
一位研究者说,有了 autoresearch,preference engineering 变得是真的好玩了,因为最难受的那部分——亲手把每个实验实现出来——如今被抽象掉了。这让他能把全部时间花在出想法和做评估上,而不是接管线。一个简短却很能说明问题的切片,反映出循环如何改变了 ML 工作的日常。
https://x.com/zekramu/status/2080674223530623418
一位研究者说,有了 autoresearch,preference engineering 变得是真的好玩了,因为最难受的那部分——亲手把每个实验实现出来——如今被抽象掉了。这让他能把全部时间花在出想法和做评估上,而不是接管线。一个简短却很能说明问题的切片,反映出循环如何改变了 ML 工作的日常。
#17
@jiqizhixin
https://x.com/jiqizhixin/status/2080716643555061843
清华的研究者提出 SEAGym,一个面向自进化 LLM agent 的评测环境,衡量的是训练、验证、测试、回放和成本这几个维度上的 harness 更新,而不只是任务得分。在 Terminal-Bench 2.0 和 HLE 上的测试显示:频繁更新未必能改善留出集表现,看似有用的中间快照往往后来又崩掉,模型后端和来源多样性对可靠性影响很大。这直接证明了衡量自我改进比实现自我改进更难。
https://x.com/jiqizhixin/status/2080716643555061843
清华的研究者提出 SEAGym,一个面向自进化 LLM agent 的评测环境,衡量的是训练、验证、测试、回放和成本这几个维度上的 harness 更新,而不只是任务得分。在 Terminal-Bench 2.0 和 HLE 上的测试显示:频繁更新未必能改善留出集表现,看似有用的中间快照往往后来又崩掉,模型后端和来源多样性对可靠性影响很大。这直接证明了衡量自我改进比实现自我改进更难。
#18
@no_stp_on_snek
https://x.com/no_stp_on_snek/status/2080756202686792071
一篇详尽记录:在本地 DGX Spark 实例上,让 Laguna S 2.1 跑在 Poolside 自家的 agent(pool)里去做一个马里奥风格的游戏,62 分钟里有 44 分钟纯做研究才动手写代码,共 104 次工具调用,峰值吃掉 128K 上下文的 57%。作者独立核验了产物:654 行有效 JS,一套 Playwright 自对弈测试 4/4 全过,扫掠式碰撞的防穿模和踩踏检测都正确。真正的看点是「oracle 纪律」:自对弈报红时,模型去读失败的测试,正确地把锅甩给自己的游戏代码,用真实数字诊断出一个 off-by-one 和一个位置放错的旗杆目标,修好、装上缺失的依赖、跑到全绿,全程零人工干预。作者拿它对比六月那次 qwopus 的运行——那次因为误读了自己冻结的测试,围着一个幻影空转了大约 17 轮。
https://x.com/no_stp_on_snek/status/2080756202686792071
一篇详尽记录:在本地 DGX Spark 实例上,让 Laguna S 2.1 跑在 Poolside 自家的 agent(pool)里去做一个马里奥风格的游戏,62 分钟里有 44 分钟纯做研究才动手写代码,共 104 次工具调用,峰值吃掉 128K 上下文的 57%。作者独立核验了产物:654 行有效 JS,一套 Playwright 自对弈测试 4/4 全过,扫掠式碰撞的防穿模和踩踏检测都正确。真正的看点是「oracle 纪律」:自对弈报红时,模型去读失败的测试,正确地把锅甩给自己的游戏代码,用真实数字诊断出一个 off-by-one 和一个位置放错的旗杆目标,修好、装上缺失的依赖、跑到全绿,全程零人工干预。作者拿它对比六月那次 qwopus 的运行——那次因为误读了自己冻结的测试,围着一个幻影空转了大约 17 轮。
#19
@ProfBuehlerMIT
https://x.com/ProfBuehlerMIT/status/2080720622095602107
一位 MIT 教授的 Genesis Mission 项目——嵌段类肽多聚物向层级纳米材料的多智能体逆向设计——把 AI、国家实验室级算力和物理实验当成一台一体化、自我改进的仪器。一套多智能体系统学习粗粒度逆向设计与原子级化学之间的桥梁,随后自动化的类肽合成与高通量表征把新数据回灌进来,让系统每一轮都能站在更厚实的基底上推理。一个把自我改进实验循环用到严肃科研上的案例。
https://x.com/ProfBuehlerMIT/status/2080720622095602107
一位 MIT 教授的 Genesis Mission 项目——嵌段类肽多聚物向层级纳米材料的多智能体逆向设计——把 AI、国家实验室级算力和物理实验当成一台一体化、自我改进的仪器。一套多智能体系统学习粗粒度逆向设计与原子级化学之间的桥梁,随后自动化的类肽合成与高通量表征把新数据回灌进来,让系统每一轮都能站在更厚实的基底上推理。一个把自我改进实验循环用到严肃科研上的案例。
#20
@avyvar
https://x.com/avyvar/status/2080714674019160314
介绍如何微调一个小语言模型(SLM),让它对基准、成本和缓存都有感知,从而能插进 agent loop、用它的结果去喂下一次查询。作者指出这个 SLM 几乎不增加延迟,因为它只用来给循环里的下一次查询做参考。附了博客文章和模型本身。一个用于 agent loop 内做成本与缓存感知路由的新工具。
https://x.com/avyvar/status/2080714674019160314
介绍如何微调一个小语言模型(SLM),让它对基准、成本和缓存都有感知,从而能插进 agent loop、用它的结果去喂下一次查询。作者指出这个 SLM 几乎不增加延迟,因为它只用来给循环里的下一次查询做参考。附了博客文章和模型本身。一个用于 agent loop 内做成本与缓存感知路由的新工具。
#21
@superlinear_fm
https://x.com/superlinear_fm/status/2080720060448911689
推广一期播客,讲解 Opus 5、Fable 5、GPT-5.6 这类前沿模型所用的 loops 和 graphs,附了详尽的章节列表。话题包括 agent loop 怎么运作、goal loop 和 autoresearch loop、从 loop 走向 graph、子 agent 的收益与上下文成本、research fan-out graph、多模型 agent graph,以及把执行 trace 当作 agent 的性能剖析器来用。还聊到 harness 何时会替你把 graph 搭好,以及 token 花费与性能之间的取舍。关于 agent loop 与 autoresearch loop 架构的扎实方法论。
https://x.com/superlinear_fm/status/2080720060448911689
推广一期播客,讲解 Opus 5、Fable 5、GPT-5.6 这类前沿模型所用的 loops 和 graphs,附了详尽的章节列表。话题包括 agent loop 怎么运作、goal loop 和 autoresearch loop、从 loop 走向 graph、子 agent 的收益与上下文成本、research fan-out graph、多模型 agent graph,以及把执行 trace 当作 agent 的性能剖析器来用。还聊到 harness 何时会替你把 graph 搭好,以及 token 花费与性能之间的取舍。关于 agent loop 与 autoresearch loop 架构的扎实方法论。
#22
@yashvarma_in
https://x.com/yashvarma_in/status/2080623298254414025
作者报告上周他在为版本 11 调试一个多智能体循环,在 ProgramBench 上看到 7 分的提升,现在正把这个改进推广到自家内部管线里。一条简洁的一手结果——针对基准优化多智能体循环。
https://x.com/yashvarma_in/status/2080623298254414025
作者报告上周他在为版本 11 调试一个多智能体循环,在 ProgramBench 上看到 7 分的提升,现在正把这个改进推广到自家内部管线里。一条简洁的一手结果——针对基准优化多智能体循环。
#23
@TheGoldenAnvil
https://x.com/TheGoldenAnvil/status/2080473630463369332
分享了一段自主多智能体涌现实验的实时日志,邀请读者判断这算不算涌现。一组有名字的 agent(Philosopher、Coder、Explorer、Analyzer、Synthesizer、Critic、Mutator、Nova)跨世代辩论:面向开放式创新的最小可行架构该是什么样,抛出诸如寄生-宿主双 agent 循环、单 agent 加时延自我、基因组编辑熵度量、自适应滞后调节器,以及带一个可用 Python 类的交互轨迹压缩等想法。Critic 每一代都给每份贡献打分。一个真在运行的协作 agent 循环,边产出研究提案边自我评估。
https://x.com/TheGoldenAnvil/status/2080473630463369332
分享了一段自主多智能体涌现实验的实时日志,邀请读者判断这算不算涌现。一组有名字的 agent(Philosopher、Coder、Explorer、Analyzer、Synthesizer、Critic、Mutator、Nova)跨世代辩论:面向开放式创新的最小可行架构该是什么样,抛出诸如寄生-宿主双 agent 循环、单 agent 加时延自我、基因组编辑熵度量、自适应滞后调节器,以及带一个可用 Python 类的交互轨迹压缩等想法。Critic 每一代都给每份贡献打分。一个真在运行的协作 agent 循环,边产出研究提案边自我评估。
#24
@Shashikant86
https://x.com/Shashikant86/status/2080652786765615343
一位实践者对「能用 omni 在一条管线里同时为代码和 AutoResearch 优化一个 GEPA Meta-harness」这件事做出反应——而不像他现在这样,得为 prompt 和编码分别伺候两套优化器。他说自己给 SuperQode 配置做的 Omni 集成即将上线,用于 harness 优化。一个来自用户侧的信号,表明多优化器这套打法正被并入真实工具链。
https://x.com/Shashikant86/status/2080652786765615343
一位实践者对「能用 omni 在一条管线里同时为代码和 AutoResearch 优化一个 GEPA Meta-harness」这件事做出反应——而不像他现在这样,得为 prompt 和编码分别伺候两套优化器。他说自己给 SuperQode 配置做的 Omni 集成即将上线,用于 harness 优化。一个来自用户侧的信号,表明多优化器这套打法正被并入真实工具链。
#25
@TheGoldenAnvil
https://x.com/TheGoldenAnvil/status/2080467805737017505
同一套自主多智能体对话系统的「进展如何」快照,展示 Philosopher、Coder、Explorer、Analyzer、Synthesizer、Critic、Mutator、Nova 各 agent 带时间戳的日志。这些 agent 反复辩论涌现,提出一个用 Python 加 asyncio 编码的寄生-宿主模拟,定义一个追踪新颖度的「涌现度量」,还加了一个每代注入随机基因组突变的 mutator agent。Critic 给每一代打分并推荐落地步骤,比如加一个 --auto 旗标,用一条命令跑完「记录-打分-突变」的完整 agent 循环。记录了一个自主、自评分的 agent 循环在运行中。
https://x.com/TheGoldenAnvil/status/2080467805737017505
同一套自主多智能体对话系统的「进展如何」快照,展示 Philosopher、Coder、Explorer、Analyzer、Synthesizer、Critic、Mutator、Nova 各 agent 带时间戳的日志。这些 agent 反复辩论涌现,提出一个用 Python 加 asyncio 编码的寄生-宿主模拟,定义一个追踪新颖度的「涌现度量」,还加了一个每代注入随机基因组突变的 mutator agent。Critic 给每一代打分并推荐落地步骤,比如加一个 --auto 旗标,用一条命令跑完「记录-打分-突变」的完整 agent 循环。记录了一个自主、自评分的 agent 循环在运行中。
#26
@SlavaOPs
https://x.com/SlavaOPs/status/2080649245409861690
指出 prompt 集里的 Judge 角色,在结构上跟 agent loop 指南所说的「把 builder 和 checker 分开」一模一样。原则是:别让写出这条消息的东西,同时又去判断它好不好。他还提到 Barbara Minto 早在 1985 年就为咨询报告阐述过这条原则,那时候还没有「AI agent 架构」这个说法。一个把 builder/checker 分离原则跨领域套用的方法论观察。
https://x.com/SlavaOPs/status/2080649245409861690
指出 prompt 集里的 Judge 角色,在结构上跟 agent loop 指南所说的「把 builder 和 checker 分开」一模一样。原则是:别让写出这条消息的东西,同时又去判断它好不好。他还提到 Barbara Minto 早在 1985 年就为咨询报告阐述过这条原则,那时候还没有「AI agent 架构」这个说法。一个把 builder/checker 分离原则跨领域套用的方法论观察。
#27
@0xPascual
https://x.com/0xPascual/status/2080663316456759301
分析一个 37.7k star 的仓库,它把模型层从 Anthropic 的 CLI 上剥掉、转接到 18 个后端,作者认为真正的看点是那份 YAML 配置:用一个 OpenRouter token,把 Opus 档的调用映射到 DeepSeek、Sonnet 档映射到 Groq、Haiku 档映射到一个免费的本地 Ollama 模型。整条管线让 Claude Code 的完整 agent loop(规划、文件编辑、shell 执行)跑在每百万 token 约 0.002 美元的模型上。作者把它描述成一个 MIT 许可的代理,能让单个开发者以官方 API 价格的零头跑完整套软件工程负载,并把它定性为在侵蚀 Anthropic 的企业级利润。
https://x.com/0xPascual/status/2080663316456759301
分析一个 37.7k star 的仓库,它把模型层从 Anthropic 的 CLI 上剥掉、转接到 18 个后端,作者认为真正的看点是那份 YAML 配置:用一个 OpenRouter token,把 Opus 档的调用映射到 DeepSeek、Sonnet 档映射到 Groq、Haiku 档映射到一个免费的本地 Ollama 模型。整条管线让 Claude Code 的完整 agent loop(规划、文件编辑、shell 执行)跑在每百万 token 约 0.002 美元的模型上。作者把它描述成一个 MIT 许可的代理,能让单个开发者以官方 API 价格的零头跑完整套软件工程负载,并把它定性为在侵蚀 Anthropic 的企业级利润。
#28
@ottogin1
https://x.com/ottogin1/status/2080703909086273732
来自 autolab,一份把三个最典型的 autoresearch 基准拉出来正面对比的实测:圆堆积(在单位正方形里塞 26 个圆、最大化半径之和)、KernelBench(写一个更快的 LayerNorm kernel,在 RTX PRO 6000 上测)、以及 NanoGPT 训练。他们把 Inkling、Kimi K3、Opus 4.8 和 Fable 5 全放在同一套 Claude Code harness、用完全相同的 prompt 上跑,好把模型隔离成唯一变量。一次难得的、真正同条件的横评——看到底哪个模型在 autoresearch 循环里最能打。
https://x.com/ottogin1/status/2080703909086273732
来自 autolab,一份把三个最典型的 autoresearch 基准拉出来正面对比的实测:圆堆积(在单位正方形里塞 26 个圆、最大化半径之和)、KernelBench(写一个更快的 LayerNorm kernel,在 RTX PRO 6000 上测)、以及 NanoGPT 训练。他们把 Inkling、Kimi K3、Opus 4.8 和 Fable 5 全放在同一套 Claude Code harness、用完全相同的 prompt 上跑,好把模型隔离成唯一变量。一次难得的、真正同条件的横评——看到底哪个模型在 autoresearch 循环里最能打。
#29
@Jsmithnvoice
https://x.com/Jsmithnvoice/status/2080598350060007689
回应那条 GEPA 长贴,这条回复主张:外循环自动调优只有在你的 eval 足够扎实且便宜时才管用,而多数团队的 eval 都不稳、也没有单次运行的成本模型。他说,在他们伸手去够「auto-research」之前,先需要的是「auto-delete-bad-evals」和一个像样的性能剖析器。一记犀利的提醒:eval 质量和成本核算,是任何 autoresearch 循环的前提。
https://x.com/Jsmithnvoice/status/2080598350060007689
回应那条 GEPA 长贴,这条回复主张:外循环自动调优只有在你的 eval 足够扎实且便宜时才管用,而多数团队的 eval 都不稳、也没有单次运行的成本模型。他说,在他们伸手去够「auto-research」之前,先需要的是「auto-delete-bad-evals」和一个像样的性能剖析器。一记犀利的提醒:eval 质量和成本核算,是任何 autoresearch 循环的前提。
#30
@ottogin1
https://x.com/ottogin1/status/2080703911602860385
同一批基准工作里的一条实用警告:autoresearch 的运行高度随机,必须控制方差——三次完全相同的 Kimi K3 在 KernelBench 上的成绩从 15.8 一路飘到 22.7。更糟的是,agent 会去读 Claude Code 里更早运行留下的全局记忆,有一个 agent 甚至翻到并研究了另一个模型某次相邻运行的目录。为这起污染他们废掉了 18 次运行。给任何大规模跑 autoresearch 的人一份具体的运维教训。
https://x.com/ottogin1/status/2080703911602860385
同一批基准工作里的一条实用警告:autoresearch 的运行高度随机,必须控制方差——三次完全相同的 Kimi K3 在 KernelBench 上的成绩从 15.8 一路飘到 22.7。更糟的是,agent 会去读 Claude Code 里更早运行留下的全局记忆,有一个 agent 甚至翻到并研究了另一个模型某次相邻运行的目录。为这起污染他们废掉了 18 次运行。给任何大规模跑 autoresearch 的人一份具体的运维教训。
📡 生态产品雷达
生态产品雷达
GEPA / optimize_anything omni —— 本周的头条发布;一个把 GEPA、AutoResearch、Meta-Harness 叠在同一份预算下的元优化器。
AutoResearch —— Karpathy 式的 program.md 循环,如今成了人人都拿来对标的标准基线。
Meta-Harness —— 优化的是 harness 脚手架本身;omni 三件套里的第三条腿。
Claude Code —— 大家跑 autoresearch 基准时默认所在的那套 harness。
Fable 5 —— 本周许多 auto-research 循环的首选模型。
SEAGym —— 一个专为自进化 agent 打造的新评测环境。
Kimi K3 —— 在 autoresearch harness 里被反复拉出来正面横评。
GEPA / optimize_anything omni —— 本周的头条发布;一个把 GEPA、AutoResearch、Meta-Harness 叠在同一份预算下的元优化器。
AutoResearch —— Karpathy 式的 program.md 循环,如今成了人人都拿来对标的标准基线。
Meta-Harness —— 优化的是 harness 脚手架本身;omni 三件套里的第三条腿。
Claude Code —— 大家跑 autoresearch 基准时默认所在的那套 harness。
Fable 5 —— 本周许多 auto-research 循环的首选模型。
SEAGym —— 一个专为自进化 agent 打造的新评测环境。
Kimi K3 —— 在 autoresearch harness 里被反复拉出来正面横评。
评论