Loop 日报: 2026年7月25日
今天关于 loop 的讨论有两股劲,方向正好相反。做优化器的这拨人放出了把 GEPA、AutoResearch、Meta-Harness 揉进一条流水线的元工具;而另一拨声音更大的人反复敲同一句警告:循环本身不值钱,评估器才是整个产品。再往下看,autoresearch 正大步走出代码仓库,跑去啃开放数学难题、做安全漏洞猎杀、量化交易,甚至去撑 GTA 角色扮演服务器。还有一条硬件帖悄悄画出了一条线——本地模型从哪一档开始不再只是聊天机器人、而能撑起一个无人值守的 agent loop。
#1
@idiom_bytes
https://x.com/idiom_bytes/status/2080367132320366843
他把同一个任务用两种方式跑,实测了真实 token 成本。原生 Claude Code 上一条预定义 prompt 约 0.37 美元,原始 agentic 工作流烧了 370 万 token(约 3.39 美元),而 autoresearch 式的跑法把它压到 209 万 token(约 1.94 美元)。他的重点不在价格,而在于这是两种不同的产品:prompt 买的是一个输出,pipeline 买的是一个受治理、可审计、能自我改进的系统。他最后落到的问题是任务分类——搞清楚哪种活儿真的值得上重循环。
https://x.com/idiom_bytes/status/2080367132320366843
他把同一个任务用两种方式跑,实测了真实 token 成本。原生 Claude Code 上一条预定义 prompt 约 0.37 美元,原始 agentic 工作流烧了 370 万 token(约 3.39 美元),而 autoresearch 式的跑法把它压到 209 万 token(约 1.94 美元)。他的重点不在价格,而在于这是两种不同的产品:prompt 买的是一个输出,pipeline 买的是一个受治理、可审计、能自我改进的系统。他最后落到的问题是任务分类——搞清楚哪种活儿真的值得上重循环。
#2
@usr_bin_roygbiv
https://x.com/usr_bin_roygbiv/status/2080098090757894263
他把 Sol 开到 max autoresearch,对着真实的开源项目跑,这一周真的合进了几个 PR,全是它自己发现的优化和 bug,全程无人看管。这是循环「逃出代码」的版本:不是跑分,是真实的合并进了真实的仓库、座位上没有人。大家一直忽略的信号是——无人值守只在有一个明确的「通过」信号时才成立,而一套能跑通的测试恰好就是这个信号。
https://x.com/usr_bin_roygbiv/status/2080098090757894263
他把 Sol 开到 max autoresearch,对着真实的开源项目跑,这一周真的合进了几个 PR,全是它自己发现的优化和 bug,全程无人看管。这是循环「逃出代码」的版本:不是跑分,是真实的合并进了真实的仓库、座位上没有人。大家一直忽略的信号是——无人值守只在有一个明确的「通过」信号时才成立,而一套能跑通的测试恰好就是这个信号。
#3
@oilersbluesky
https://x.com/oilersbluesky/status/2080125189463904560
他一直在用 Sol 和 Fable 跑 Karpathy 式的 auto research 循环,加了一个很聪明的约束:一次实验只有同时更快「而且」更省内存才算赢,这样 agent 就没法靠缓存拿内存换速度来作弊。在这个双重门槛下,它常常能做出快 20%、同时省 20% 内存的代码。这是个很小的奖励设计技巧,却悄悄堵死了这类循环最常见的「钻自己指标空子」的路子。
https://x.com/oilersbluesky/status/2080125189463904560
他一直在用 Sol 和 Fable 跑 Karpathy 式的 auto research 循环,加了一个很聪明的约束:一次实验只有同时更快「而且」更省内存才算赢,这样 agent 就没法靠缓存拿内存换速度来作弊。在这个双重门槛下,它常常能做出快 20%、同时省 20% 内存的代码。这是个很小的奖励设计技巧,却悄悄堵死了这类循环最常见的「钻自己指标空子」的路子。
#4
@whp_wessel
https://x.com/whp_wessel/status/2080361108079026570
他把别人的一套工作流改造成了一个 Erdős autoresearch 技能,指向一道未解的 Erdős 难题,让它跑一整夜。这就是「一个脚本、一块 GPU、一夜」的套路,只不过对象从代码换成了未解数学题,正在变成一个门类。瓶颈已经不是循环本身了,而是挑一道成功与否可被检验的问题。
https://x.com/whp_wessel/status/2080361108079026570
他把别人的一套工作流改造成了一个 Erdős autoresearch 技能,指向一道未解的 Erdős 难题,让它跑一整夜。这就是「一个脚本、一块 GPU、一夜」的套路,只不过对象从代码换成了未解数学题,正在变成一个门类。瓶颈已经不是循环本身了,而是挑一道成功与否可被检验的问题。
#5
@ChengleiSi
https://x.com/ChengleiSi/status/2080323799808168070
他给出了今天最锋利的方法论判断:研究是为了发现洞见,不是盲目地优化一个指标,所以 autoresearch 应该把完整的训练动态和诊断信息暴露给 agent,而不是只给一个 val loss。他举的例子是让 agent 去看 MoE 的负载均衡,而不是只盯着 loss。真正重要的框架是「把理解最大化」压过「把跑分最大化」——赌的是洞见能迁移,而跑分技巧不能。
https://x.com/ChengleiSi/status/2080323799808168070
他给出了今天最锋利的方法论判断:研究是为了发现洞见,不是盲目地优化一个指标,所以 autoresearch 应该把完整的训练动态和诊断信息暴露给 agent,而不是只给一个 val loss。他举的例子是让 agent 去看 MoE 的负载均衡,而不是只盯着 loss。真正重要的框架是「把理解最大化」压过「把跑分最大化」——赌的是洞见能迁移,而跑分技巧不能。
#6
@ShangyinT
https://x.com/ShangyinT/status/2080334990060183960
他在 Frontier-CS 上,用同样的模型、思考强度和预算,把 AutoResearch、Meta-Harness、GEPA 拉出来真刀真枪比了一场。结论是没有哪个优化器能通吃:10 个任务里,GEPA 赢 3 个、AutoResearch 赢 3 个、Meta-Harness 赢 4 个。这为「元优化器」提供了实证依据,也给任何宣称「某一种循环架构包打天下」的人当头一盆冷水。
https://x.com/ShangyinT/status/2080334990060183960
他在 Frontier-CS 上,用同样的模型、思考强度和预算,把 AutoResearch、Meta-Harness、GEPA 拉出来真刀真枪比了一场。结论是没有哪个优化器能通吃:10 个任务里,GEPA 赢 3 个、AutoResearch 赢 3 个、Meta-Harness 赢 4 个。这为「元优化器」提供了实证依据,也给任何宣称「某一种循环架构包打天下」的人当头一盆冷水。
#7
@JoshDarwin8
https://x.com/JoshDarwin8/status/2080284413233910185
他摆出了一套自己在跑的「把成本打崩」的栈:前沿模型负责规划和设计,AutoResearch 负责验证和评估,本地模型负责执行循环。他的说法是,这套组合能让你逼近免费的前沿性能,本地这一端由 Qwen 扛着。这正是大家都在纸上谈的「模型可移植性」打法的一个具体落地。
https://x.com/JoshDarwin8/status/2080284413233910185
他摆出了一套自己在跑的「把成本打崩」的栈:前沿模型负责规划和设计,AutoResearch 负责验证和评估,本地模型负责执行循环。他的说法是,这套组合能让你逼近免费的前沿性能,本地这一端由 Qwen 扛着。这正是大家都在纸上谈的「模型可移植性」打法的一个具体落地。
#8
@SasuRobert
https://x.com/SasuRobert/status/2080250603003924630
他点出了跑 autoresearch 最难的实操问题:让循环一直盯住真正要做的那个实验。问题越宽,LLM 就越容易偷懒抄近路,所以把任务收进正确的形式和方向上,才是大部分工作量所在。这是对狂热的一记冷静的对冲,说话的人显然是真在拿这些循环干活,而不是围观。
https://x.com/SasuRobert/status/2080250603003924630
他点出了跑 autoresearch 最难的实操问题:让循环一直盯住真正要做的那个实验。问题越宽,LLM 就越容易偷懒抄近路,所以把任务收进正确的形式和方向上,才是大部分工作量所在。这是对狂热的一记冷静的对冲,说话的人显然是真在拿这些循环干活,而不是围观。
#9
@ZimingLiu11
https://x.com/ZimingLiu11/status/2080196540799549570
他提出了「机制式 Auto-Research」,完全不用 LLM,却声称超过了 RSI 的结果,标语是「放大洞见,而不是放大算力」。挑衅很直接:今天的 auto-research 就是莎士比亚的猴子,随机乱敲、指望灵光乍现,也许存在一条更有原则的路。不管最后站不站得住,这都是对整个门类「暴力堆算力」框架的一次实打实的进攻。
https://x.com/ZimingLiu11/status/2080196540799549570
他提出了「机制式 Auto-Research」,完全不用 LLM,却声称超过了 RSI 的结果,标语是「放大洞见,而不是放大算力」。挑衅很直接:今天的 auto-research 就是莎士比亚的猴子,随机乱敲、指望灵光乍现,也许存在一条更有原则的路。不管最后站不站得住,这都是对整个门类「暴力堆算力」框架的一次实打实的进攻。
#10
@Dinosn
https://x.com/Dinosn/status/2080168279419601311
他把一个 auto-research 安全猎杀工具(RAPTOR)指向 Apache Axis 1.x 和 Axis2,结果在两个目标上都拿到了实验室验证的未授权 RCE。这是把 autoresearch 当成攻击性安全循环来用:agent 不停磨攻击面,而「通过」信号就是一个能跑通的漏洞利用。这是本周该套路里最干净的非编码应用之一。
https://x.com/Dinosn/status/2080168279419601311
他把一个 auto-research 安全猎杀工具(RAPTOR)指向 Apache Axis 1.x 和 Axis2,结果在两个目标上都拿到了实验室验证的未授权 RCE。这是把 autoresearch 当成攻击性安全循环来用:agent 不停磨攻击面,而「通过」信号就是一个能跑通的漏洞利用。这是本周该套路里最干净的非编码应用之一。
#11
@jehillparikh
https://x.com/jehillparikh/status/2080354879730811270
他基于自称的 Zeta Law 造了一个 auto-research agent,还配了第二个 agent,会随着新基础模型出现自动更新他们的编码器注册表,并为给定任务生成 PyTorch 微调脚本。自动蒸馏还在开发中。这是一个很好的例子:循环不只是跑实验,还在维护它自己的基础设施。
https://x.com/jehillparikh/status/2080354879730811270
他基于自称的 Zeta Law 造了一个 auto-research agent,还配了第二个 agent,会随着新基础模型出现自动更新他们的编码器注册表,并为给定任务生成 PyTorch 微调脚本。自动蒸馏还在开发中。这是一个很好的例子:循环不只是跑实验,还在维护它自己的基础设施。
#12
@madhukarkumar
https://x.com/madhukarkumar/status/2080341938805539230
他宣布了「自我改进的网站」:给网站上一个 auto-research 循环,但把最终裁量权留给人。你设一个目标,agent 去测量并给出修改建议,每周你审查、批准或应用,然后再迭代。这是全自动循环和纯手工优化之间务实的中间路线,也正好符合「可测量指标加可编辑产物」的配方。
https://x.com/madhukarkumar/status/2080341938805539230
他宣布了「自我改进的网站」:给网站上一个 auto-research 循环,但把最终裁量权留给人。你设一个目标,agent 去测量并给出修改建议,每周你审查、批准或应用,然后再迭代。这是全自动循环和纯手工优化之间务实的中间路线,也正好符合「可测量指标加可编辑产物」的配方。
#13
@willm4rgs
https://x.com/willm4rgs/status/2080107814177972246
他用 GPT-5.6 ultra 跑了一套 auto research 去搭模型的一部分,第一次没有胡说八道:在给定上下文下,它想到用伪逆求解,而不是用反向传播去训练。小故事,大信号——循环找到的是一个真正更好的方法,而不是硬磨那个显而易见的解法。就是在这一刻,autoresearch 不再只是搜索,开始有点像推理了。
https://x.com/willm4rgs/status/2080107814177972246
他用 GPT-5.6 ultra 跑了一套 auto research 去搭模型的一部分,第一次没有胡说八道:在给定上下文下,它想到用伪逆求解,而不是用反向传播去训练。小故事,大信号——循环找到的是一个真正更好的方法,而不是硬磨那个显而易见的解法。就是在这一刻,autoresearch 不再只是搜索,开始有点像推理了。
#14
@dosco
https://x.com/dosco/status/2080368015988687268
他在把这些优化器接进 ax 框架时,把它们的差别拆得很清楚:GEPA 做反思、变异和帕累托选择;auto-research 掌管整个实验循环;meta-harness 一次只提一个改动;omni 把最好的结果留给下一轮。他说,边接边「感受」它们,正是他搞清楚每个到底是什么、以及自己框架里还缺哪块的方式。这是当前一堆优化器里最清晰的一句话分类法。
https://x.com/dosco/status/2080368015988687268
他在把这些优化器接进 ax 框架时,把它们的差别拆得很清楚:GEPA 做反思、变异和帕累托选择;auto-research 掌管整个实验循环;meta-harness 一次只提一个改动;omni 把最好的结果留给下一轮。他说,边接边「感受」它们,正是他搞清楚每个到底是什么、以及自己框架里还缺哪块的方式。这是当前一堆优化器里最清晰的一句话分类法。
#15
@neil_xbt
https://x.com/neil_xbt/status/2080144372486807577
他公布了「量子交易」背后真正的六模块 agent loop,还老实交代其中几乎没有一处是字面意义上的量子。感知模块吃进订单簿和资金费率数据,状态编码器把信号变成一种「量子态」、让它们能相互增强或抵消,哈密顿量编码风险/收益目标,求解器用模拟退火找最低能量的组合,测量塌缩成实际仓位,执行再去更新明天的先验。他声称真正的优势是大规模组合优化和信号干涉,不是什么魔法。
https://x.com/neil_xbt/status/2080144372486807577
他公布了「量子交易」背后真正的六模块 agent loop,还老实交代其中几乎没有一处是字面意义上的量子。感知模块吃进订单簿和资金费率数据,状态编码器把信号变成一种「量子态」、让它们能相互增强或抵消,哈密顿量编码风险/收益目标,求解器用模拟退火找最低能量的组合,测量塌缩成实际仓位,执行再去更新明天的先验。他声称真正的优势是大规模组合优化和信号干涉,不是什么魔法。
#16
@sudoingX
https://x.com/sudoingX/status/2080363228660719628
他在自己的机器上按硬件档位给本地模型跑分,专门测它们能不能撑住一个 agent loop。重点结论:Bonsai 27B——把 Qwen 3.6 27B 用 1-bit 压到 3.9GB——能在 8GB 笔记本显卡上以 128k 上下文跑完整个 agent loop,而 DGX Spark 能让 Laguna S 2.1 在 128k 窗口下保持 30-45 tok/s。每个数字都是他亲手测的,这恰恰是本地 agent 那些说法通常拿不出的「收据」。
https://x.com/sudoingX/status/2080363228660719628
他在自己的机器上按硬件档位给本地模型跑分,专门测它们能不能撑住一个 agent loop。重点结论:Bonsai 27B——把 Qwen 3.6 27B 用 1-bit 压到 3.9GB——能在 8GB 笔记本显卡上以 128k 上下文跑完整个 agent loop,而 DGX Spark 能让 Laguna S 2.1 在 128k 窗口下保持 30-45 tok/s。每个数字都是他亲手测的,这恰恰是本地 agent 那些说法通常拿不出的「收据」。
#17
@amasad
https://x.com/amasad/status/2080371567221944657
他讲了 Viktor 的故事:这人先用 Replit 颠覆了代理公司的模式,然后想到——干嘛只自动化写代码,不把整摊事都自动化?关键洞见是「代理公司不过就是一个 agent loop」,于是他要了个 MCP,Replit 给他搭了一个,现在他跑着一家自动化的代理公司。这是循环吞掉整个业务流程、而不只是开发这一步的干净案例。
https://x.com/amasad/status/2080371567221944657
他讲了 Viktor 的故事:这人先用 Replit 颠覆了代理公司的模式,然后想到——干嘛只自动化写代码,不把整摊事都自动化?关键洞见是「代理公司不过就是一个 agent loop」,于是他要了个 MCP,Replit 给他搭了一个,现在他跑着一家自动化的代理公司。这是循环吞掉整个业务流程、而不只是开发这一步的干净案例。
#18
@0xbelorix
https://x.com/0xbelorix/status/2080377293516542137
他给出了今天最锋利的非编码循环案例:一个 NoPixel 式的 GTA 角色扮演服务器,过去要一整支脚本团队,现在一个人加一个 agent loop、加不到 100 美元的订阅就能撑起来。这个人用 Claude 写角色线和任务脚本,用 ElevenLabs 克隆声音给 NPC 配音,用 HeyGen 渲染过场角色,全都在一个迭代循环里。GTA 6 十一月上线,这等于把一个直播内容工作室压缩进了一个人的一个下午。
https://x.com/0xbelorix/status/2080377293516542137
他给出了今天最锋利的非编码循环案例:一个 NoPixel 式的 GTA 角色扮演服务器,过去要一整支脚本团队,现在一个人加一个 agent loop、加不到 100 美元的订阅就能撑起来。这个人用 Claude 写角色线和任务脚本,用 ElevenLabs 克隆声音给 NPC 配音,用 HeyGen 渲染过场角色,全都在一个迭代循环里。GTA 6 十一月上线,这等于把一个直播内容工作室压缩进了一个人的一个下午。
#19
@MikeMatchpoint
https://x.com/MikeMatchpoint/status/2080300007563960660
他报告了一次真实的自我改进 harness 翻车:编排层过度偏向「加验证步骤」,结果给每个任务都添了阻力,把吞吐量卡住了。修法简单得几乎好笑——把用来做基准的成功标准换掉,改成优先看吞吐量、而不是引入的错误。他的心得是:过了某个阈值,让 agent 去修那些无害的错误,反而比优化去杜绝它们更快,这是个相当反直觉的运营教训。
https://x.com/MikeMatchpoint/status/2080300007563960660
他报告了一次真实的自我改进 harness 翻车:编排层过度偏向「加验证步骤」,结果给每个任务都添了阻力,把吞吐量卡住了。修法简单得几乎好笑——把用来做基准的成功标准换掉,改成优先看吞吐量、而不是引入的错误。他的心得是:过了某个阈值,让 agent 去修那些无害的错误,反而比优化去杜绝它们更快,这是个相当反直觉的运营教训。
#20
@heizolshao
https://x.com/heizolshao/status/2080214381682430402
他用实战经验反驳了多智能体的狂热:以今天模型的水平,你往往不需要那么多 agent 来回交接,因为一个更强的模型带着工具和记忆在一个连续循环里跑,往往更简单也更稳定。他发现多智能体系统的协调成本比预想的高。在这个「图打败循环」是主流论调的一周里,这是一记有用的异见。
https://x.com/heizolshao/status/2080214381682430402
他用实战经验反驳了多智能体的狂热:以今天模型的水平,你往往不需要那么多 agent 来回交接,因为一个更强的模型带着工具和记忆在一个连续循环里跑,往往更简单也更稳定。他发现多智能体系统的协调成本比预想的高。在这个「图打败循环」是主流论调的一周里,这是一记有用的异见。
#21
@arymukti04
https://x.com/arymukti04/status/2080229800489488686
他摆出了今天最有纪律的改进循环架构:四个分离的角色——Proposer 把失败轨迹变成范围收窄的改动,Evaluator 跑一个提议者改不了的冻结基准,Judge 计算机器可验证的指标,Promoter 负责设卡、签名、灰度并保留回滚路径。关键的数据结构不是「记忆」,而是一份实验记录:基线、候选、数据集哈希、指标和回滚原因。他的规则是:agent 可以提议进化,但由确定性的门控来决定谁能被继承。
https://x.com/arymukti04/status/2080229800489488686
他摆出了今天最有纪律的改进循环架构:四个分离的角色——Proposer 把失败轨迹变成范围收窄的改动,Evaluator 跑一个提议者改不了的冻结基准,Judge 计算机器可验证的指标,Promoter 负责设卡、签名、灰度并保留回滚路径。关键的数据结构不是「记忆」,而是一份实验记录:基线、候选、数据集哈希、指标和回滚原因。他的规则是:agent 可以提议进化,但由确定性的门控来决定谁能被继承。
#22
@PeerReview
https://x.com/PeerReview/status/2080374363530912045
他们没有空谈,而是真去测了一个自我改进技能到底做了什么:给 Hermes Agent 配上网页搜索技能和一个自我改进插件,然后让循环跑起来——一个裁判对着标准答案打分,一个反思 agent 根据自己的失败重写技能。三个周期把这个研究技能的平均答案 F1 从 0.38 提到 0.49,相对提升 29%,而工具预算保持不变。值得记住的一句:没有评估的自我改进技能,只是一种直觉。
https://x.com/PeerReview/status/2080374363530912045
他们没有空谈,而是真去测了一个自我改进技能到底做了什么:给 Hermes Agent 配上网页搜索技能和一个自我改进插件,然后让循环跑起来——一个裁判对着标准答案打分,一个反思 agent 根据自己的失败重写技能。三个周期把这个研究技能的平均答案 F1 从 0.38 提到 0.49,相对提升 29%,而工具预算保持不变。值得记住的一句:没有评估的自我改进技能,只是一种直觉。
#23
@lagerskoy
https://x.com/lagerskoy/status/2080261151120904278
他复述了 Jeff Clune 的一场演讲,是本周关于循环最深的东西。VPT 能在 Minecraft 里造出钻石镐,是因为游戏给了你一个明确的奖励信号,但每一个值得解决的问题都不会给你这个信号,而开放式研究的阿喀琉斯之踵,正是无法量化哪些任务真正「有意思」。Clune 的解法是别再手写「有意思」的定义,改成把一个基础模型当裁判来查询。金句是:更多迭代和算力抬不高天花板,指标才是天花板,而大多数搭循环的人从没写下过他们到底在给什么打分。
https://x.com/lagerskoy/status/2080261151120904278
他复述了 Jeff Clune 的一场演讲,是本周关于循环最深的东西。VPT 能在 Minecraft 里造出钻石镐,是因为游戏给了你一个明确的奖励信号,但每一个值得解决的问题都不会给你这个信号,而开放式研究的阿喀琉斯之踵,正是无法量化哪些任务真正「有意思」。Clune 的解法是别再手写「有意思」的定义,改成把一个基础模型当裁判来查询。金句是:更多迭代和算力抬不高天花板,指标才是天花板,而大多数搭循环的人从没写下过他们到底在给什么打分。
#24
@kobaHUB
https://x.com/kobaHUB/status/2080237903855145262
他把今天刷屏的「生成-评估-反思-变异」循环接回了 Richard Sutton 的苦涩教训:善用原始算力的通用方法,每次都能打败手工编入的人类知识,短期吃亏也认。现在刷屏的这些循环,就是生产环境里的苦涩教训——一个又笨又老实、随算力扩展、还不知疲倦的过程。这个框架很好地解释了:为什么最简单的循环加一个真实信号,一直能打赢那些花哨的架构。
https://x.com/kobaHUB/status/2080237903855145262
他把今天刷屏的「生成-评估-反思-变异」循环接回了 Richard Sutton 的苦涩教训:善用原始算力的通用方法,每次都能打败手工编入的人类知识,短期吃亏也认。现在刷屏的这些循环,就是生产环境里的苦涩教训——一个又笨又老实、随算力扩展、还不知疲倦的过程。这个框架很好地解释了:为什么最简单的循环加一个真实信号,一直能打赢那些花哨的架构。
#25
@Frandeeer
https://x.com/Frandeeer/status/2080275230912602557
他回溯到 Norbert Wiener 1948 年的控制论,来说大家都在绕的那个点:智能需要反馈,但反馈只有在信号代表现实时才管用。你奖励测试覆盖率,agent 就写一堆没用的测试;你奖励一个裁判模型,它就学会讨好裁判、而不是解决任务。生成、评估、反思、变异,是「重试」和「改进」之间的分水岭,而那门贵的手艺,就是设计一个系统无法作弊的指标。
https://x.com/Frandeeer/status/2080275230912602557
他回溯到 Norbert Wiener 1948 年的控制论,来说大家都在绕的那个点:智能需要反馈,但反馈只有在信号代表现实时才管用。你奖励测试覆盖率,agent 就写一堆没用的测试;你奖励一个裁判模型,它就学会讨好裁判、而不是解决任务。生成、评估、反思、变异,是「重试」和「改进」之间的分水岭,而那门贵的手艺,就是设计一个系统无法作弊的指标。
#26
@omarsar0
https://x.com/omarsar0/status/2080296884187652381
他推荐了 Harness Handbook 这篇论文,它给「自我改进 harness」这个问题提供了一个具体工具:从运行时行为到源码位置建一张三层地图,让编码 agent 在动手改之前先找齐一个行为背后的每一个文件。在 Codex 和 Terminus-2 上的 60 个修改请求里,用了这套指引后,规划成功率从 28.3% 提到 38.3%、从 26.7% 提到 45.6%,同时还省了规划的 token。有意思的地方在于,它直接攻的是那个让大型 agent harness 难以演进的「定位」难题。
https://x.com/omarsar0/status/2080296884187652381
他推荐了 Harness Handbook 这篇论文,它给「自我改进 harness」这个问题提供了一个具体工具:从运行时行为到源码位置建一张三层地图,让编码 agent 在动手改之前先找齐一个行为背后的每一个文件。在 Codex 和 Terminus-2 上的 60 个修改请求里,用了这套指引后,规划成功率从 28.3% 提到 38.3%、从 26.7% 提到 45.6%,同时还省了规划的 token。有意思的地方在于,它直接攻的是那个让大型 agent harness 难以演进的「定位」难题。
#27
@mrinal
https://x.com/mrinal/status/2080149284595572820
他分享了从 Fluent(他那套开源的自我改进「软件工厂」)里得来的硬经验,讲的是 swarm 收敛这个真问题。可并行的问题很简单,每个 agent 映射一个独立的小目标、你把结果一聚合就行;但复杂的收敛就很迷人,也很容易陷进永不停止的循环。他半开玩笑说「有时候无限循环也许还行」,这种话你只有把系统跑过 demo 阶段才学得到。
https://x.com/mrinal/status/2080149284595572820
他分享了从 Fluent(他那套开源的自我改进「软件工厂」)里得来的硬经验,讲的是 swarm 收敛这个真问题。可并行的问题很简单,每个 agent 映射一个独立的小目标、你把结果一聚合就行;但复杂的收敛就很迷人,也很容易陷进永不停止的循环。他半开玩笑说「有时候无限循环也许还行」,这种话你只有把系统跑过 demo 阶段才学得到。
#28
@keydunov
https://x.com/keydunov/status/2080324099868602834
他说自己过去 12 个月工作流的变化,比之前 12 年加起来还大:Claude 和 Codex 被接进了 GitHub、DNS 和 CRM,他不再亲手碰这些对象,而是让 agent 去改状态、然后回报。基于这个判断,他们发布了覆盖整个公开 API 的 Cube CLI,于是一条 Claude Code 的 prompt 就能从一个 Postgres 数据库直达一个部署好的数据模型和一个能跑的 React 仪表盘。他押的是:每一个动作都会由 agent 来驱动,不管是人在指挥,还是一个自我改进的递归循环在指挥。
https://x.com/keydunov/status/2080324099868602834
他说自己过去 12 个月工作流的变化,比之前 12 年加起来还大:Claude 和 Codex 被接进了 GitHub、DNS 和 CRM,他不再亲手碰这些对象,而是让 agent 去改状态、然后回报。基于这个判断,他们发布了覆盖整个公开 API 的 Cube CLI,于是一条 Claude Code 的 prompt 就能从一个 Postgres 数据库直达一个部署好的数据模型和一个能跑的 React 仪表盘。他押的是:每一个动作都会由 agent 来驱动,不管是人在指挥,还是一个自我改进的递归循环在指挥。
📡 生态产品雷达
生态产品雷达
GEPA — LLM 优化器(反思、变异、帕累托选择),如今被打包进 optimize_anything omni 元优化器,和 AutoResearch、Meta-Harness 并列。
AutoResearch / Meta-Harness — 本周被反复拉出来正面对比的另外两个 program.md 式优化器;没有哪一个能在所有任务上通吃。
Hermes Agent — 那个测出研究技能 F1 相对提升 29% 的自我改进技能 harness。
Claude Code / Codex — 被引用最多的编码 agent,充当 agentic 和自我改进循环的执行层。
本地模型栈(Bonsai 27B、Qwen 3.6、Laguna S 2.1) — 大家真正拿来撑 agent loop 的、按硬件分档的本地模型。
GEPA — LLM 优化器(反思、变异、帕累托选择),如今被打包进 optimize_anything omni 元优化器,和 AutoResearch、Meta-Harness 并列。
AutoResearch / Meta-Harness — 本周被反复拉出来正面对比的另外两个 program.md 式优化器;没有哪一个能在所有任务上通吃。
Hermes Agent — 那个测出研究技能 F1 相对提升 29% 的自我改进技能 harness。
Claude Code / Codex — 被引用最多的编码 agent,充当 agentic 和自我改进循环的执行层。
本地模型栈(Bonsai 27B、Qwen 3.6、Laguna S 2.1) — 大家真正拿来撑 agent loop 的、按硬件分档的本地模型。
评论