Loop 日报: 2026-09-25
今天这个循环不再是演示,它变成了带价签的基础设施。一个衡量递归自我改进的开放基准发布了,跑在一千张 GPU 上、单条 agent 轨迹长达 60 小时,而且点名了两个 agent 到底发现了什么——Codex 找到的优化器在不同方向之间平衡矩阵更新,Claude Code 找到的按每个隐藏单元自身的权重缩放它的更新,分别比基线高 0.60% 和 0.35%。一个悬赏挑战赛七天内把一笔抗量子比特币交易的成本砍掉 79%。Perplexity 把一个核心检索引擎的功劳公开归给了数百次 auto-research 循环,而不是归给工程师。但这些战果底下压着一个更难的发现:Google 的论文显示,自动优化 harness 会让你的评测分数上升、agent 在真实任务上反而变差,解法是在循环的两端都加约束。今天的另一半是清醒的那一半——瓶颈不是 agent 循环,是监督循环;先上审计轨迹、再上自主性的那批人,试点才活得下来。当天被引用最多的一条架构论断是:不要把 agent 跑在沙盒里面,因为沙盒的爆炸半径会变成你 agent 的爆炸半径。
#1
@OpenRSI
https://x.com/OpenRSI/status/2102831770458890626
发布了 OpenRSI-Index v0.1,一个衡量「AI 能不能递归自我改进」的开放基准,而且跑的是生产级集群上的真任务而不是玩具任务。他们把完整的开源项目转成 autoresearch 环境,agent 单条轨迹长达 60 小时以上,在 1000 张 GPU 上运行,光是造 v0.1 就烧掉了 10 万以上 H100 小时。真正值得争论的是他们的立论:核心问题是递归自我改进能不能系统性地越过人类设计的方法,而现在缺的不是一个排行榜名次,而是一套在真实智能研发场景里衡量它的中立开放标准。
https://x.com/OpenRSI/status/2102831770458890626
发布了 OpenRSI-Index v0.1,一个衡量「AI 能不能递归自我改进」的开放基准,而且跑的是生产级集群上的真任务而不是玩具任务。他们把完整的开源项目转成 autoresearch 环境,agent 单条轨迹长达 60 小时以上,在 1000 张 GPU 上运行,光是造 v0.1 就烧掉了 10 万以上 H100 小时。真正值得争论的是他们的立论:核心问题是递归自我改进能不能系统性地越过人类设计的方法,而现在缺的不是一个排行榜名次,而是一套在真实智能研发场景里衡量它的中立开放标准。
#2
@yuetai12575
https://x.com/yuetai12575/status/2102884893562941492
解释了他们为什么要做 RSI-Anything 这条人机协作流水线:通过大约一小时的对话,就能把一个真实的研究问题变成一个可运行的 autoresearch 环境。他开放它的理由是:今天所有人都在为递归自我改进兴奋,但参与门槛把所有人都挡在门外;而模型的 RSI 能力本来就来自研究者、独立实验室和各领域团队的共同贡献。所有东西都开源,包括轨迹本身——任务、harness、验证器、完整的 agent 执行轨迹。最值得记住的是那句:人的洞察受限于带宽,而 agent 可以扫过大得多的方法空间。
https://x.com/yuetai12575/status/2102884893562941492
解释了他们为什么要做 RSI-Anything 这条人机协作流水线:通过大约一小时的对话,就能把一个真实的研究问题变成一个可运行的 autoresearch 环境。他开放它的理由是:今天所有人都在为递归自我改进兴奋,但参与门槛把所有人都挡在门外;而模型的 RSI 能力本来就来自研究者、独立实验室和各领域团队的共同贡献。所有东西都开源,包括轨迹本身——任务、harness、验证器、完整的 agent 执行轨迹。最值得记住的是那句:人的洞察受限于带宽,而 agent 可以扫过大得多的方法空间。
#3
@OpenRSI
https://x.com/OpenRSI/status/2102831775307411720
公布了第一批具体结果,这是今天这条流里最有意思的东西,因为它点名了每个 agent 到底发现了什么。在 Marin-Scaling-Ladder 上,agent 必须自主提出、实现并评估新的优化器,跨 550M 到 2.5B 六个模型规模、对标 Marin 基线。跑 GPT-5.6 的 Codex 测试了 17 个假设,发现了 PSPR——在不同方向之间平衡矩阵更新的强度,在全部六个规模上平均超过 AdamH 0.60%。跑 Opus 5 的 Claude Code 发现了 RMBT——按每个隐藏单元自身的权重去缩放它的更新,平均提升 0.35%。数字不大,但这是优化器层面的发现,不是调提示词。
https://x.com/OpenRSI/status/2102831775307411720
公布了第一批具体结果,这是今天这条流里最有意思的东西,因为它点名了每个 agent 到底发现了什么。在 Marin-Scaling-Ladder 上,agent 必须自主提出、实现并评估新的优化器,跨 550M 到 2.5B 六个模型规模、对标 Marin 基线。跑 GPT-5.6 的 Codex 测试了 17 个假设,发现了 PSPR——在不同方向之间平衡矩阵更新的强度,在全部六个规模上平均超过 AdamH 0.60%。跑 Opus 5 的 Claude Code 发现了 RMBT——按每个隐藏单元自身的权重去缩放它的更新,平均提升 0.35%。数字不大,但这是优化器层面的发现,不是调提示词。
#4
@StarkWareLtd
https://x.com/StarkWareLtd/status/2103137679940505957
量子安全比特币 Autoresearch 挑战赛开跑一周,研究者和 AI agent 把一笔抗量子比特币交易的成本从约 320 美元压到约 67 美元,七天降了 79%。第一周的前三名分掉 2000 美元,接下来两周还有 1.8 万美元。这是本轮最干净的一个例子:一个 autoresearch 循环对准一个挂着真钱的标量指标——目标可验证、排行榜公开、奖励用美元而不是引用数计价。
https://x.com/StarkWareLtd/status/2103137679940505957
量子安全比特币 Autoresearch 挑战赛开跑一周,研究者和 AI agent 把一笔抗量子比特币交易的成本从约 320 美元压到约 67 美元,七天降了 79%。第一周的前三名分掉 2000 美元,接下来两周还有 1.8 万美元。这是本轮最干净的一个例子:一个 autoresearch 循环对准一个挂着真钱的标量指标——目标可验证、排行榜公开、奖励用美元而不是引用数计价。
#5
@VoidAsuka
https://x.com/VoidAsuka/status/2102995589017543102
记录了一次在租来的 H100 上提交的 PR,重点不在用了什么模型,而在 agent 实际干了什么。她以前要写和维护一大堆脚本才能高效使用租来的算力;这次她的编码 agent 可以在同一个工作流里创建节点、跑容器、检查失败、取回结果,并在不需要时把节点关掉——和改代码是同一件事。补丁本身修的是 Diffusers 版本覆盖了确定性设置、并把 FA3 包成了一个没有注册反向的自定义算子。整次验证包括配置和重试在内,GPU 费用约 8 美元。
https://x.com/VoidAsuka/status/2102995589017543102
记录了一次在租来的 H100 上提交的 PR,重点不在用了什么模型,而在 agent 实际干了什么。她以前要写和维护一大堆脚本才能高效使用租来的算力;这次她的编码 agent 可以在同一个工作流里创建节点、跑容器、检查失败、取回结果,并在不需要时把节点关掉——和改代码是同一件事。补丁本身修的是 Diffusers 版本覆盖了确定性设置、并把 FA3 包成了一个没有注册反向的自定义算子。整次验证包括配置和重试在内,GPU 费用约 8 美元。
#6
@AravSrinivas
https://x.com/AravSrinivas/status/2103195385804238972
他说 Perplexity 那个用 Rust 写的检索排序引擎 Photon——p95 延迟低于 250 毫秒、相关性基准分数还很高——是由一个小团队加上数百次 auto-research 循环做出来的,驱动这些循环的是一个能力更强的内部版 Perplexity Computer。真正承重的是后半句:这些循环会持续在帕累托前沿上爬坡。这是第一次有大型消费级 AI 产品公开把一个核心基础组件的功劳归给 auto-research 流程,而不是归给工程师。
https://x.com/AravSrinivas/status/2103195385804238972
他说 Perplexity 那个用 Rust 写的检索排序引擎 Photon——p95 延迟低于 250 毫秒、相关性基准分数还很高——是由一个小团队加上数百次 auto-research 循环做出来的,驱动这些循环的是一个能力更强的内部版 Perplexity Computer。真正承重的是后半句:这些循环会持续在帕累托前沿上爬坡。这是第一次有大型消费级 AI 产品公开把一个核心基础组件的功劳归给 auto-research 流程,而不是归给工程师。
#7
@GregKamradt
https://x.com/GregKamradt/status/2102783480191189236
用两个条件把 RSI 这场争论切开了。第一,模型要能提出能改进模型的想法——但「nanoGPT 式的优化改进」和「换架构这种根本性改进」是两回事,AI 目前明显更擅长前者。第二,人要退出循环,而现在按下部署按钮的还是人;把这个瓶颈拿掉会缩短周期,但同时也拿掉了人的监督,他把这看成一个信任问题和工程问题,会随着更好的监控和可解释性被解决。他补的那句才最锋利:RSI 其实已经在了——把一个本地模型挂到 autoresearch 循环上去改进它自己或另一个模型,这就是 RSI,只是还不够好,所以大家争的其实是程度。
https://x.com/GregKamradt/status/2102783480191189236
用两个条件把 RSI 这场争论切开了。第一,模型要能提出能改进模型的想法——但「nanoGPT 式的优化改进」和「换架构这种根本性改进」是两回事,AI 目前明显更擅长前者。第二,人要退出循环,而现在按下部署按钮的还是人;把这个瓶颈拿掉会缩短周期,但同时也拿掉了人的监督,他把这看成一个信任问题和工程问题,会随着更好的监控和可解释性被解决。他补的那句才最锋利:RSI 其实已经在了——把一个本地模型挂到 autoresearch 循环上去改进它自己或另一个模型,这就是 RSI,只是还不够好,所以大家争的其实是程度。
#8
@realbarnakiss
https://x.com/realbarnakiss/status/2102780148906909934
从内部描述了长周期 autoresearch 到底是什么感觉。当你找到那种需要几周才能用 AI 解决的问题时,你会进入一个知识获取的循环:你不断回头看三四天前的自己,意识到当时有多少东西不知道,同时也知道再过三四天自己会知道更多。有意思的是他对「为什么人和人之间的认知差距这么大」的解释:知识的定义本身在变——什么是必需的、什么是多余的、什么看起来可以跳过但其实不能。
https://x.com/realbarnakiss/status/2102780148906909934
从内部描述了长周期 autoresearch 到底是什么感觉。当你找到那种需要几周才能用 AI 解决的问题时,你会进入一个知识获取的循环:你不断回头看三四天前的自己,意识到当时有多少东西不知道,同时也知道再过三四天自己会知道更多。有意思的是他对「为什么人和人之间的认知差距这么大」的解释:知识的定义本身在变——什么是必需的、什么是多余的、什么看起来可以跳过但其实不能。
#9
@dair_ai
https://x.com/dair_ai/status/2102465468556820660
总结了 PrimeScientist,它把「研究 agent 的预算该花在哪」当成 agent 自己的工作,而不是一个超参数。它维护一棵可执行的计划树,装着相互竞争的研究方向和各自的结果;一个自适应 MCTS 策略读取实验反馈和剩余预算,决定是探索新方向还是继续一条有希望的路。在同等预算下,它在 12 项 AI 研究任务上对比 AutoResearch 多拿 10.3% 的回报,同时少做 50.6% 的实验尝试;这个优势在系统、代码优化和机器学习工程任务上同样成立。最能落地的是那句:如果你的研究 agent 提出的实验比你跑得起的多,这就是一个在它们之间做选择的具体方法。
https://x.com/dair_ai/status/2102465468556820660
总结了 PrimeScientist,它把「研究 agent 的预算该花在哪」当成 agent 自己的工作,而不是一个超参数。它维护一棵可执行的计划树,装着相互竞争的研究方向和各自的结果;一个自适应 MCTS 策略读取实验反馈和剩余预算,决定是探索新方向还是继续一条有希望的路。在同等预算下,它在 12 项 AI 研究任务上对比 AutoResearch 多拿 10.3% 的回报,同时少做 50.6% 的实验尝试;这个优势在系统、代码优化和机器学习工程任务上同样成立。最能落地的是那句:如果你的研究 agent 提出的实验比你跑得起的多,这就是一个在它们之间做选择的具体方法。
#10
@pzakin
https://x.com/pzakin/status/2102477549024706842
列了他在找的五类公司,第一类把 autoresearch 重新框定得很有用。他管它们叫「探索者 agent」——持续调查「可能的改进」这个搜索空间的 agent;autoresearch 只是其中一个「目标可验证」的例子,而他认为目标不可验证的探索者同样会被找到,而且会很有意思。他给的通俗定义是:一个把某件事想到过分的 agent。他还在找传感器和仿真类公司,因为好决策来自对世界运作方式的理解;他的判断是每一个软件产品都应该用上由仿真或生产环境数据驱动的自主循环。
https://x.com/pzakin/status/2102477549024706842
列了他在找的五类公司,第一类把 autoresearch 重新框定得很有用。他管它们叫「探索者 agent」——持续调查「可能的改进」这个搜索空间的 agent;autoresearch 只是其中一个「目标可验证」的例子,而他认为目标不可验证的探索者同样会被找到,而且会很有意思。他给的通俗定义是:一个把某件事想到过分的 agent。他还在找传感器和仿真类公司,因为好决策来自对世界运作方式的理解;他的判断是每一个软件产品都应该用上由仿真或生产环境数据驱动的自主循环。
#11
@varun_mathur
https://x.com/varun_mathur/status/2102463188432216202
因为「agentic 集群如何在没有编排者的情况下协作」这项工作被学术论文引用,他描述的那条谱系值得记下来。在 Karpathy 号召大家为他开创的 autoresearch 循环搞一个 SETI@home 式的协作项目之后,他做的版本刻意不设中央编排者,而是用一个消息板代替。关键特征是:agent 读写同一份公开记录、开放参与、按签名划分的分支、CRDT 排行榜,以及把所有结果(包括没有改进的结果)都广播出去。他的说法是,2026 年 3 月以来所有集群最终都收敛到了这个形状——而让 agent 知识产生复利的,正是把失败也广播出去这一条。
https://x.com/varun_mathur/status/2102463188432216202
因为「agentic 集群如何在没有编排者的情况下协作」这项工作被学术论文引用,他描述的那条谱系值得记下来。在 Karpathy 号召大家为他开创的 autoresearch 循环搞一个 SETI@home 式的协作项目之后,他做的版本刻意不设中央编排者,而是用一个消息板代替。关键特征是:agent 读写同一份公开记录、开放参与、按签名划分的分支、CRDT 排行榜,以及把所有结果(包括没有改进的结果)都广播出去。他的说法是,2026 年 3 月以来所有集群最终都收敛到了这个形状——而让 agent 知识产生复利的,正是把失败也广播出去这一条。
#12
@EMostaque
https://x.com/EMostaque/status/2102810115703484479
指向 Bespoke Labs 关于 Autoresearch 考试的那篇博文,结论是:换成标准 harness,性能差异极小。在一个人人都在卖 harness 优化的星期里,这是一条被低估的负面结果——如果一套专门打造的研究配置在这个考试上和现成的差不多,那别处报出来的 harness 增益就是任务专属的、而不是普遍的。他自己的判断是:可靠的前沿对所有人都触手可及。
https://x.com/EMostaque/status/2102810115703484479
指向 Bespoke Labs 关于 Autoresearch 考试的那篇博文,结论是:换成标准 harness,性能差异极小。在一个人人都在卖 harness 优化的星期里,这是一条被低估的负面结果——如果一套专门打造的研究配置在这个考试上和现成的差不多,那别处报出来的 harness 增益就是任务专属的、而不是普遍的。他自己的判断是:可靠的前沿对所有人都触手可及。
#13
@antoine_chaffin
https://x.com/antoine_chaffin/status/2102290426589819092
就一句话,却是这一批里最悄无声息的激进:跟自己的 CTO 讨论「让 auto-research 在周末把一个 encoder 训出来」。不是 demo,不是跑分,就是一次普通的工程对话——而在这次对话里,一个周末的无人值守训练已经成了默认选项,训的还是一个过去根本不会专门派人去调的组件。
https://x.com/antoine_chaffin/status/2102290426589819092
就一句话,却是这一批里最悄无声息的激进:跟自己的 CTO 讨论「让 auto-research 在周末把一个 encoder 训出来」。不是 demo,不是跑分,就是一次普通的工程对话——而在这次对话里,一个周末的无人值守训练已经成了默认选项,训的还是一个过去根本不会专门派人去调的组件。
#14
@insecureagents
https://x.com/insecureagents/status/2102391446674554993
发了一期关于 agent 化防御的访谈,里面有本轮关于自主性最诚实的一句话:市面上有大量「把人从循环里拿掉」的营销噪音,而他们几乎没见过谁真的走到了那个 run 阶段。他们的分级路径是 crawl-walk-run:先只读,再在 Slack 或 Teams 里挂一个审批钩子,然后开始统计 agent 到底对了多少次。两个细节特别扎实:一个卡点是 agent 在运行时到底知不知道它要杀掉的那台服务器每天承载着一百万美元的业务;另一个是审计日志必须记下每一次 agent 动作,以及它是代表谁执行的。他们的 API 访问是在配置阶段授予而不是运行时授予,同时在监控「40 个 agent 里第 17 个开始漂移」这种情况。他们的下一步正是 auto-research 循环和数字孪生。
https://x.com/insecureagents/status/2102391446674554993
发了一期关于 agent 化防御的访谈,里面有本轮关于自主性最诚实的一句话:市面上有大量「把人从循环里拿掉」的营销噪音,而他们几乎没见过谁真的走到了那个 run 阶段。他们的分级路径是 crawl-walk-run:先只读,再在 Slack 或 Teams 里挂一个审批钩子,然后开始统计 agent 到底对了多少次。两个细节特别扎实:一个卡点是 agent 在运行时到底知不知道它要杀掉的那台服务器每天承载着一百万美元的业务;另一个是审计日志必须记下每一次 agent 动作,以及它是代表谁执行的。他们的 API 访问是在配置阶段授予而不是运行时授予,同时在监控「40 个 agent 里第 17 个开始漂移」这种情况。他们的下一步正是 auto-research 循环和数字孪生。
#15
@alex_verem
https://x.com/alex_verem/status/2102698998515761629
把 NVIDIA、南洋理工和 MIT 那篇关于自我改进 harness 的 SoL-Pi 论文讲得最清楚。做法是让一个研究 AI 看着编码 agent 工作,提出对 harness 的修改、做测试,只保留那些「省 token 又不掉分」的改动——约 150 个研究方向、约 500 个环境、3000 多次运行、6 万多次 agent 与环境的交互。最后活下来四条:把「改文件」和「跑测试」合成一次调用而不是两次;子任务结束时压缩记忆,且只在压缩比全留更便宜时才做;大的工具输出完整发两次,之后换成 1KB 摘要并留一个句柄按需取全文;用便宜模型总结构建和测试日志,再由一个验证器把丢失证据的摘要打回。结果是 token 流量降 44.7% 到 49%、API 成本降约三分之一、分数保住约 94%。这些全都没碰模型。他们的下一步是用这个更便宜的 harness 再跑一遍搜索——让便宜的 agent 去资助搜索一个更便宜的。
https://x.com/alex_verem/status/2102698998515761629
把 NVIDIA、南洋理工和 MIT 那篇关于自我改进 harness 的 SoL-Pi 论文讲得最清楚。做法是让一个研究 AI 看着编码 agent 工作,提出对 harness 的修改、做测试,只保留那些「省 token 又不掉分」的改动——约 150 个研究方向、约 500 个环境、3000 多次运行、6 万多次 agent 与环境的交互。最后活下来四条:把「改文件」和「跑测试」合成一次调用而不是两次;子任务结束时压缩记忆,且只在压缩比全留更便宜时才做;大的工具输出完整发两次,之后换成 1KB 摘要并留一个句柄按需取全文;用便宜模型总结构建和测试日志,再由一个验证器把丢失证据的摘要打回。结果是 token 流量降 44.7% 到 49%、API 成本降约三分之一、分数保住约 94%。这些全都没碰模型。他们的下一步是用这个更便宜的 harness 再跑一遍搜索——让便宜的 agent 去资助搜索一个更便宜的。
#16
@ayyazdev
https://x.com/ayyazdev/status/2102883543479173512
补上了让 SoL-Pi 这个结果真正落地的那个数字:auto-research 循环一共提出了 152 条 harness 改动,最后活下来 4 条。存活率 2.6%,而这是整篇论文里最有用的一个统计量,因为它诚实地给这个循环定了价——价值不在于「AI 能提改动」,而在于它提得起 152 条、也扔得起 148 条。他还点出那个 Evidence-Preserving Reducer 的做法是把冗长的构建和测试日志过一遍便宜模型、再由验证器把关;他自己的结论是:账单里有很大一块,仅仅是 agent 跟工具说话的方式造成的。
https://x.com/ayyazdev/status/2102883543479173512
补上了让 SoL-Pi 这个结果真正落地的那个数字:auto-research 循环一共提出了 152 条 harness 改动,最后活下来 4 条。存活率 2.6%,而这是整篇论文里最有用的一个统计量,因为它诚实地给这个循环定了价——价值不在于「AI 能提改动」,而在于它提得起 152 条、也扔得起 148 条。他还点出那个 Evidence-Preserving Reducer 的做法是把冗长的构建和测试日志过一遍便宜模型、再由验证器把关;他自己的结论是:账单里有很大一块,仅仅是 agent 跟工具说话的方式造成的。
#17
@omarsar0
https://x.com/omarsar0/status/2102853768266256738
总结了那篇点名所有自我改进 harness 通病的 Google 论文:如果你自动优化 agent 的 harness,评测分数可以上升,而 agent 在真实任务上反而变差。在五种 harness 演化方法的对比里,带正则化的那个在「它演化时对着的那批任务」上分数最低,却在三个分布外基准上全部最高。Meta-Harness 在演化集上冲到 93.0,但在 JobBench、GDPval 和 APEX-Agents 上只涨了 0.3 到 1.5 分。RRSI 的做法是在循环两端都加约束:提案端给一个随时间收缩的编辑预算,并推着它去试没试过的方向;一个评论者否决那些明显针对特定基准的改动;一个修剪器删掉太小、太贵或已经没用的改动。RRSI 在演化集上 90.5,却在三个留出基准上涨了 3.5 到 4.7 分,且每次试验用 242 万 token,而不加正则化的要 380 万。
https://x.com/omarsar0/status/2102853768266256738
总结了那篇点名所有自我改进 harness 通病的 Google 论文:如果你自动优化 agent 的 harness,评测分数可以上升,而 agent 在真实任务上反而变差。在五种 harness 演化方法的对比里,带正则化的那个在「它演化时对着的那批任务」上分数最低,却在三个分布外基准上全部最高。Meta-Harness 在演化集上冲到 93.0,但在 JobBench、GDPval 和 APEX-Agents 上只涨了 0.3 到 1.5 分。RRSI 的做法是在循环两端都加约束:提案端给一个随时间收缩的编辑预算,并推着它去试没试过的方向;一个评论者否决那些明显针对特定基准的改动;一个修剪器删掉太小、太贵或已经没用的改动。RRSI 在演化集上 90.5,却在三个留出基准上涨了 3.5 到 4.7 分,且每次试验用 242 万 token,而不加正则化的要 380 万。
#18
@tierfour_
https://x.com/tierfour_/status/2102429476571288057
转述了一个能重新框定 agent 设计的区分:编码 agent 和工具 agent 不是一回事。工具 agent 把每个结果直接倒进 LLM 上下文,于是你让它查数据库,它把所有行都返回来,这些东西在模型开始推理之前就已经烧掉了输入 token。代码 agent 调用的是普通函数、拿回结构化对象——是一个 DataFrame 而不是一大段文字——你可以直接交给下一步,而这些数据从头到尾没经过模型。正确的心智模型是 Jupyter notebook 会话,而同一个 agent 可以按任务在两种范式之间切换。真正夸张的是 auto-research:把它指向一个问题,它能在两天里不知疲倦地跑上百个实验,瓶颈从科学家变成了算力。
https://x.com/tierfour_/status/2102429476571288057
转述了一个能重新框定 agent 设计的区分:编码 agent 和工具 agent 不是一回事。工具 agent 把每个结果直接倒进 LLM 上下文,于是你让它查数据库,它把所有行都返回来,这些东西在模型开始推理之前就已经烧掉了输入 token。代码 agent 调用的是普通函数、拿回结构化对象——是一个 DataFrame 而不是一大段文字——你可以直接交给下一步,而这些数据从头到尾没经过模型。正确的心智模型是 Jupyter notebook 会话,而同一个 agent 可以按任务在两种范式之间切换。真正夸张的是 auto-research:把它指向一个问题,它能在两天里不知疲倦地跑上百个实验,瓶颈从科学家变成了算力。
#19
@0xMortyx
https://x.com/0xMortyx/status/2102418994510639280
做了一个自我改进的 agent,在一个刁钻的结账流程上把成功率从 12% 提到 88%,耗时 29 秒、成本 2 美分,没有任何微调——同一个 agent、同一份模型权重、50 次尝试。每次失败之后,一个决策模型会问六个类型化的问题:哪一步坏了、根因是什么、这会再发生还是只是噪声。最后保留了 8 条规则,16 次失败被当噪声丢掉。活下来的规则里有两条是「忽略那个绿色的 BUY NOW 横幅」(+16 分)和「遇到验证码就转去音频挑战」(+12 分)。他的结论最值得带走:这个 agent 从来不是不会结账,它是不会「不去点广告」。
https://x.com/0xMortyx/status/2102418994510639280
做了一个自我改进的 agent,在一个刁钻的结账流程上把成功率从 12% 提到 88%,耗时 29 秒、成本 2 美分,没有任何微调——同一个 agent、同一份模型权重、50 次尝试。每次失败之后,一个决策模型会问六个类型化的问题:哪一步坏了、根因是什么、这会再发生还是只是噪声。最后保留了 8 条规则,16 次失败被当噪声丢掉。活下来的规则里有两条是「忽略那个绿色的 BUY NOW 横幅」(+16 分)和「遇到验证码就转去音频挑战」(+12 分)。他的结论最值得带走:这个 agent 从来不是不会结账,它是不会「不去点广告」。
#20
@JamesWard
https://x.com/JamesWard/status/2102468057494917237
他说在自己那套基于决策模型的 agentic loop 里,现在只剩两个地方还需要把 LLM 当工具用:摘要和参数解析。以前他会让 LLM 为工具调用返回的结果生成过滤条件——就像编码助手定义 grep 和 find 调用那样。现在他直接让决策模型来做过滤:它写不出 LLM 那样的过滤条件,但对足够小的数据集,它可以直接做语义过滤,而他认为这样反而可能比生成出来的条件更准。
https://x.com/JamesWard/status/2102468057494917237
他说在自己那套基于决策模型的 agentic loop 里,现在只剩两个地方还需要把 LLM 当工具用:摘要和参数解析。以前他会让 LLM 为工具调用返回的结果生成过滤条件——就像编码助手定义 grep 和 find 调用那样。现在他直接让决策模型来做过滤:它写不出 LLM 那样的过滤条件,但对足够小的数据集,它可以直接做语义过滤,而他认为这样反而可能比生成出来的条件更准。
#21
@OnFinality
https://x.com/OnFinality/status/2102413942824075551
一句话点出了大家在搭 agentic loop 时真正卡住的地方——他是在追问某门课程有没有讲这一段。循环本身是容易的;难的是决定它什么时候该停、什么时候该重试、什么时候该交回给人。终止条件是循环工程里最少被教、代价最高的一块,而几乎没有教材讲它。
https://x.com/OnFinality/status/2102413942824075551
一句话点出了大家在搭 agentic loop 时真正卡住的地方——他是在追问某门课程有没有讲这一段。循环本身是容易的;难的是决定它什么时候该停、什么时候该重试、什么时候该交回给人。终止条件是循环工程里最少被教、代价最高的一块,而几乎没有教材讲它。
#22
@NathanFlurry
https://x.com/NathanFlurry/status/2102523527304032256
提出了本轮最有力的一条架构论证,反对把 agent 跑在沙盒里面。理论上很简单,但在生产环境里,沙盒的爆炸半径就变成了你 agent 的爆炸半径:沙盒崩溃或 OOM,agent 循环跟着死;磁盘满了或环境坏了,agent 变砖;把你自己的 API 暴露成工具需要额外基建;凭据不能放在沙盒里,于是你还得再造一整层凭据代理;休眠的沙盒没法自己醒来跑定时任务;更新 agent 代码意味着去每一台虚拟机里更新二进制;监控意味着沙盒得自己上报自己的故障。他的替代方案是:harness 跑在你的后端里,把沙盒当成工具暴露出来,凭据、历史和权限全部放在外面,只在需要时唤醒沙盒。他指出 Amp、Vercel Eve、Cloudflare Flue、Claude Managed Agents 和 OpenAI 的 Agents SDK 全都收敛到了这个架构。
https://x.com/NathanFlurry/status/2102523527304032256
提出了本轮最有力的一条架构论证,反对把 agent 跑在沙盒里面。理论上很简单,但在生产环境里,沙盒的爆炸半径就变成了你 agent 的爆炸半径:沙盒崩溃或 OOM,agent 循环跟着死;磁盘满了或环境坏了,agent 变砖;把你自己的 API 暴露成工具需要额外基建;凭据不能放在沙盒里,于是你还得再造一整层凭据代理;休眠的沙盒没法自己醒来跑定时任务;更新 agent 代码意味着去每一台虚拟机里更新二进制;监控意味着沙盒得自己上报自己的故障。他的替代方案是:harness 跑在你的后端里,把沙盒当成工具暴露出来,凭据、历史和权限全部放在外面,只在需要时唤醒沙盒。他指出 Amp、Vercel Eve、Cloudflare Flue、Claude Managed Agents 和 OpenAI 的 Agents SDK 全都收敛到了这个架构。
#23
@Kizuno18
https://x.com/Kizuno18/status/2102206357017436609
补上了让确定性检查点值得做的那个理由:当每个检查点都由确定性代码在带外验证过,凌晨三点崩一次并不意味着要从头再跑一遍 30 分钟的 agent 循环——你可以从最后一个通过的检查点恢复,而且状态保证干净。值得记住的词是「带外」。验证不能来自那个正在被检查的 agent 自己,否则这个检查点什么也证明不了。
https://x.com/Kizuno18/status/2102206357017436609
补上了让确定性检查点值得做的那个理由:当每个检查点都由确定性代码在带外验证过,凌晨三点崩一次并不意味着要从头再跑一遍 30 分钟的 agent 循环——你可以从最后一个通过的检查点恢复,而且状态保证干净。值得记住的词是「带外」。验证不能来自那个正在被检查的 agent 自己,否则这个检查点什么也证明不了。
#24
@joeyjjooste
https://x.com/joeyjjooste/status/2103072239763456379
报告了他们第一条完全自动的 agent 循环打到了代码仓库:用户遇到报错 → PostHog 捕获 → 自动建 Linear 工单 → 决策模型分流 → 内部 agent 修复 → 开 PR → 合并。除了点一下合并之外没有任何人工介入,而他们正在考虑把自动合并也打开。这是本条流里对「从真实用户报错开始、到代码上线结束」的生产循环最短的一个完整描述,剩下的唯一人工闸门就是一个按钮。
https://x.com/joeyjjooste/status/2103072239763456379
报告了他们第一条完全自动的 agent 循环打到了代码仓库:用户遇到报错 → PostHog 捕获 → 自动建 Linear 工单 → 决策模型分流 → 内部 agent 修复 → 开 PR → 合并。除了点一下合并之外没有任何人工介入,而他们正在考虑把自动合并也打开。这是本条流里对「从真实用户报错开始、到代码上线结束」的生产循环最短的一个完整描述,剩下的唯一人工闸门就是一个按钮。
#25
@ishaansehgal
https://x.com/ishaansehgal/status/2102912828202164713
一口气说出了方向和方向本身的问题。下一次更新之后一切都会变成托管 agent——agent 循环默认跑在云上,如果你想用本地设备,可以选择跑一个本地守护进程。他说这不可避免,同时也令人担忧,然后把立场摊开:你不该从模型厂商那里租你的控制平面。模型自己挑、云自己挑、价格自己挑、数据自己拥有。这是对本周各大实验室齐刷刷推出的托管 agent 浪潮,最干净的一句反面陈述。
https://x.com/ishaansehgal/status/2102912828202164713
一口气说出了方向和方向本身的问题。下一次更新之后一切都会变成托管 agent——agent 循环默认跑在云上,如果你想用本地设备,可以选择跑一个本地守护进程。他说这不可避免,同时也令人担忧,然后把立场摊开:你不该从模型厂商那里租你的控制平面。模型自己挑、云自己挑、价格自己挑、数据自己拥有。这是对本周各大实验室齐刷刷推出的托管 agent 浪潮,最干净的一句反面陈述。
#26
@paddix
https://x.com/paddix/status/2102438430013628677
宣布托管 agent 进入公开预览,立论是:agent 不是跑在虚拟机里的传统应用,它是有状态的、事件驱动的循环——用 token 推理、以突发方式执行、调用外部系统、并跨会话保持状态。真正值得看的是它预接好的那张清单:每个会话一个独立的安全 microVM 沙盒;带暂停、恢复、检查点和分叉的持久化执行;在托管的开源权重模型和前沿模型之间做统一路由;一个托管 MCP 端点接入 1.6 万个以上工具;执行时的凭据代理,让 agent 永远看不到密钥;以及贯穿运行时、模型和工具调用的统一遥测。他的判断是:云计算的计费单元正在从「开出来的虚拟机」变成「一次 agent 运行」。
https://x.com/paddix/status/2102438430013628677
宣布托管 agent 进入公开预览,立论是:agent 不是跑在虚拟机里的传统应用,它是有状态的、事件驱动的循环——用 token 推理、以突发方式执行、调用外部系统、并跨会话保持状态。真正值得看的是它预接好的那张清单:每个会话一个独立的安全 microVM 沙盒;带暂停、恢复、检查点和分叉的持久化执行;在托管的开源权重模型和前沿模型之间做统一路由;一个托管 MCP 端点接入 1.6 万个以上工具;执行时的凭据代理,让 agent 永远看不到密钥;以及贯穿运行时、模型和工具调用的统一遥测。他的判断是:云计算的计费单元正在从「开出来的虚拟机」变成「一次 agent 运行」。
#27
@YokushObiwan
https://x.com/YokushObiwan/status/2102871969586909644
关于「在 agent 循环里做微支付」这件事,说出了最锋利的一句:它把花钱的决策从一张采购单挪到了一次运行时调用。订阅制自带一道人工闸门——有人签了一份年度订单,那道闸门就是控制本身。按请求的微支付把它拿掉了,于是 agent 一天买上千次数据,而它和预算之间只剩一个设了一次、再没人回头看的上限。他的结论正是整个 agent 商务叙事没在回答的:限制才是产品,轨道不是。谁来设这个上限;agent 第一次判断「这次 5000 美元的调用值得」时会发生什么;以及事后有没有人能重建出它当时为什么这么想。
https://x.com/YokushObiwan/status/2102871969586909644
关于「在 agent 循环里做微支付」这件事,说出了最锋利的一句:它把花钱的决策从一张采购单挪到了一次运行时调用。订阅制自带一道人工闸门——有人签了一份年度订单,那道闸门就是控制本身。按请求的微支付把它拿掉了,于是 agent 一天买上千次数据,而它和预算之间只剩一个设了一次、再没人回头看的上限。他的结论正是整个 agent 商务叙事没在回答的:限制才是产品,轨道不是。谁来设这个上限;agent 第一次判断「这次 5000 美元的调用值得」时会发生什么;以及事后有没有人能重建出它当时为什么这么想。
#28
@ayyazdev
https://x.com/ayyazdev/status/2102822946729259335
介绍了 Cloudflare 的 Worker Previews:每个 Git 分支都能拿到一个接近生产的独立 Worker,有自己的 URL、配置、可观测性,以及隔离的 Durable Object 和 Container 命名空间。最值得抄的是他们建议的那条 agent 循环:部署预览 → 用 Playwright MCP 打开它 → 用 Workers Observability MCP 查 trace → 打补丁 → 重新部署。坏的迁移就留在那条分支上,不会打到共享的 staging 环境。预览里的多 Worker 请求路径和队列消费者还没做完,但他说光是 Durable Object 隔离这一条就已经很有用了。
https://x.com/ayyazdev/status/2102822946729259335
介绍了 Cloudflare 的 Worker Previews:每个 Git 分支都能拿到一个接近生产的独立 Worker,有自己的 URL、配置、可观测性,以及隔离的 Durable Object 和 Container 命名空间。最值得抄的是他们建议的那条 agent 循环:部署预览 → 用 Playwright MCP 打开它 → 用 Workers Observability MCP 查 trace → 打补丁 → 重新部署。坏的迁移就留在那条分支上,不会打到共享的 staging 环境。预览里的多 Worker 请求路径和队列消费者还没做完,但他说光是 Durable Object 隔离这一条就已经很有用了。
#29
@ayyazdev
https://x.com/ayyazdev/status/2102912659343749180
转述了 GitLab 怎么把每条 agentic 流程的代码量砍掉 45%。早期每条流程大约是 450 多行临时拼出来的 LangGraph Python,做到第四条时,图里已经全是一次性节点、自定义状态和没人愿意碰的测试。解法叫 Flow Registry:用 YAML 声明 agent、人工审核检查点和固定步骤,路由器基于共享上下文分支,平台把 agent 循环拥有一次,开发者就不用反复重写它。他们的 Fix Pipeline 说明了为什么结构比「把一切塞进一个提示词」更好——一个裁判 agent 决定是重试、重新规划还是改代码,路由器再把流量送到对应路径;而因为流程住在配置里,高频分支上可以放更便宜的模型。
https://x.com/ayyazdev/status/2102912659343749180
转述了 GitLab 怎么把每条 agentic 流程的代码量砍掉 45%。早期每条流程大约是 450 多行临时拼出来的 LangGraph Python,做到第四条时,图里已经全是一次性节点、自定义状态和没人愿意碰的测试。解法叫 Flow Registry:用 YAML 声明 agent、人工审核检查点和固定步骤,路由器基于共享上下文分支,平台把 agent 循环拥有一次,开发者就不用反复重写它。他们的 Fix Pipeline 说明了为什么结构比「把一切塞进一个提示词」更好——一个裁判 agent 决定是重试、重新规划还是改代码,路由器再把流量送到对应路径;而因为流程住在配置里,高频分支上可以放更便宜的模型。
#30
@ayyazdev
https://x.com/ayyazdev/status/2103000787768984050
报道了 Google 以 Apache 2.0 开源 AX,一个 Kubernetes 风格的长时运行 agent 运行时。值得记住的是他对「agent 为什么是一种奇怪的负载」的描述:它在用工具时算力飙升,然后就干等模型或等人,于是保持热的沙盒在这段空闲里一直烧钱,而冷启动又会毁掉交互循环。AX 把每个会话当成一个有状态的 actor,空闲时检查点并挂起,恢复只要一秒以内。四个 CRD:Task、Workspace、Gateway、Model。他说自己会先上 Gateway——显式的主机与端口白名单,加上出站调用时的凭据注入,而这恰恰是大多数自建 agent 沙盒会跳过的那层围栏。
https://x.com/ayyazdev/status/2103000787768984050
报道了 Google 以 Apache 2.0 开源 AX,一个 Kubernetes 风格的长时运行 agent 运行时。值得记住的是他对「agent 为什么是一种奇怪的负载」的描述:它在用工具时算力飙升,然后就干等模型或等人,于是保持热的沙盒在这段空闲里一直烧钱,而冷启动又会毁掉交互循环。AX 把每个会话当成一个有状态的 actor,空闲时检查点并挂起,恢复只要一秒以内。四个 CRD:Task、Workspace、Gateway、Model。他说自己会先上 Gateway——显式的主机与端口白名单,加上出站调用时的凭据注入,而这恰恰是大多数自建 agent 沙盒会跳过的那层围栏。
#31
@adamm285
https://x.com/adamm285/status/2102260919526928405
点名了三个让 agent 循环变贵的反模式,而且立论对:token 效率不是 LLM 问题,是系统架构问题。天真的 agent 有「grep 反射」——一开机就慌慌张张读文件,烧掉 2000 多个 token。动态前缀每一轮都会把 KV 缓存打爆。而在有确定性格式化工具的情况下,还用前沿模型推理去修缩进,本身就是反模式。他自己那套形式化的做法是把代码库当成一间「家具齐全的办公室」:用 AST 边界划分,黑板区做 token 预算且上限 350,并设置确定性的预检门禁,让失败发生在磁盘上、而不是烧掉模型 token 之后。
https://x.com/adamm285/status/2102260919526928405
点名了三个让 agent 循环变贵的反模式,而且立论对:token 效率不是 LLM 问题,是系统架构问题。天真的 agent 有「grep 反射」——一开机就慌慌张张读文件,烧掉 2000 多个 token。动态前缀每一轮都会把 KV 缓存打爆。而在有确定性格式化工具的情况下,还用前沿模型推理去修缩进,本身就是反模式。他自己那套形式化的做法是把代码库当成一间「家具齐全的办公室」:用 AST 边界划分,黑板区做 token 预算且上限 350,并设置确定性的预检门禁,让失败发生在磁盘上、而不是烧掉模型 token 之后。
#32
@farmer_pink
https://x.com/farmer_pink/status/2102776733208563947
注意到各大实验室正在从不同方向撞上同一个问题——GPT-6 是百万级上下文加上针对常驻 agent 的 prompt 缓存优化,DeepSeek V4 是百万级上下文加逐 token 压缩和稀疏注意力,MiMo 是跨层 KV 共享加稀疏检索和提前退出的 prefill——然后得出了正确的结论:「你的上下文窗口有多长」正在变成上一代的问题。下一代的问题是:跑到 agent 循环的第 30 轮时,你为处理那份上下文付了多少次钱?
https://x.com/farmer_pink/status/2102776733208563947
注意到各大实验室正在从不同方向撞上同一个问题——GPT-6 是百万级上下文加上针对常驻 agent 的 prompt 缓存优化,DeepSeek V4 是百万级上下文加逐 token 压缩和稀疏注意力,MiMo 是跨层 KV 共享加稀疏检索和提前退出的 prefill——然后得出了正确的结论:「你的上下文窗口有多长」正在变成上一代的问题。下一代的问题是:跑到 agent 循环的第 30 轮时,你为处理那份上下文付了多少次钱?
#33
@JoshARosen
https://x.com/JoshARosen/status/2102772898788249865
预测会出现一种介于「一次模型调用」和「一个 agent 循环」之间的新原语,让 LLM 变得可问责得多。想象 invoke 或 responses.create,但配上一个快速决策模型:你传进提示词和消息、类型化的问题、这些答案的阈值,以及最大迭代次数,推理模型就一直循环,直到决策模型判定答案满足阈值为止。本质上就是把「最小可能的 agent 循环」打包进一次调用。如果它真的成立,终止条件就从提示词工程搬进了 API 签名里——而这正是上面那条抱怨认为它本来该待的地方。
https://x.com/JoshARosen/status/2102772898788249865
预测会出现一种介于「一次模型调用」和「一个 agent 循环」之间的新原语,让 LLM 变得可问责得多。想象 invoke 或 responses.create,但配上一个快速决策模型:你传进提示词和消息、类型化的问题、这些答案的阈值,以及最大迭代次数,推理模型就一直循环,直到决策模型判定答案满足阈值为止。本质上就是把「最小可能的 agent 循环」打包进一次调用。如果它真的成立,终止条件就从提示词工程搬进了 API 签名里——而这正是上面那条抱怨认为它本来该待的地方。
#34
@twid
https://x.com/twid/status/2102328541576581567
对「缓存让 agent 循环变便宜」这股乐观情绪做了有用的反驳。很多常见工作流的命中率并不高:3 万 token 对文字来说很多,对图片或视频来说一点都不多,所以只要你在喂截图、图片或视频片段,缓存很快就被冲掉了。对大量文档做 RAG 会慢,分析一份很大的 PDF 也会慢。而多用户同时开两个以上会话会把 SSD 上的 KV 缓存来回擦写,所以共享场景必须先把范围划清楚。他同意长时间运行的单一 agent 循环确实会很快——需要注意的是所有不是这个形状的场景。
https://x.com/twid/status/2102328541576581567
对「缓存让 agent 循环变便宜」这股乐观情绪做了有用的反驳。很多常见工作流的命中率并不高:3 万 token 对文字来说很多,对图片或视频来说一点都不多,所以只要你在喂截图、图片或视频片段,缓存很快就被冲掉了。对大量文档做 RAG 会慢,分析一份很大的 PDF 也会慢。而多用户同时开两个以上会话会把 SSD 上的 KV 缓存来回擦写,所以共享场景必须先把范围划清楚。他同意长时间运行的单一 agent 循环确实会很快——需要注意的是所有不是这个形状的场景。
#35
@DivyanshT91162
https://x.com/DivyanshT91162/status/2102276746842415534
总结了 VideoGen-Agent:它把视频生成从「一条提示词盲生成」变成了一个 agentic loop——提示 → 推理 → 搜索或仿真 → 生成 → 验证 → 精修。这个 agent 可以用网页搜索补程序性知识、用图片搜索找身份和视觉参考、用物理仿真做真实运动、用目标检测做验证、用深度估计保场景一致性,还能按任务切换不同的生成工具。他们用一个共享 agent 跨六个高难度类别训练。基础视频生成器 56.5 分,VideoGen-Agent 75.6,换上更强的生成工具之后 86.1,而且 agent 本身不需要额外训练。人类评审在 84.3% 的对比里更喜欢升级后的配置,而不是最强的单体基线。更大的观点是:AI 学会了判断什么时候不该凭记忆生成、而应该先用工具。
https://x.com/DivyanshT91162/status/2102276746842415534
总结了 VideoGen-Agent:它把视频生成从「一条提示词盲生成」变成了一个 agentic loop——提示 → 推理 → 搜索或仿真 → 生成 → 验证 → 精修。这个 agent 可以用网页搜索补程序性知识、用图片搜索找身份和视觉参考、用物理仿真做真实运动、用目标检测做验证、用深度估计保场景一致性,还能按任务切换不同的生成工具。他们用一个共享 agent 跨六个高难度类别训练。基础视频生成器 56.5 分,VideoGen-Agent 75.6,换上更强的生成工具之后 86.1,而且 agent 本身不需要额外训练。人类评审在 84.3% 的对比里更喜欢升级后的配置,而不是最强的单体基线。更大的观点是:AI 学会了判断什么时候不该凭记忆生成、而应该先用工具。
#36
@thehypedotnews
https://x.com/thehypedotnews/status/2102527541051633903
用同一条约 10 万 token 的提示词,让三个模型各做三部末日题材短片、每部一个 HTML 文件,而方法论本身很关键:GPT-6 Astra 是一次提示一次回复、没有 agent 循环;Opus 5.5 和 Fable 5.1 则是在 Claude Code 里以 agent 方式跑——写文件、在浏览器里打开、看画面、修、再来一遍。两个发现值得记:Opus 5.5 是靠看自己渲染出来的画面发现自己的 bug 的,包括光束里一个 NaN 导致餐厅场景出现黑色虚线,以及用了 patch 当变量名(这在 GLSL 里是保留字)。另一个是循环会越跑越便宜:第一部片子用了 46 次模型调用、9.94 美元,之后复用自己的工具包,第二部 16 次 4.85 美元,第三部 17 次 4.59 美元。Opus 总共 19.38 美元里有 8.8 美元是缓存读取——因为每一个 agent 步骤都要重读 20 万到 45 万 token 的上下文。
https://x.com/thehypedotnews/status/2102527541051633903
用同一条约 10 万 token 的提示词,让三个模型各做三部末日题材短片、每部一个 HTML 文件,而方法论本身很关键:GPT-6 Astra 是一次提示一次回复、没有 agent 循环;Opus 5.5 和 Fable 5.1 则是在 Claude Code 里以 agent 方式跑——写文件、在浏览器里打开、看画面、修、再来一遍。两个发现值得记:Opus 5.5 是靠看自己渲染出来的画面发现自己的 bug 的,包括光束里一个 NaN 导致餐厅场景出现黑色虚线,以及用了 patch 当变量名(这在 GLSL 里是保留字)。另一个是循环会越跑越便宜:第一部片子用了 46 次模型调用、9.94 美元,之后复用自己的工具包,第二部 16 次 4.85 美元,第三部 17 次 4.59 美元。Opus 总共 19.38 美元里有 8.8 美元是缓存读取——因为每一个 agent 步骤都要重读 20 万到 45 万 token 的上下文。
#37
@jjohana
https://x.com/jjohana/status/2103003083118715067
弄清楚了为什么 GPT-6 Sol 在整体超越前代的同时,却在部分专业工作基准上倒退——答案是 harness。AA-Briefcase 和 GDPval 让 Sol 跑在 Stirrup 里而不是 Work 里;Terminal-Bench 用的是 mini-swe-agent 而不是 Codex。换到 OpenAI 自家的 Codex harness,分数是 57 对 55,Terminal-Bench 从 37% 跳到 43%。他还指出大家在低推理档位上观察到的「偷懒」——回答更短、更早停、迭代更少——有一部分是 harness 造成的,因为在原生 harness 里,agent 循环、上下文管理、工具、迭代和停止条件全都由 OpenAI 控制。他的结论该被钉在墙上:基准测试越来越是在测「模型 × harness」,而不只是模型。
https://x.com/jjohana/status/2103003083118715067
弄清楚了为什么 GPT-6 Sol 在整体超越前代的同时,却在部分专业工作基准上倒退——答案是 harness。AA-Briefcase 和 GDPval 让 Sol 跑在 Stirrup 里而不是 Work 里;Terminal-Bench 用的是 mini-swe-agent 而不是 Codex。换到 OpenAI 自家的 Codex harness,分数是 57 对 55,Terminal-Bench 从 37% 跳到 43%。他还指出大家在低推理档位上观察到的「偷懒」——回答更短、更早停、迭代更少——有一部分是 harness 造成的,因为在原生 harness 里,agent 循环、上下文管理、工具、迭代和停止条件全都由 OpenAI 控制。他的结论该被钉在墙上:基准测试越来越是在测「模型 × harness」,而不只是模型。
#38
@Nitikshofficial
https://x.com/Nitikshofficial/status/2102564638952997172
描述了模型发布当天真实会发生的事,而这正是很多人差点甩锅给新权重的那些现象。大家把 token 暴涨和 CLAUDE.md 失灵怪到新模型头上,结果翻出来的是一个旧的 effort 默认值、一条过期的工具权限,或者一个语义已经变了的遗留 thinking 设置。他开的方子是:在把生产环境指向新版本之前做一次简短预检——把当前默认值导出来、重读迁移说明、开着 trace 重跑一条你熟悉的 agent 循环。他说发布周里投入产出比最高的帖子就是这种无聊的设置审计——考虑到本轮那个默认 effort 从 high 降到 medium 的变化,他说得没错。
https://x.com/Nitikshofficial/status/2102564638952997172
描述了模型发布当天真实会发生的事,而这正是很多人差点甩锅给新权重的那些现象。大家把 token 暴涨和 CLAUDE.md 失灵怪到新模型头上,结果翻出来的是一个旧的 effort 默认值、一条过期的工具权限,或者一个语义已经变了的遗留 thinking 设置。他开的方子是:在把生产环境指向新版本之前做一次简短预检——把当前默认值导出来、重读迁移说明、开着 trace 重跑一条你熟悉的 agent 循环。他说发布周里投入产出比最高的帖子就是这种无聊的设置审计——考虑到本轮那个默认 effort 从 high 降到 medium 的变化,他说得没错。
#39
@lzyzddhg
https://x.com/lzyzddhg/status/2102412194801709067
两句话就把关于 agent 循环的讨论切开了:瓶颈不是 agent 循环,是监督循环。试点项目死在验证上,因为凌晨三点没人能回答「它改了什么、改得对不对」。活下来的那些都是先上审计轨迹、再上自主性。这个顺序——审计先于自主——是本窗口里被最多人独立说出来的一条结构性论断,它同时出现在安全访谈、沙盒架构争论和托管 agent 的发布稿里。
https://x.com/lzyzddhg/status/2102412194801709067
两句话就把关于 agent 循环的讨论切开了:瓶颈不是 agent 循环,是监督循环。试点项目死在验证上,因为凌晨三点没人能回答「它改了什么、改得对不对」。活下来的那些都是先上审计轨迹、再上自主性。这个顺序——审计先于自主——是本窗口里被最多人独立说出来的一条结构性论断,它同时出现在安全访谈、沙盒架构争论和托管 agent 的发布稿里。
#40
@Its_clade
https://x.com/Its_clade/status/2102757691890245639
发布了这条流里最小可用的一张交易台:一个三 agent 循环,每个 agent 一条固定提示词。宏观解码器读 FOMC 纪要、美联储讲话和 CME FedWatch 概率,给鹰派/鸽派打 1 到 10 分,列出对 BTC、ETH、黄金和美元的三个二阶影响,并标出「市场已经定价的」和「仍属意外的」,只输出一张六行的表——他把这些分数存在一张持续更新的表里,就能看出 AI 的语气什么时候和价格背离。机会筛选器接着问:相对上面那个宏观分数,哪两个交易对错价最严重,并给出失效位。策略构建器把活下来的想法加上 90 天 4 小时 K 线喂进回测,其中有三条他从不跳过的规则:每个想法最多冒 1% 到 2% 的风险、必须有明确失效条件、如果资金费率已经在同方向极端就不做。他的立论才是重点:大多数人问「BTC 会怎么走」,他问的是「什么已经被定价了、意外在哪、我的失效位在哪」。
https://x.com/Its_clade/status/2102757691890245639
发布了这条流里最小可用的一张交易台:一个三 agent 循环,每个 agent 一条固定提示词。宏观解码器读 FOMC 纪要、美联储讲话和 CME FedWatch 概率,给鹰派/鸽派打 1 到 10 分,列出对 BTC、ETH、黄金和美元的三个二阶影响,并标出「市场已经定价的」和「仍属意外的」,只输出一张六行的表——他把这些分数存在一张持续更新的表里,就能看出 AI 的语气什么时候和价格背离。机会筛选器接着问:相对上面那个宏观分数,哪两个交易对错价最严重,并给出失效位。策略构建器把活下来的想法加上 90 天 4 小时 K 线喂进回测,其中有三条他从不跳过的规则:每个想法最多冒 1% 到 2% 的风险、必须有明确失效条件、如果资金费率已经在同方向极端就不做。他的立论才是重点:大多数人问「BTC 会怎么走」,他问的是「什么已经被定价了、意外在哪、我的失效位在哪」。
#41
@HarryTandy
https://x.com/HarryTandy/status/2102450981665493392
指出了一份 35 位 AI 研究者合写的 64 页图工程论文,被描述成一张地图:把一个乱糟糟的 agent 循环拆成显式任务、专职团队、检查点、恢复路径和验证。他建议的用法很实用,也和这里其他所有内容指向同一个方向:把这份 PDF 丢进 Claude Code 或 Codex,让它把你最长的那条工作流转成一张可以暂停、检查、恢复的图。
https://x.com/HarryTandy/status/2102450981665493392
指出了一份 35 位 AI 研究者合写的 64 页图工程论文,被描述成一张地图:把一个乱糟糟的 agent 循环拆成显式任务、专职团队、检查点、恢复路径和验证。他建议的用法很实用,也和这里其他所有内容指向同一个方向:把这份 PDF 丢进 Claude Code 或 Codex,让它把你最长的那条工作流转成一张可以暂停、检查、恢复的图。
#42
@anniewangtech
https://x.com/anniewangtech/status/2103157966577033412
把 harness 递归自我改进的五个方向列了出来,这是本窗口最干净的一份分类法:agent 循环(逐步逻辑与错误恢复)、工具使用(API 选择与参数格式化)、观察管理(过滤环境噪声)、上下文管理(长周期 token 的优化),以及任务完成检测——她的解释就一句:知道活什么时候算干完了。最后这一条,正是上面那位从开发者角度点出的同一个缺口。
https://x.com/anniewangtech/status/2103157966577033412
把 harness 递归自我改进的五个方向列了出来,这是本窗口最干净的一份分类法:agent 循环(逐步逻辑与错误恢复)、工具使用(API 选择与参数格式化)、观察管理(过滤环境噪声)、上下文管理(长周期 token 的优化),以及任务完成检测——她的解释就一句:知道活什么时候算干完了。最后这一条,正是上面那位从开发者角度点出的同一个缺口。
#43
@LatBenela
https://x.com/LatBenela/status/2102293991681363969
写了一篇长文,论证应该先做 harness 的自我改进而不是模型的自我改进。即使你把它挂靠的那个项目打折扣,这仍是这一批里结构最好的一篇思考。把同一个模型给两套系统,结果可能完全不像;模型外面那套操作系统就是 harness。2026 年 7 月发表的研究显示,几轮 harness 自我改进就能让低推理档位的 agent 反超同配置的最高推理档位——测试覆盖金融、机器人和制药领域的 30 项合成机器学习研究任务——同时把推理成本砍掉最多 60%;而且大部分收益来自更好的上下文管理和 agent 之间更干净的信息流,不是来自更长的思维链。他接着问的那个问题正是这个领域一直在躲的:一旦 agent 能改变自己的工作方式,是什么告诉它这次改动真的有用?他引了一篇综述了 1250 篇自我改进论文的调查,其中把「自我评估」单列成一类——正因为弱评估器会产生自我确认的循环并最终崩塌。
https://x.com/LatBenela/status/2102293991681363969
写了一篇长文,论证应该先做 harness 的自我改进而不是模型的自我改进。即使你把它挂靠的那个项目打折扣,这仍是这一批里结构最好的一篇思考。把同一个模型给两套系统,结果可能完全不像;模型外面那套操作系统就是 harness。2026 年 7 月发表的研究显示,几轮 harness 自我改进就能让低推理档位的 agent 反超同配置的最高推理档位——测试覆盖金融、机器人和制药领域的 30 项合成机器学习研究任务——同时把推理成本砍掉最多 60%;而且大部分收益来自更好的上下文管理和 agent 之间更干净的信息流,不是来自更长的思维链。他接着问的那个问题正是这个领域一直在躲的:一旦 agent 能改变自己的工作方式,是什么告诉它这次改动真的有用?他引了一篇综述了 1250 篇自我改进论文的调查,其中把「自我评估」单列成一类——正因为弱评估器会产生自我确认的循环并最终崩塌。
#44
@gigalester
https://x.com/gigalester/status/2102380440732516423
对「决策模型拆分到底是不是加了几步的函数调用」给出了最精确的诊断。今天所有 agent 循环都犯同一个错:让同一个模型既写计划、又决定走哪条分支。前者需要慢速的、审慎的推理;后者需要在高负载下每秒上千次地给出快速且校准过的是或否。他写的免责部分难得地诚实——基准是厂商自己跑的;它只在可能答案事先已知时才管用,所以它是路由器和守门员而不是推理器;而把你的审批逻辑绑在一个专有决策模型上,是一种新的、只是更安静的厂商锁定。结尾那句很到位:LLM 慢从来不是因为它笨,而是因为你在让它做决定,而你其实只需要它猜一下。
https://x.com/gigalester/status/2102380440732516423
对「决策模型拆分到底是不是加了几步的函数调用」给出了最精确的诊断。今天所有 agent 循环都犯同一个错:让同一个模型既写计划、又决定走哪条分支。前者需要慢速的、审慎的推理;后者需要在高负载下每秒上千次地给出快速且校准过的是或否。他写的免责部分难得地诚实——基准是厂商自己跑的;它只在可能答案事先已知时才管用,所以它是路由器和守门员而不是推理器;而把你的审批逻辑绑在一个专有决策模型上,是一种新的、只是更安静的厂商锁定。结尾那句很到位:LLM 慢从来不是因为它笨,而是因为你在让它做决定,而你其实只需要它猜一下。
#45
@DieHeartMansoor
https://x.com/DieHeartMansoor/status/2102334392198984184
回答了一个关于「agentic loop 里怎么做搜索」的问题,给的是诚实版:有几个选项,但没有一个干净。SerpAPI 或 ValueSERP 的 MCP 能拿到实时 SERP 数据;Brave Search MCP 有免费额度;Google Search Console API 是官方的但有两到三天延迟。原生的 Google Search CLI 不存在,他说这个缺口是真实的——尤其是在 agentic loop 里做实时排名追踪的场景。条目不大,但它点名了一个具体的基建空洞,而不是一种感觉。
https://x.com/DieHeartMansoor/status/2102334392198984184
回答了一个关于「agentic loop 里怎么做搜索」的问题,给的是诚实版:有几个选项,但没有一个干净。SerpAPI 或 ValueSERP 的 MCP 能拿到实时 SERP 数据;Brave Search MCP 有免费额度;Google Search Console API 是官方的但有两到三天延迟。原生的 Google Search CLI 不存在,他说这个缺口是真实的——尤其是在 agentic loop 里做实时排名追踪的场景。条目不大,但它点名了一个具体的基建空洞,而不是一种感觉。
#46
@premsaivarma_ch
https://x.com/premsaivarma_ch/status/2102989851192913973
就两句话,而且是对的两句:token 消耗的波动,在没有一个针对「被接受的 diff」的评估之前毫无意义;他会砍掉任何在一个冻结周期内打不过人类合并质量的编码 agent 循环。大多数人跳过的正是「冻结周期」这四个字——没有固定的对照期,任何声称的改进都只是在跟团队那周碰巧在做的事作比较。
https://x.com/premsaivarma_ch/status/2102989851192913973
就两句话,而且是对的两句:token 消耗的波动,在没有一个针对「被接受的 diff」的评估之前毫无意义;他会砍掉任何在一个冻结周期内打不过人类合并质量的编码 agent 循环。大多数人跳过的正是「冻结周期」这四个字——没有固定的对照期,任何声称的改进都只是在跟团队那周碰巧在做的事作比较。
#47
@FlexbuildWill
https://x.com/FlexbuildWill/status/2102533106934644828
给出了本轮唯一一条关于治理时机的建议:在你上线第一条 agent 循环的同一周,就把 agent 的写入权限管起来。生产密钥不要放在 agent 主机上,每一个特权工具都要有一条指名到人的审批路径,被拒绝的动作每天记录。他最后那句适合甩给所有打算「以后再加管控」的人——等到 agent 已经能把东西推上生产之后再谈治理,那不叫治理,那叫加了几页 PPT 的事故响应。
https://x.com/FlexbuildWill/status/2102533106934644828
给出了本轮唯一一条关于治理时机的建议:在你上线第一条 agent 循环的同一周,就把 agent 的写入权限管起来。生产密钥不要放在 agent 主机上,每一个特权工具都要有一条指名到人的审批路径,被拒绝的动作每天记录。他最后那句适合甩给所有打算「以后再加管控」的人——等到 agent 已经能把东西推上生产之后再谈治理,那不叫治理,那叫加了几页 PPT 的事故响应。
#48
@BugoTheCat
https://x.com/BugoTheCat/status/2103051589862801566
对那些「一发入魂」的演示提出了有根据的质疑:他怀疑这些一次成功的故事不可能没有水分,因为他现在自己发一条提示,拿回来的绝不是完整的东西;大多数干常规工作的人,光是解决某些问题就需要好几轮提示。他补的那句才是诚实所在——除非你有某种自动的 agent 循环加上 harness 之类的东西才行,而这恰恰就是演示视频和真实工作日之间的那道缝。
https://x.com/BugoTheCat/status/2103051589862801566
对那些「一发入魂」的演示提出了有根据的质疑:他怀疑这些一次成功的故事不可能没有水分,因为他现在自己发一条提示,拿回来的绝不是完整的东西;大多数干常规工作的人,光是解决某些问题就需要好几轮提示。他补的那句才是诚实所在——除非你有某种自动的 agent 循环加上 harness 之类的东西才行,而这恰恰就是演示视频和真实工作日之间的那道缝。
📡 生态产品雷达
生态产品雷达
Jev / TypeSafe 决策模型 —— 「循环里谁来做决定」这个问题的高频答案,出现在自我改进 agent、路由、验证和播客分段里
SoL-Pi —— NVIDIA、南洋理工和 MIT 的自我改进 harness,提出 152 条改动、活下来 4 条,被三个独立账号分别引用
OpenRSI-Index —— 新发布的递归自我改进开放基准,连完整 agent 轨迹一起公开
Claude Code —— 既是 OpenRSI 优化器发现实验里的被测 agent,也是三部短片渲染对比里的 agent 循环载体
Codex / GPT-6 —— 另一个被测 agent,同时是「基准测的是模型 × harness」这个论点的主角
MCP —— 这里描述的每一个循环的连接层,从 Playwright、可观测性到搜索和 Google Home
托管 agent 运行时 —— DigitalOcean Managed Agents、Google AX、Cloudflare Worker Previews 和 GitLab Flow Registry 同一周齐发
Autoresearch 作为 GPU 平台 —— sfcompute 改名后的形态,现在可以在编码工作流里直接创建节点、跑容器、再把它关掉
Jev / TypeSafe 决策模型 —— 「循环里谁来做决定」这个问题的高频答案,出现在自我改进 agent、路由、验证和播客分段里
SoL-Pi —— NVIDIA、南洋理工和 MIT 的自我改进 harness,提出 152 条改动、活下来 4 条,被三个独立账号分别引用
OpenRSI-Index —— 新发布的递归自我改进开放基准,连完整 agent 轨迹一起公开
Claude Code —— 既是 OpenRSI 优化器发现实验里的被测 agent,也是三部短片渲染对比里的 agent 循环载体
Codex / GPT-6 —— 另一个被测 agent,同时是「基准测的是模型 × harness」这个论点的主角
MCP —— 这里描述的每一个循环的连接层,从 Playwright、可观测性到搜索和 Google Home
托管 agent 运行时 —— DigitalOcean Managed Agents、Google AX、Cloudflare Worker Previews 和 GitLab Flow Registry 同一周齐发
Autoresearch 作为 GPU 平台 —— sfcompute 改名后的形态,现在可以在编码工作流里直接创建节点、跑容器、再把它关掉
评论