Loop 日报: 2026-09-18
本轮有两个结果都在一根权重都没碰的前提下改进了循环,而它和其他所有东西的对比才是重点。Google 的 Dream-RSI 把模型完全冻住,只递归改进搜索,把记录下来的发现历史当成便宜的模拟器回放,算力调用少了 162 倍。Salesforce 的 DarwinX 不重训任何模型,只进化提示词、工具和工作流这一层,把 agent 任务完成率从 43.5% 拉到 93%。与此同时,一场开放的 autoresearch 竞赛在 24 小时内把一笔抗量子比特币交易的成本砍掉 4 倍,而一个自主研究 agent 自己挑了目标,在一份已获批准的 Solana 提案上线之前找出了签名验证的漏洞。失效模式也被同样精确地点了名:周一写下的一条发现到周五读起来还像圣经;一个循环知道自己在绕圈却从来没说;而这个领域的激励结构,现在正在悄悄奖励那些让结果更好看的评测错误。
#1
@hyperparticle
https://x.com/hyperparticle/status/2099861544481731058
把一群 agent 放出去打 Karpathy 的 NanoChat 基准,三天就把 SoTA 干掉了。值得抄的是机制:他们在图数据库上自建了一套 harness,让这群 agent 做 auto-autoresearch——每一轮迭代学到的不只是任务本身,还有下一轮该怎么做研究。这个团队往图里写了超过 15000 条记录。
https://x.com/hyperparticle/status/2099861544481731058
把一群 agent 放出去打 Karpathy 的 NanoChat 基准,三天就把 SoTA 干掉了。值得抄的是机制:他们在图数据库上自建了一套 harness,让这群 agent 做 auto-autoresearch——每一轮迭代学到的不只是任务本身,还有下一轮该怎么做研究。这个团队往图里写了超过 15000 条记录。
#2
@thtbee_
https://x.com/thtbee_/status/2100205546146247066
对 Google Dream-RSI 读得最仔细的一条,而且纠正了别人跑出来的标题。模型是完全冻结的,权重一点没动。递归改进的是 agent 怎么探索:它把过去的发现记进一棵树,再把这棵树变成一个回放模拟器,在自己的历史上零成本地梦出成千上万种搜索策略,挑最好的那个部署出去,更丰富的历史又喂出更好的模拟器。不是 AI 变聪明了,是 AI 变得更会搜了,而且算力调用少了 162 倍。
https://x.com/thtbee_/status/2100205546146247066
对 Google Dream-RSI 读得最仔细的一条,而且纠正了别人跑出来的标题。模型是完全冻结的,权重一点没动。递归改进的是 agent 怎么探索:它把过去的发现记进一棵树,再把这棵树变成一个回放模拟器,在自己的历史上零成本地梦出成千上万种搜索策略,挑最好的那个部署出去,更丰富的历史又喂出更好的模拟器。不是 AI 变聪明了,是 AI 变得更会搜了,而且算力调用少了 162 倍。
#3
@papersdatacode
https://x.com/papersdatacode/status/2100285341324152897
Dream-RSI 的纯数字版:Lasso 上 agent 调用比 SimpleTES 少最多 162 倍,数学优化在 1000 代以内省下 50 倍以上预算,KernelBench 上同等预算下 kernel 性能最多好 2.09 倍。底下的主张是:记录下来的发现历史可以当成一个便宜的模拟器,用来改进长程探索策略,不必反复做线上 rollout。
https://x.com/papersdatacode/status/2100285341324152897
Dream-RSI 的纯数字版:Lasso 上 agent 调用比 SimpleTES 少最多 162 倍,数学优化在 1000 代以内省下 50 倍以上预算,KernelBench 上同等预算下 kernel 性能最多好 2.09 倍。底下的主张是:记录下来的发现历史可以当成一个便宜的模拟器,用来改进长程探索策略,不必反复做线上 rollout。
#4
@juanmackie
https://x.com/juanmackie/status/2100486203489570988
他点出了自己试过的每一个 autoresearch 循环的共同毛病:它永远不会在怎么搜这件事上变聪明,所以第 40 轮和第 1 轮一样笨。他把 Dream-RSI 那篇论文移植成了 pi 的扩展,探索策略是从真正管用的东西里重写出来的代码。一篇论文几天之内就变成可安装的扩展,本身就说明这个领域现在跑得多快。
https://x.com/juanmackie/status/2100486203489570988
他点出了自己试过的每一个 autoresearch 循环的共同毛病:它永远不会在怎么搜这件事上变聪明,所以第 40 轮和第 1 轮一样笨。他把 Dream-RSI 那篇论文移植成了 pi 的扩展,探索策略是从真正管用的东西里重写出来的代码。一篇论文几天之内就变成可安装的扩展,本身就说明这个领域现在跑得多快。
#5
@hackhackai
https://x.com/hackhackai/status/2100596940580790652
他们的 autoresearch agent 在 Solana 的 SIMD-0376 激活之前揪出了一个关键边界情况:按提案的 ZIP-215 规则,一个 64 字节全零签名配上全零公钥,可以对任何消息通过验证。而在 Solana 上那个全零公钥就是 System Program ID,被大量当成无权限或不可变的哨兵值,程序把权限设为零就是假定没人能替它签名。他们找到了 433 个可变元数据账户的更新权限正好设成了这个值。激活前上报,修复已备好。
https://x.com/hackhackai/status/2100596940580790652
他们的 autoresearch agent 在 Solana 的 SIMD-0376 激活之前揪出了一个关键边界情况:按提案的 ZIP-215 规则,一个 64 字节全零签名配上全零公钥,可以对任何消息通过验证。而在 Solana 上那个全零公钥就是 System Program ID,被大量当成无权限或不可变的哨兵值,程序把权限设为零就是假定没人能替它签名。他们找到了 433 个可变元数据账户的更新权限正好设成了这个值。激活前上报,修复已备好。
#6
@r0bre
https://x.com/r0bre/status/2100598730231549998
让这次 Solana 发现真正有分量的细节:autoresearch agent 是自己挑的目标,自己去研究,自己找出了问题,除了一开始笼统的研究指令之外没有任何输入。不是人指着一份提案说你来审一下,而是 agent 自己决定去看什么。协议团队很快确认并修复。
https://x.com/r0bre/status/2100598730231549998
让这次 Solana 发现真正有分量的细节:autoresearch agent 是自己挑的目标,自己去研究,自己找出了问题,除了一开始笼统的研究指令之外没有任何输入。不是人指着一份提案说你来审一下,而是 agent 自己决定去看什么。协议团队很快确认并修复。
#7
@StarkWareLtd
https://x.com/StarkWareLtd/status/2100239431764705353
他们那笔抗量子比特币交易花了大约 320 美元的 GPU 算力,于是他们把这个成本变成了一场公开的 autoresearch 挑战赛,两万多美元奖金征集代码改进。当目标真的可验证时,竞赛型 autoresearch 就长这样:一个数字,所有人的 agent 全指着它。
https://x.com/StarkWareLtd/status/2100239431764705353
他们那笔抗量子比特币交易花了大约 320 美元的 GPU 算力,于是他们把这个成本变成了一场公开的 autoresearch 挑战赛,两万多美元奖金征集代码改进。当目标真的可验证时,竞赛型 autoresearch 就长这样:一个数字,所有人的 agent 全指着它。
#8
@StarkWareLtd
https://x.com/StarkWareLtd/status/2100627827443855871
挑战赛开放一天之后,成本已经降了 4 倍,从 320 美元到 76 美元。最初那笔主网交易用掉了约 100 块 GPU、3100 GPU 小时。在一份刻意未优化的 CUDA 种子代码上,24 小时内做到 4 倍提升,是迄今为止关于一群开放的编码 agent 能对一个良定义优化问题做什么的最清楚的公开测量。
https://x.com/StarkWareLtd/status/2100627827443855871
挑战赛开放一天之后,成本已经降了 4 倍,从 320 美元到 76 美元。最初那笔主网交易用掉了约 100 块 GPU、3100 GPU 小时。在一份刻意未优化的 CUDA 种子代码上,24 小时内做到 4 倍提升,是迄今为止关于一群开放的编码 agent 能对一个良定义优化问题做什么的最清楚的公开测量。
#9
@AbdelStark
https://x.com/AbdelStark/status/2100240920146763871
比起奖金,这场挑战的赛制更值得研究。两类 GPU 暴力计算被拆成两个独立赛道,每个候选都是一次 ECDSA 公钥恢复加一次 SHA-256 哈希,重复几十亿次。排名跑分在托管的 RTX 4090 沙箱里执行,题目实例是在你的代码锁定之后才生成的,而且每一次命中都要在 CPU 上重算一遍,没做真正的椭圆曲线运算的 kernel 拿不到吞吐量积分。想上榜首,必须比当前最好成绩再快至少 1%。这是一份由预期自己会被钻空子的人设计的基准。
https://x.com/AbdelStark/status/2100240920146763871
比起奖金,这场挑战的赛制更值得研究。两类 GPU 暴力计算被拆成两个独立赛道,每个候选都是一次 ECDSA 公钥恢复加一次 SHA-256 哈希,重复几十亿次。排名跑分在托管的 RTX 4090 沙箱里执行,题目实例是在你的代码锁定之后才生成的,而且每一次命中都要在 CPU 上重算一遍,没做真正的椭圆曲线运算的 kernel 拿不到吞吐量积分。想上榜首,必须比当前最好成绩再快至少 1%。这是一份由预期自己会被钻空子的人设计的基准。
#10
@akashneelesh
https://x.com/akashneelesh/status/2100239659510972662
他给这场 autoresearch 挑战赛的预测押了个数:每笔低于 100 美元,否则就剃头。把可证伪的公开预测挂在一场开放优化竞赛上,是被严重低估的推进机制。
https://x.com/akashneelesh/status/2100239659510972662
他给这场 autoresearch 挑战赛的预测押了个数:每笔低于 100 美元,否则就剃头。把可证伪的公开预测挂在一场开放优化竞赛上,是被严重低估的推进机制。
#11
@adiiHQ
https://x.com/adiiHQ/status/2100239860036755565
让整场挑战真正有意思的那句框架:现在任何人只要有一个 agent,就能在不是自己专业的领域里攻一个前沿问题并赢钱。以前的门槛是攻这个问题需要的密码学知识,现在的门槛变成了你的 harness 能不能做硬核 CUDA 优化。
https://x.com/adiiHQ/status/2100239860036755565
让整场挑战真正有意思的那句框架:现在任何人只要有一个 agent,就能在不是自己专业的领域里攻一个前沿问题并赢钱。以前的门槛是攻这个问题需要的密码学知识,现在的门槛变成了你的 harness 能不能做硬核 CUDA 优化。
#12
@cyrusasg
https://x.com/cyrusasg/status/2099899773251956777
他认为推理服务是 autoresearch 最干净的目标之一,而所有人都盯着 kernel 生成,瞄得太窄了。理由是结构性的:这是一个带可验证目标的约束优化——守住延迟和质量 SLA,最大化吞吐——而并行策略、批处理策略、缓存配置、投机解码模型选择、路由和 kernel 全都在同一个搜索空间里。而且它高度依赖具体负载,这恰恰是搜索能赢过人的场景。
https://x.com/cyrusasg/status/2099899773251956777
他认为推理服务是 autoresearch 最干净的目标之一,而所有人都盯着 kernel 生成,瞄得太窄了。理由是结构性的:这是一个带可验证目标的约束优化——守住延迟和质量 SLA,最大化吞吐——而并行策略、批处理策略、缓存配置、投机解码模型选择、路由和 kernel 全都在同一个搜索空间里。而且它高度依赖具体负载,这恰恰是搜索能赢过人的场景。
#13
@VarunGangal
https://x.com/VarunGangal/status/2099971923560292826
他指出 VibeServe 就是把 autoresearch 用在推理服务上的一个现成例子。用来对照一下这里有多少东西已经在跑、多少还只是提案,很有用。
https://x.com/VarunGangal/status/2099971923560292826
他指出 VibeServe 就是把 autoresearch 用在推理服务上的一个现成例子。用来对照一下这里有多少东西已经在跑、多少还只是提案,很有用。
#14
@Jiacheng_Miao
https://x.com/Jiacheng_Miao/status/2100296661427999222
Paper2Agent 发在了 Nature:一个多 agent 框架,把论文的正文、代码、数据和补充材料变成任何 agent 都能调用的 MCP 服务,内含自动测试和在 agentic loop 里的迭代精修。论文由此变成可以追问的虚拟作者,而从不同论文构建出来的 agent 互相协作,提出了一种跨扰动数据集整合证据的新方法,并锁定了银屑病的一个可能致病基因。他们的 agent 打赢了直接读同样 PDF 和代码仓库的 Claude Code。
https://x.com/Jiacheng_Miao/status/2100296661427999222
Paper2Agent 发在了 Nature:一个多 agent 框架,把论文的正文、代码、数据和补充材料变成任何 agent 都能调用的 MCP 服务,内含自动测试和在 agentic loop 里的迭代精修。论文由此变成可以追问的虚拟作者,而从不同论文构建出来的 agent 互相协作,提出了一种跨扰动数据集整合证据的新方法,并锁定了银屑病的一个可能致病基因。他们的 agent 打赢了直接读同样 PDF 和代码仓库的 Claude Code。
#15
@creus_roger
https://x.com/creus_roger/status/2100080651214971017
Astra 玩 NetHack,得分 48978、BALROG 进度 49.4%、最深到第 17 层——重要的前提他自己一开头就写了:这是十局里挑出来的最好一局,而且 Astra 被允许修改自己玩游戏的 harness。没有特权信息,但它自己写了通往已访问地标的寻路,还有记录已观测实体的追踪器,把底层推理外包出去,同时仍然对每一步决策负责。他的观点是:能自主造出摊薄控制成本的工具、再在上下文里解读这些工具的输出,等于白送你一套层级结构。
https://x.com/creus_roger/status/2100080651214971017
Astra 玩 NetHack,得分 48978、BALROG 进度 49.4%、最深到第 17 层——重要的前提他自己一开头就写了:这是十局里挑出来的最好一局,而且 Astra 被允许修改自己玩游戏的 harness。没有特权信息,但它自己写了通往已访问地标的寻路,还有记录已观测实体的追踪器,把底层推理外包出去,同时仍然对每一步决策负责。他的观点是:能自主造出摊薄控制成本的工具、再在上下文里解读这些工具的输出,等于白送你一套层级结构。
#16
@ZhihuFrontier
https://x.com/ZhihuFrontier/status/2100487920427971027
关于大家嘴里的自进化 AI,目前最清楚的一份分类,而且结论是这里面大部分还不算递归自我改进。三个阶段:人在环内批准改动、人在环上监督部署而数据和奖励已自动化、以及真正闭环。大多数系统卡在第二阶段。被点名的瓶颈是可靠的验证,因为生成器和验证器如果共享同一种偏差,错误会被放大;而开放式 agent 工作需要的验证器要判断的不只是对错,还有新颖性、有用性和研究品味。如果策略和评估者一起进化,谁来保证两边都还贴着现实?
https://x.com/ZhihuFrontier/status/2100487920427971027
关于大家嘴里的自进化 AI,目前最清楚的一份分类,而且结论是这里面大部分还不算递归自我改进。三个阶段:人在环内批准改动、人在环上监督部署而数据和奖励已自动化、以及真正闭环。大多数系统卡在第二阶段。被点名的瓶颈是可靠的验证,因为生成器和验证器如果共享同一种偏差,错误会被放大;而开放式 agent 工作需要的验证器要判断的不只是对错,还有新颖性、有用性和研究品味。如果策略和评估者一起进化,谁来保证两边都还贴着现实?
#17
@StragglerLiu
https://x.com/StragglerLiu/status/2100551950181847228
他把递归自我改进重新框成两个反馈回路之间的速率差,而不是一条单点加速的曲线。执行回路以小时计:数据质量审查三年之内从一屋子人逐行找问题,变成 agent 做得好一百倍、人只做抽查。方向回路仍然以月计,因为研究品味要按季度才验证得出来,模型没在这个尺度上被训练过——模型能很快优化掉他博士期间写的算法,却提不出一个比所有人都更好的新算法。从 AI 辅助研究到 AI 自主研究的距离,是由慢的那个回路决定的,不是快的那个。
https://x.com/StragglerLiu/status/2100551950181847228
他把递归自我改进重新框成两个反馈回路之间的速率差,而不是一条单点加速的曲线。执行回路以小时计:数据质量审查三年之内从一屋子人逐行找问题,变成 agent 做得好一百倍、人只做抽查。方向回路仍然以月计,因为研究品味要按季度才验证得出来,模型没在这个尺度上被训练过——模型能很快优化掉他博士期间写的算法,却提不出一个比所有人都更好的新算法。从 AI 辅助研究到 AI 自主研究的距离,是由慢的那个回路决定的,不是快的那个。
#18
@omarsar0
https://x.com/omarsar0/status/2100362936057561114
读完一次大规模 subagent 运行之后,他拎出两个值得起名字的技术:自进化技能,也就是把教训和经验编码回 harness 里;以及复利式工程。他的保留意见很诚实——这次跑用了大约 1400 个 subagent、省下了惊人的成本,但少用一些是不是也能做到?他还明说在一个 harness 里管用的东西未必能迁移,这就是他主张做定制 harness 而不是用通用编码 harness 的理由。
https://x.com/omarsar0/status/2100362936057561114
读完一次大规模 subagent 运行之后,他拎出两个值得起名字的技术:自进化技能,也就是把教训和经验编码回 harness 里;以及复利式工程。他的保留意见很诚实——这次跑用了大约 1400 个 subagent、省下了惊人的成本,但少用一些是不是也能做到?他还明说在一个 harness 里管用的东西未必能迁移,这就是他主张做定制 harness 而不是用通用编码 harness 的理由。
#19
@DmitroCP
https://x.com/DmitroCP/status/2100577327008866734
他把一位 Anthropic 工程师停止推销 SDK、开始解释大多数 agent 为什么造错了的那十五分钟剪了出来。核心论点:一个 agent loop 是三部分——收集上下文、采取行动、验证结果——而几乎所有人只造了两部分。他的调试方法不是加评测也不是改提示词,而是每跑一次就把整份 transcript 从头读完,问它在干什么、为什么。工具的取舍也摊开讲了:tools 可靠但吃上下文且不可组合,bash 可组合、上下文开销低但需要探索时间,代码生成动态灵活但需要 lint 和精心设计的 API。还有最扎心的一句:每六个月把你的 agent 代码重写一遍,因为你把一些已经悄悄不成立的假设焊进去了。
https://x.com/DmitroCP/status/2100577327008866734
他把一位 Anthropic 工程师停止推销 SDK、开始解释大多数 agent 为什么造错了的那十五分钟剪了出来。核心论点:一个 agent loop 是三部分——收集上下文、采取行动、验证结果——而几乎所有人只造了两部分。他的调试方法不是加评测也不是改提示词,而是每跑一次就把整份 transcript 从头读完,问它在干什么、为什么。工具的取舍也摊开讲了:tools 可靠但吃上下文且不可组合,bash 可组合、上下文开销低但需要探索时间,代码生成动态灵活但需要 lint 和精心设计的 API。还有最扎心的一句:每六个月把你的 agent 代码重写一遍,因为你把一些已经悄悄不成立的假设焊进去了。
#20
@NewsTongueX
https://x.com/NewsTongueX/status/2100245617255514224
Salesforce 的 DarwinX 在完全不重训模型的前提下,把 agent 任务完成率从 43.5% 提到 93%,靠的是进化提示词、工具和工作流这一层。它瞄准的两种失效模式被点得很准:路径依赖,早期的编辑把次优策略锁死;以及跨任务干扰,修好一个任务却弄坏别的。报告的提升是 WebArena-Infinity 上 49.5 个百分点、SWE-bench Verified 上 3.4 个百分点。
https://x.com/NewsTongueX/status/2100245617255514224
Salesforce 的 DarwinX 在完全不重训模型的前提下,把 agent 任务完成率从 43.5% 提到 93%,靠的是进化提示词、工具和工作流这一层。它瞄准的两种失效模式被点得很准:路径依赖,早期的编辑把次优策略锁死;以及跨任务干扰,修好一个任务却弄坏别的。报告的提升是 WebArena-Infinity 上 49.5 个百分点、SWE-bench Verified 上 3.4 个百分点。
#21
@MTSlive
https://x.com/MTSlive/status/2100319418895286607
Salesforce 的 AI 负责人给了自我改进 agent 的三个旋钮——更好的上下文、更好的工具调用、更好的模型权重——以及三者共同的前提:海量的、已解决和未解决任务的执行轨迹。他关于一个成熟企业 agent 单次任务实际动作的观察——五到十次上下文调用把自己锚定,再四到五次工具调用把活干完——正说明了为什么轨迹必须记下的远不止最终答案。
https://x.com/MTSlive/status/2100319418895286607
Salesforce 的 AI 负责人给了自我改进 agent 的三个旋钮——更好的上下文、更好的工具调用、更好的模型权重——以及三者共同的前提:海量的、已解决和未解决任务的执行轨迹。他关于一个成熟企业 agent 单次任务实际动作的观察——五到十次上下文调用把自己锚定,再四到五次工具调用把活干完——正说明了为什么轨迹必须记下的远不止最终答案。
#22
@spenserskates
https://x.com/spenserskates/status/2100260619438178682
他公布了一套自我改进产品引擎跑在自家产品上的真实数字。围绕连接器重做 AI 反馈的配置页,新客户完成至少一个数据源连接的比例从 5% 涨到 69%。把哪些连接器需要管理员权限提前说清楚,配置成功转化提升 34%,配置耗时减少一分钟。把开发者引导到 HTTP API 这条推荐路径,首次事件转化从 17% 到 25%。把循环对准新手引导漏斗而不是代码,是一个被探索得很少的方向。
https://x.com/spenserskates/status/2100260619438178682
他公布了一套自我改进产品引擎跑在自家产品上的真实数字。围绕连接器重做 AI 反馈的配置页,新客户完成至少一个数据源连接的比例从 5% 涨到 69%。把哪些连接器需要管理员权限提前说清楚,配置成功转化提升 34%,配置耗时减少一分钟。把开发者引导到 HTTP API 这条推荐路径,首次事件转化从 17% 到 25%。把循环对准新手引导漏斗而不是代码,是一个被探索得很少的方向。
#23
@sarahookr
https://x.com/sarahookr/status/2099844681530012084
上线了一个 API:你描述想要什么数据集,它返回一份多样、高质量的训练数据集,条款上不禁止你拿去训练。她的卖点明确指向 autoresearch agent——现在循环可以把生成自己的训练数据当成一次工具调用,而不是一个研究项目。
https://x.com/sarahookr/status/2099844681530012084
上线了一个 API:你描述想要什么数据集,它返回一份多样、高质量的训练数据集,条款上不禁止你拿去训练。她的卖点明确指向 autoresearch agent——现在循环可以把生成自己的训练数据当成一次工具调用,而不是一个研究项目。
#24
@LFrefman
https://x.com/LFrefman/status/2099897972658233814
OpenResearch 是一个本地优先的工作区,把 Claude Code、Codex、OpenCode 或 Cursor 变成研究 agent。有意思的是那些设计决定:本地 SQLite,项目和运行记录不出本机;并行 agent 各自拿独立会话,跑在隔离的 git worktree 里,配不可变归档,所以变体可复现;autoresearch 模式提出想法、改代码、跑实验,再看日志、diff 和产物决定下一步。同一个 commit 可以在本地、通过 SSH,或者在 Slurm、K8s、Ray、Modal 上跑,而不用公开仓库。
https://x.com/LFrefman/status/2099897972658233814
OpenResearch 是一个本地优先的工作区,把 Claude Code、Codex、OpenCode 或 Cursor 变成研究 agent。有意思的是那些设计决定:本地 SQLite,项目和运行记录不出本机;并行 agent 各自拿独立会话,跑在隔离的 git worktree 里,配不可变归档,所以变体可复现;autoresearch 模式提出想法、改代码、跑实验,再看日志、diff 和产物决定下一步。同一个 commit 可以在本地、通过 SSH,或者在 Slurm、K8s、Ray、Modal 上跑,而不用公开仓库。
#25
@CoreyGallon
https://x.com/CoreyGallon/status/2099976426577355199
本轮最好的一份生产环境 agent 演讲总结,来自马士基。核心概念叫部落地牢:那些真实存在、已经被证明跑起来是安全的操作知识,却被困在 agent 执行不了的形态里。传统 SOP 是一个人点击动作的截图;agent 的 SOP 需要前置条件、决策点、标识符、后端调用、校验、恢复和执行成功的证据,而大部分工作就是在两者之间做翻译。生产里跑着 200 多个实例,SOP 语料库的体量大约是运行时本身的 20 倍,九个月记录了十万多条纠正,而延迟主要由它们依赖的遗留系统决定而不是 agent loop。他们干脆跳过 MCP 服务,直接用函数调用写工具,这样才能控制和验证 agent 到底在干什么。
https://x.com/CoreyGallon/status/2099976426577355199
本轮最好的一份生产环境 agent 演讲总结,来自马士基。核心概念叫部落地牢:那些真实存在、已经被证明跑起来是安全的操作知识,却被困在 agent 执行不了的形态里。传统 SOP 是一个人点击动作的截图;agent 的 SOP 需要前置条件、决策点、标识符、后端调用、校验、恢复和执行成功的证据,而大部分工作就是在两者之间做翻译。生产里跑着 200 多个实例,SOP 语料库的体量大约是运行时本身的 20 倍,九个月记录了十万多条纠正,而延迟主要由它们依赖的遗留系统决定而不是 agent loop。他们干脆跳过 MCP 服务,直接用函数调用写工具,这样才能控制和验证 agent 到底在干什么。
#26
@WhiteNightNiki
https://x.com/WhiteNightNiki/status/2099933976689266766
agentic loop 和人驱动的循环之间,有一个没人提前规划的差别:出网的默认策略。agentic loop 没有临时申请额外权限这种奢侈,否则它就变成一个过度工程化的 human-in-the-loop 系统,所以升级路径必须提前设计,而且升级应该罕见到一百次运行里才出现一次。没有严格的出网控制,最好的情况是结果方差很大,因为每次会话从一个不断变异的互联网拿到的输入都不一样;最坏的情况是一群拥有特权访问、并且对你的基础设施有内在理解的 agent 把东西泄出去。
https://x.com/WhiteNightNiki/status/2099933976689266766
agentic loop 和人驱动的循环之间,有一个没人提前规划的差别:出网的默认策略。agentic loop 没有临时申请额外权限这种奢侈,否则它就变成一个过度工程化的 human-in-the-loop 系统,所以升级路径必须提前设计,而且升级应该罕见到一百次运行里才出现一次。没有严格的出网控制,最好的情况是结果方差很大,因为每次会话从一个不断变异的互联网拿到的输入都不一样;最坏的情况是一群拥有特权访问、并且对你的基础设施有内在理解的 agent 把东西泄出去。
#27
@synorb
https://x.com/synorb/status/2099962542466666915
本轮为 auto-research agent 点名的最具体的失效模式:agent 周一把一条发现写进记忆,到周五来源已经变了,而那条记忆读起来还像圣经。harness 尽到了本分,数据没有。他的提议是记忆应该自带过期信息——什么时候写的、来自哪里——这样 agent 会去复核而不是直接信。
https://x.com/synorb/status/2099962542466666915
本轮为 auto-research agent 点名的最具体的失效模式:agent 周一把一条发现写进记忆,到周五来源已经变了,而那条记忆读起来还像圣经。harness 尽到了本分,数据没有。他的提议是记忆应该自带过期信息——什么时候写的、来自哪里——这样 agent 会去复核而不是直接信。
#28
@_ScottCondron
https://x.com/_ScottCondron/status/2099875921788354754
他认为这就是 auto-research agent 一直没真正立住的原因,并且点到了具体的接缝:记忆和 harness 必须紧耦合,而现实中大多没有。帖子很短,但和周一圣经周五过期那个问题、以及马士基语料库是运行时 20 倍那件事,完全对得上。
https://x.com/_ScottCondron/status/2099875921788354754
他认为这就是 auto-research agent 一直没真正立住的原因,并且点到了具体的接缝:记忆和 harness 必须紧耦合,而现实中大多没有。帖子很短,但和周一圣经周五过期那个问题、以及马士基语料库是运行时 20 倍那件事,完全对得上。
#29
@realbarnakiss
https://x.com/realbarnakiss/status/2099896566064541704
他更新了 zk-autoresearch 的 README,现在可以说自己给 Lean Ethereum 路线图贡献了 45% 的证明时间削减,这是在拿到以太坊基金会给 LeanVM 和 Plonky3 的资助之后做出来的。autoresearch 对准证明系统反复产出这个量级的数字,是因为目标可以被精确测量。
https://x.com/realbarnakiss/status/2099896566064541704
他更新了 zk-autoresearch 的 README,现在可以说自己给 Lean Ethereum 路线图贡献了 45% 的证明时间削减,这是在拿到以太坊基金会给 LeanVM 和 Plonky3 的资助之后做出来的。autoresearch 对准证明系统反复产出这个量级的数字,是因为目标可以被精确测量。
#30
@LeeLeepenkman
https://x.com/LeeLeepenkman/status/2100536487490322698
两周时间,靠 autoresearch 把 GLM 的推理速度提到三倍以上。这类成果集中在推理和 kernel 上不是因为赶时髦,而是因为这里的奖励函数是一块秒表。
https://x.com/LeeLeepenkman/status/2100536487490322698
两周时间,靠 autoresearch 把 GLM 的推理速度提到三倍以上。这类成果集中在推理和 kernel 上不是因为赶时髦,而是因为这里的奖励函数是一块秒表。
#31
@CognosR
https://x.com/CognosR/status/2100489128404046157
他的副业项目 mac-stats 用 Karpathy 的 autoresearch 一夜之间自己改进了,现在能看到每个线程的 GPU 占用。不华丽的那种过夜循环——一个个人工具在作者睡觉时长出了一个真实功能——大概才是这件事最常见的形态。
https://x.com/CognosR/status/2100489128404046157
他的副业项目 mac-stats 用 Karpathy 的 autoresearch 一夜之间自己改进了,现在能看到每个线程的 GPU 占用。不华丽的那种过夜循环——一个个人工具在作者睡觉时长出了一个真实功能——大概才是这件事最常见的形态。
#32
@pwnies
https://x.com/pwnies/status/2100303752809091319
Union Alpha 在 OpenRouter 上免费,于是他的网站提速工具现在通过它提供免费的 autoresearch 循环。一条 npx 命令,指向一个网址,在这个推广窗口期内循环免费帮你优化。免费的前沿级推理,会把每一个优化循环在窗口期内都变成大路货。
https://x.com/pwnies/status/2100303752809091319
Union Alpha 在 OpenRouter 上免费,于是他的网站提速工具现在通过它提供免费的 autoresearch 循环。一条 npx 命令,指向一个网址,在这个推广窗口期内循环免费帮你优化。免费的前沿级推理,会把每一个优化循环在窗口期内都变成大路货。
#33
@0rdlibrary
https://x.com/0rdlibrary/status/2099864945840046502
发布了第一套 Solana AI 模型工具包,还放出了他自己 fork 的 Karpathy autoresearch,专门针对区块链和金融模型以及 AI harness,并且包含用 Solana 全历史交易做的微调。通用 autoresearch 循环的垂直分叉,就是它扩散的方式。
https://x.com/0rdlibrary/status/2099864945840046502
发布了第一套 Solana AI 模型工具包,还放出了他自己 fork 的 Karpathy autoresearch,专门针对区块链和金融模型以及 AI harness,并且包含用 Solana 全历史交易做的微调。通用 autoresearch 循环的垂直分叉,就是它扩散的方式。
#34
@lukehollis
https://x.com/lukehollis/status/2100224949759738332
SceneAgent 把 3D 采集变成可仿真的场景,用于机器人策略训练:处理高斯泼溅、为每个高斯推断语义特征、分割物体并补全背景、为每个物体烘焙刚性摩擦密度这类预测性物理材质、把物体拆成零件并让可动部分具备关节,最后生成几何、纹理、物理属性和关节都不同的变体。接上 autoresearch 工具之后,它主张要解决的是机器人训练和评估里最耗时的数据问题。
https://x.com/lukehollis/status/2100224949759738332
SceneAgent 把 3D 采集变成可仿真的场景,用于机器人策略训练:处理高斯泼溅、为每个高斯推断语义特征、分割物体并补全背景、为每个物体烘焙刚性摩擦密度这类预测性物理材质、把物体拆成零件并让可动部分具备关节,最后生成几何、纹理、物理属性和关节都不同的变体。接上 autoresearch 工具之后,它主张要解决的是机器人训练和评估里最耗时的数据问题。
#35
@braincramps
https://x.com/braincramps/status/2100482515140067741
Agora 把 Git 当成集体 autoresearch 的共享记忆:agent 把工作记成一个只追加的 DAG,每一条主张都是一次 commit,任何人都能 checkout 重跑。它针对的问题是多个 agent 并行时的重复搜索,而这正是蜂群方案里没人算进预算的协调税。
https://x.com/braincramps/status/2100482515140067741
Agora 把 Git 当成集体 autoresearch 的共享记忆:agent 把工作记成一个只追加的 DAG,每一条主张都是一次 commit,任何人都能 checkout 重跑。它针对的问题是多个 agent 并行时的重复搜索,而这正是蜂群方案里没人算进预算的协调税。
#36
@AkSondeak52572
https://x.com/AkSondeak52572/status/2100141342709924216
一个把 Jev 当作唯一决策层、完全不做生成的 autoresearch 循环。它给论文按相关性、方法和新颖性打分,把每一条主张对照原文片段核验,然后选择图上的边和下一步动作——抓取、扩展、升级还是收敛——而检索和图由代码掌管。把生成彻底移出循环、只留下带类型的决策,是一种确实不同的架构。
https://x.com/AkSondeak52572/status/2100141342709924216
一个把 Jev 当作唯一决策层、完全不做生成的 autoresearch 循环。它给论文按相关性、方法和新颖性打分,把每一条主张对照原文片段核验,然后选择图上的边和下一步动作——抓取、扩展、升级还是收敛——而检索和图由代码掌管。把生成彻底移出循环、只留下带类型的决策,是一种确实不同的架构。
#37
@mdlahfir
https://x.com/mdlahfir/status/2100390804888142007
关于带类型决策的模型该放在哪里,这是最清楚的解释:Jev 不是一个 agentic loop,它是一个决策点。它回答该点哪个元素,而不是点完之后出现了这个结果、接下来试什么——后者仍然是 agent 的活。只用 Jev 的循环是可能的,但重试和故障恢复做不了,除非上面套一个 agent。它赢的地方是那些 LLM 在长程任务里会产生幻觉的确定性判断,比如某个元素到底在不在屏幕上。
https://x.com/mdlahfir/status/2100390804888142007
关于带类型决策的模型该放在哪里,这是最清楚的解释:Jev 不是一个 agentic loop,它是一个决策点。它回答该点哪个元素,而不是点完之后出现了这个结果、接下来试什么——后者仍然是 agent 的活。只用 Jev 的循环是可能的,但重试和故障恢复做不了,除非上面套一个 agent。它赢的地方是那些 LLM 在长程任务里会产生幻觉的确定性判断,比如某个元素到底在不在屏幕上。
#38
@Aperture_Inst
https://x.com/Aperture_Inst/status/2100037403633127759
在一份内核里住着语言模型的操作系统发布说明里,埋着本轮最好的一条单行 bug 报告:agent loop 知道自己在绕圈,却从来没提过。同一次发布里还有:一个每次启动只能通过一次的测试,让一台干净的机器看起来像坏了;以及一次 128 位除法在这个目标平台上会静默地永不返回,一行代码就让启动挂掉且没有任何报错。
https://x.com/Aperture_Inst/status/2100037403633127759
在一份内核里住着语言模型的操作系统发布说明里,埋着本轮最好的一条单行 bug 报告:agent loop 知道自己在绕圈,却从来没提过。同一次发布里还有:一个每次启动只能通过一次的测试,让一台干净的机器看起来像坏了;以及一次 128 位除法在这个目标平台上会静默地永不返回,一行代码就让启动挂掉且没有任何报错。
#39
@the_niresh
https://x.com/the_niresh/status/2099724920163017140
他花两周读 Codex 的代码去找那个 agent loop,结论是它不存在。那里有四个循环,而且是刻意分开的,最外层那个接收你的输入、从不等待工作完成。正是这一个选择,才让你能在模型还在说到一半的时候按 ctrl-c 或者批准一条命令。大家谈 agent loop 的时候好像它是一个东西,在一个真正发货的产品里它不是。
https://x.com/the_niresh/status/2099724920163017140
他花两周读 Codex 的代码去找那个 agent loop,结论是它不存在。那里有四个循环,而且是刻意分开的,最外层那个接收你的输入、从不等待工作完成。正是这一个选择,才让你能在模型还在说到一半的时候按 ctrl-c 或者批准一条命令。大家谈 agent loop 的时候好像它是一个东西,在一个真正发货的产品里它不是。
#40
@Oluwaphilemon1
https://x.com/Oluwaphilemon1/status/2100577302715285869
一个适配器,做的不是简单压低推理预算,而是定位那些跟过度思考相关的 token 并在生成时惩罚它们。GPQA-Diamond 上思考 token 从 15014 降到 8855,分数 88.4% 到 88.3%——少了大约 41% 而成绩基本不变;Terminal-Bench 从每任务约 3.7 万 token 降到 2.7 万,表现持平。代价也一并公布了:AIME 从 98.7% 掉到 94%,也就是说在模型确实需要想更久的地方,深度被交换掉了。放进 agent loop 他愿意做这个交换,做硬数学他不愿意。
https://x.com/Oluwaphilemon1/status/2100577302715285869
一个适配器,做的不是简单压低推理预算,而是定位那些跟过度思考相关的 token 并在生成时惩罚它们。GPQA-Diamond 上思考 token 从 15014 降到 8855,分数 88.4% 到 88.3%——少了大约 41% 而成绩基本不变;Terminal-Bench 从每任务约 3.7 万 token 降到 2.7 万,表现持平。代价也一并公布了:AIME 从 98.7% 掉到 94%,也就是说在模型确实需要想更久的地方,深度被交换掉了。放进 agent loop 他愿意做这个交换,做硬数学他不愿意。
#41
@elteslaengineer
https://x.com/elteslaengineer/status/2100017759946178654
有人认真算了一下每天用 Claude Code 的耗电,结果大约是 1 到 6 千瓦时,跟两台冰箱差不多。真正到位的是那句框架:耗的不是回答的 token,而是 agent loop、缓存读取、工具调用,是你喝咖啡的时候它跑的那几千步。聊天机器人是一只灯泡,agent 是家电。
https://x.com/elteslaengineer/status/2100017759946178654
有人认真算了一下每天用 Claude Code 的耗电,结果大约是 1 到 6 千瓦时,跟两台冰箱差不多。真正到位的是那句框架:耗的不是回答的 token,而是 agent loop、缓存读取、工具调用,是你喝咖啡的时候它跑的那几千步。聊天机器人是一只灯泡,agent 是家电。
#42
@mygtmhire
https://x.com/mygtmhire/status/2099778894098481357
他把一份关于对冲基金循环工程的从业者笔记,跟斯坦福讲隐马尔可夫模型的那一章放在一起读,然后做了综合。文中提的交易循环是:数据、信号、独立验证、执行、风险监控、记忆、再来一遍——一个 agent 生成交易,另一个独立的检查器拿确定性规则去测它,夏普、回撤、统计显著性、样本外表现,不过就作废。再叠上隐状态推断,你得到的是一台会维持某个信念并自动更新的机器,不需要谁去敲一句再想想。他搬过来的那句警告才是重点:自动化不创造 alpha,一个糟糕的研究论点只会变成一台亏钱更快的机器,而验证可能比生成更重要。
https://x.com/mygtmhire/status/2099778894098481357
他把一份关于对冲基金循环工程的从业者笔记,跟斯坦福讲隐马尔可夫模型的那一章放在一起读,然后做了综合。文中提的交易循环是:数据、信号、独立验证、执行、风险监控、记忆、再来一遍——一个 agent 生成交易,另一个独立的检查器拿确定性规则去测它,夏普、回撤、统计显著性、样本外表现,不过就作废。再叠上隐状态推断,你得到的是一台会维持某个信念并自动更新的机器,不需要谁去敲一句再想想。他搬过来的那句警告才是重点:自动化不创造 alpha,一个糟糕的研究论点只会变成一台亏钱更快的机器,而验证可能比生成更重要。
#43
@Macro_Harder
https://x.com/Macro_Harder/status/2100008284551819524
他跑着一个自我改进的参谋长 agent,设计目标是同一个错不犯第二次、尽量少要人介入,用它来监控和帮忙搭他那套 agent 蜂群交易系统。一个专职监督其他 agent、自己不干活的 agent,反复出现,看起来是大家正在收敛到的形态。
https://x.com/Macro_Harder/status/2100008284551819524
他跑着一个自我改进的参谋长 agent,设计目标是同一个错不犯第二次、尽量少要人介入,用它来监控和帮忙搭他那套 agent 蜂群交易系统。一个专职监督其他 agent、自己不干活的 agent,反复出现,看起来是大家正在收敛到的形态。
#44
@ishaansehgal
https://x.com/ishaansehgal/status/2100397702249062680
他指出把 agent loop 和工具执行环境分开之后的自然结果:agent 可以决定在哪台机器上跑工具。配上机器心跳、守护进程架构和机器生命周期工具,agent 能实时看到哪些机器可用,你可以自带执行环境——笔记本、虚拟机、容器——而在更高级的用法里,agent 自己申请和释放算力。
https://x.com/ishaansehgal/status/2100397702249062680
他指出把 agent loop 和工具执行环境分开之后的自然结果:agent 可以决定在哪台机器上跑工具。配上机器心跳、守护进程架构和机器生命周期工具,agent 能实时看到哪些机器可用,你可以自带执行环境——笔记本、虚拟机、容器——而在更高级的用法里,agent 自己申请和释放算力。
#45
@vikasmalpani
https://x.com/vikasmalpani/status/2100485745194782744
来自一个真的把这套跑在房产运营上的人,关于自编辑技能文件的锋利之处:它一路自我改进,直到某一次 agent 改了一个技能,悄无声息地改变了没人审过的生产行为。他的解法不是自编辑本身,而是给每一次自编辑加一道审批门。
https://x.com/vikasmalpani/status/2100485745194782744
来自一个真的把这套跑在房产运营上的人,关于自编辑技能文件的锋利之处:它一路自我改进,直到某一次 agent 改了一个技能,悄无声息地改变了没人审过的生产行为。他的解法不是自编辑本身,而是给每一次自编辑加一道审批门。
#46
@anrayama
https://x.com/anrayama/status/2100261845286482132
同一个问题的另一面:自我改进的技能听起来很美,直到某个 agent 改了一份别的工作流依赖的工具契约。他的结论是生产环境跑 agent 就必须做版本化和不可变的技能 schema。这两条帖子合起来,基本就是一个自编辑 harness 在安全之前需要满足的完整规格。
https://x.com/anrayama/status/2100261845286482132
同一个问题的另一面:自我改进的技能听起来很美,直到某个 agent 改了一份别的工作流依赖的工具契约。他的结论是生产环境跑 agent 就必须做版本化和不可变的技能 schema。这两条帖子合起来,基本就是一个自编辑 harness 在安全之前需要满足的完整规格。
#47
@Cch_Chichieh
https://x.com/Cch_Chichieh/status/2099885613243634131
放在 harness 外面的记忆看着很灵活,直到两边的写入路径开始分叉。他只信任那种跟 agent loop 共享同一套写入规则、隔离边界和失败信号的记忆。这是目前对外挂式记忆产品为什么总让人失望的最凝练解释。
https://x.com/Cch_Chichieh/status/2099885613243634131
放在 harness 外面的记忆看着很灵活,直到两边的写入路径开始分叉。他只信任那种跟 agent loop 共享同一套写入规则、隔离边界和失败信号的记忆。这是目前对外挂式记忆产品为什么总让人失望的最凝练解释。
#48
@RitwikSrivast11
https://x.com/RitwikSrivast11/status/2099681642189107321
记忆在检索的 demo 里看起来已经解决了,然后写入路径、淘汰策略和评测把每一个真实的多 agent 循环吃掉。他把这段缺口叫作投入不足的地方,而本轮有这么多不同的人各自描述同一条接缝,说明他是对的。
https://x.com/RitwikSrivast11/status/2099681642189107321
记忆在检索的 demo 里看起来已经解决了,然后写入路径、淘汰策略和评测把每一个真实的多 agent 循环吃掉。他把这段缺口叫作投入不足的地方,而本轮有这么多不同的人各自描述同一条接缝,说明他是对的。
#49
@KissonL
https://x.com/KissonL/status/2099701611518197847
那条大家都跳过、然后都后悔的日志建议。他碰到的大多数 agent loop 的 bug 不是推理不行,而是某次工具输出被静默截断,agent 自信地把剩下的部分补完,仿佛它读了全部。静默截断在最终答案里看不见,在 transcript 里一目了然。
https://x.com/KissonL/status/2099701611518197847
那条大家都跳过、然后都后悔的日志建议。他碰到的大多数 agent loop 的 bug 不是推理不行,而是某次工具输出被静默截断,agent 自信地把剩下的部分补完,仿佛它读了全部。静默截断在最终答案里看不见,在 transcript 里一目了然。
#50
@rusabuilds
https://x.com/rusabuilds/status/2099917040362414440
在每一个边界上把输入和输出都记下来,是大家跳过、然后就调不动的那一步。他的原话:一个你没法检查的 agent loop,就是一台老虎机。
https://x.com/rusabuilds/status/2099917040362414440
在每一个边界上把输入和输出都记下来,是大家跳过、然后就调不动的那一步。他的原话:一个你没法检查的 agent loop,就是一台老虎机。
#51
@grenlouis
https://x.com/grenlouis/status/2100110463597953169
他刻意限制并行。与其让很多 agent 在一个代码库上跑,不如把代码库切成更多独立作用域,让几个 agent 分别在这些作用域上干活——一个做 Web 应用、一个造工具、一个写原生技能、一个改 agent loop——并且有一条硬规则:它们绝不改同一批文件。需要改共享代码的部分他自己单独处理,因为另一种方式在心智上太累。
https://x.com/grenlouis/status/2100110463597953169
他刻意限制并行。与其让很多 agent 在一个代码库上跑,不如把代码库切成更多独立作用域,让几个 agent 分别在这些作用域上干活——一个做 Web 应用、一个造工具、一个写原生技能、一个改 agent loop——并且有一条硬规则:它们绝不改同一批文件。需要改共享代码的部分他自己单独处理,因为另一种方式在心智上太累。
#52
@stretchcloud
https://x.com/stretchcloud/status/2099716085658325426
说的是 DeepSeek 那个 MIT 协议的 harness,agent loop 的每一个组件都是可替换插件——模型、工具、沙箱、UI,以及循环本身——一条 npx 命令 30 秒启动。发布几小时内 33K 星,说明市场早就在等。他提的问题才是要紧的:harness 这一层会不会也商品化,还是说围绕它形成的生态里有一条持久的护城河?
https://x.com/stretchcloud/status/2099716085658325426
说的是 DeepSeek 那个 MIT 协议的 harness,agent loop 的每一个组件都是可替换插件——模型、工具、沙箱、UI,以及循环本身——一条 npx 命令 30 秒启动。发布几小时内 33K 星,说明市场早就在等。他提的问题才是要紧的:harness 这一层会不会也商品化,还是说围绕它形成的生态里有一条持久的护城河?
#53
@paradoxbuilder
https://x.com/paradoxbuilder/status/2099940525851697494
对什么都是插件这类架构最对的反驳:听着很干净,直到第 12 个插件跟第 3 个插件打架。你怎么防止 agent loop 变成一锅插件汤?目前做这类东西的人,没有一个回答过。
https://x.com/paradoxbuilder/status/2099940525851697494
对什么都是插件这类架构最对的反驳:听着很干净,直到第 12 个插件跟第 3 个插件打架。你怎么防止 agent loop 变成一锅插件汤?目前做这类东西的人,没有一个回答过。
#54
@sonicdr1p
https://x.com/sonicdr1p/status/2100183101062209983
xAI 一直没正式修 Grok Bot 的审批问题,于是 GitHub 上的人自己绕过去了。他整理的清单包括一个完全开源、跑在 Grok API 上的编码 agent,自带实时搜索和子 agent,你可以在 Telegram 上驱动它而不用守着终端;一个把同一套 harness 塞进桌面端的应用;以及 xAI 自己开源的编码 agent,可以直接读他们内部的 agent loop 和审批、工具调用层是怎么写的。他的收尾警告是对的:这些都不能替你去读审批弹窗。
https://x.com/sonicdr1p/status/2100183101062209983
xAI 一直没正式修 Grok Bot 的审批问题,于是 GitHub 上的人自己绕过去了。他整理的清单包括一个完全开源、跑在 Grok API 上的编码 agent,自带实时搜索和子 agent,你可以在 Telegram 上驱动它而不用守着终端;一个把同一套 harness 塞进桌面端的应用;以及 xAI 自己开源的编码 agent,可以直接读他们内部的 agent loop 和审批、工具调用层是怎么写的。他的收尾警告是对的:这些都不能替你去读审批弹窗。
#55
@ayyazdev
https://x.com/ayyazdev/status/2100071328178991602
Coder 把 Claude Code 接进了 Agent Relay,而重点是架构。Anthropic 仍然跑 agent loop 和推理;工具调用在你自己的工作区里执行,受你的防火墙、RBAC 和审计管辖,会话结束工作区就销毁。他观察到的企业模式是:模型质量早就过关了,deal 死在安全部门问代码和凭证到底存在哪里的那一刻。
https://x.com/ayyazdev/status/2100071328178991602
Coder 把 Claude Code 接进了 Agent Relay,而重点是架构。Anthropic 仍然跑 agent loop 和推理;工具调用在你自己的工作区里执行,受你的防火墙、RBAC 和审计管辖,会话结束工作区就销毁。他观察到的企业模式是:模型质量早就过关了,deal 死在安全部门问代码和凭证到底存在哪里的那一刻。
#56
@AurevonLabs
https://x.com/AurevonLabs/status/2100186637476962642
他把整条 Anthropic 产品线归约成一个问题——agent loop 是你跑还是 Anthropic 跑。SDK 意味着你来运营:Claude Code 级别的工具、循环和上下文管理,作为一个库跑在你的进程里。托管 agent 意味着 Anthropic 运营 agent 和沙箱会话基础设施。同一个 agent 概念,运行时归属不同,而每一场采购谈判谈的其实就是这个归属。
https://x.com/AurevonLabs/status/2100186637476962642
他把整条 Anthropic 产品线归约成一个问题——agent loop 是你跑还是 Anthropic 跑。SDK 意味着你来运营:Claude Code 级别的工具、循环和上下文管理,作为一个库跑在你的进程里。托管 agent 意味着 Anthropic 运营 agent 和沙箱会话基础设施。同一个 agent 概念,运行时归属不同,而每一场采购谈判谈的其实就是这个归属。
#57
@DAssetBuzz
https://x.com/DAssetBuzz/status/2099869255172759554
自托管 agent 不等于物理隔离。把工具执行挪到你的机器上,agent loop 和推理仍然在厂商云里,而工具产出——代码、diff、终端、截图——照样要出楼交给模型。他的反问很公道:如果思考离开了大楼,你还叫它自托管吗?
https://x.com/DAssetBuzz/status/2099869255172759554
自托管 agent 不等于物理隔离。把工具执行挪到你的机器上,agent loop 和推理仍然在厂商云里,而工具产出——代码、diff、终端、截图——照样要出楼交给模型。他的反问很公道:如果思考离开了大楼,你还叫它自托管吗?
#58
@neilhamson
https://x.com/neilhamson/status/2099777270126694401
他把本地这个词拆成三台完全不同的机器,而大家一直把它们混成一台:权重在你硬盘上、解码在别人 GPU 上,那是下载不是本地推理;权重在你显存里但工具调用、搜索和 agent loop 仍然出机器,那是本地模型加远程行动力;权重、解码、工具和写回记忆全在你控制的硬件上,才是第三种。所以诚实的门槛不是一个显存数字,而是:在你真正会用的量化精度、你需要的上下文长度下,你愿意跑哪一档模型,并且循环里不带 API。
https://x.com/neilhamson/status/2099777270126694401
他把本地这个词拆成三台完全不同的机器,而大家一直把它们混成一台:权重在你硬盘上、解码在别人 GPU 上,那是下载不是本地推理;权重在你显存里但工具调用、搜索和 agent loop 仍然出机器,那是本地模型加远程行动力;权重、解码、工具和写回记忆全在你控制的硬件上,才是第三种。所以诚实的门槛不是一个显存数字,而是:在你真正会用的量化精度、你需要的上下文长度下,你愿意跑哪一档模型,并且循环里不带 API。
#59
@cai_smart
https://x.com/cai_smart/status/2100183163821539458
一份对 Claude Code 技能包的认真评测,而里面那条警告是普适的。五个技能里有两个不只是加一条斜杠命令——它们会往你的仓库里搭一个定时的 GitHub Actions 工作流去跑编码 agent,外加一份提示词、一个记忆文件和参考模板。他的提醒完全正确:合并之前把生成的工作流仔细读一遍,因为你提交的是一段按时触发跑 agent 的 CI。
https://x.com/cai_smart/status/2100183163821539458
一份对 Claude Code 技能包的认真评测,而里面那条警告是普适的。五个技能里有两个不只是加一条斜杠命令——它们会往你的仓库里搭一个定时的 GitHub Actions 工作流去跑编码 agent,外加一份提示词、一个记忆文件和参考模板。他的提醒完全正确:合并之前把生成的工作流仔细读一遍,因为你提交的是一段按时触发跑 agent 的 CI。
#60
@shivam74689
https://x.com/shivam74689/status/2100273866170056983
公开构建的第 112 天,关键那一步是把检索层接进一个有界的 agent loop,让 agent 自己判断某张工单什么时候需要支撑文档,而不是每次都靠模型的内部知识。他还加了引用处理,让检索到的知识不是注入完就丢——最终草稿会引用它用过的文档,这样审核的人能追溯。他的结论是:有据可依的生成比流畅的生成更重要。
https://x.com/shivam74689/status/2100273866170056983
公开构建的第 112 天,关键那一步是把检索层接进一个有界的 agent loop,让 agent 自己判断某张工单什么时候需要支撑文档,而不是每次都靠模型的内部知识。他还加了引用处理,让检索到的知识不是注入完就丢——最终草稿会引用它用过的文档,这样审核的人能追溯。他的结论是:有据可依的生成比流畅的生成更重要。
#61
@degenpark_eth
https://x.com/degenpark_eth/status/2100174409315029410
他认为有效性交易能一次性消掉一整类 agent 协调问题。如果一笔交易自带前置条件、并且链在打包之前就做校验,那 agent 可以把第二步作为一笔条件交易发出去,只有第一步的效果在链上可见时才会执行,既不用包装合约也不用 keeper 网络。从技术栈里掉出去的是轮询循环、读完再发之间那段竞态,以及竞态输掉之后的恢复逻辑。
https://x.com/degenpark_eth/status/2100174409315029410
他认为有效性交易能一次性消掉一整类 agent 协调问题。如果一笔交易自带前置条件、并且链在打包之前就做校验,那 agent 可以把第二步作为一笔条件交易发出去,只有第一步的效果在链上可见时才会执行,既不用包装合约也不用 keeper 网络。从技术栈里掉出去的是轮询循环、读完再发之间那段竞态,以及竞态输掉之后的恢复逻辑。
#62
@jefflinshu
https://x.com/jefflinshu/status/2100058183876354367
他现在的分工是网页版 ChatGPT 做规划、Grok 执行、Codex 审查,而理由是关于 harness 不是关于智能。Codex 的 agent loop 是围着代码执行建的,所以拿它做调研、读 PDF 或者聊产品,并不会让这些事变好,只会让循环更重、上下文烧得更多。开放式的工作丢给聊天,工程执行丢给 Codex。他还提了一句,自己最近基本不用 100 万上下文了,一个月下来也没怎么想它。
https://x.com/jefflinshu/status/2100058183876354367
他现在的分工是网页版 ChatGPT 做规划、Grok 执行、Codex 审查,而理由是关于 harness 不是关于智能。Codex 的 agent loop 是围着代码执行建的,所以拿它做调研、读 PDF 或者聊产品,并不会让这些事变好,只会让循环更重、上下文烧得更多。开放式的工作丢给聊天,工程执行丢给 Codex。他还提了一句,自己最近基本不用 100 万上下文了,一个月下来也没怎么想它。
#63
@Iktiarshovo12
https://x.com/Iktiarshovo12/status/2100436975966962074
他把 MCP 支付轨道讲了一遍,问题说得很直白:一个自主 agent 在做项目时需要实时数据、向量搜索和证明生成,每样只花几厘钱,而把它重定向到人工结账页面就把整个循环毁了。有了暴露 request_payment、check_status 和 get_session_budget 的 MCP 服务,模型调支付工具就像调文件读取一样,结算走一把限定作用域的会话密钥,收据哈希大约 1.8 秒回到上下文窗口里。
https://x.com/Iktiarshovo12/status/2100436975966962074
他把 MCP 支付轨道讲了一遍,问题说得很直白:一个自主 agent 在做项目时需要实时数据、向量搜索和证明生成,每样只花几厘钱,而把它重定向到人工结账页面就把整个循环毁了。有了暴露 request_payment、check_status 和 get_session_budget 的 MCP 服务,模型调支付工具就像调文件读取一样,结算走一把限定作用域的会话密钥,收据哈希大约 1.8 秒回到上下文窗口里。
#64
@bytecrafter_1
https://x.com/bytecrafter_1/status/2100231960912392392
关于编码 agent 为什么烧预算而翻译不烧,这是一个精确的解释。翻译的每一段都是独立的,上下文从不累积,而且系统提示词每次调用都一样,所以几乎全部命中缓存——扇出到 50 种语言,支出也只随原文长度线性增长,没有任何东西复利。编码 agent 每一轮都要把整段对话加工具 schema 重发一遍。同样的额度扔进一个长的 agent loop,很快就能看出坑来。
https://x.com/bytecrafter_1/status/2100231960912392392
关于编码 agent 为什么烧预算而翻译不烧,这是一个精确的解释。翻译的每一段都是独立的,上下文从不累积,而且系统提示词每次调用都一样,所以几乎全部命中缓存——扇出到 50 种语言,支出也只随原文长度线性增长,没有任何东西复利。编码 agent 每一轮都要把整段对话加工具 schema 重发一遍。同样的额度扔进一个长的 agent loop,很快就能看出坑来。
#65
@Bober_smart
https://x.com/Bober_smart/status/2100313298428186756
他逐层拆解了 Codex 和 ChatGPT 团队怎么优化 agent loop。wrapper 层负责收集上下文、发出去、执行返回的工具动作,而由于网络往返和提示词重建在每次调用里占大头,他们用持久 WebSocket 和固定提示词前缀。API 层做校验、安全检查和分词,所以用了增量分词和并行安全评估。推理层用缓存感知路由、投机解码,以及分离的 prefill 和 decode 阶段。底下只有一条原则:同样的计算绝不付两次钱。
https://x.com/Bober_smart/status/2100313298428186756
他逐层拆解了 Codex 和 ChatGPT 团队怎么优化 agent loop。wrapper 层负责收集上下文、发出去、执行返回的工具动作,而由于网络往返和提示词重建在每次调用里占大头,他们用持久 WebSocket 和固定提示词前缀。API 层做校验、安全检查和分词,所以用了增量分词和并行安全评估。推理层用缓存感知路由、投机解码,以及分离的 prefill 和 decode 阶段。底下只有一条原则:同样的计算绝不付两次钱。
#66
@ElInsuranceGuy
https://x.com/ElInsuranceGuy/status/2100615937019859147
一条关于延迟约束的干净陈述,而大家总忘。表格基础模型可以零训练做预测,但 CPU 上一次调用要 12.6 秒——你没法把它放进一个交互式 agent loop,因为没人愿意为一个假设性问题等 88 秒。一旦链条末端坐着一个人,单次调用的延迟就不再是锦上添花。
https://x.com/ElInsuranceGuy/status/2100615937019859147
一条关于延迟约束的干净陈述,而大家总忘。表格基础模型可以零训练做预测,但 CPU 上一次调用要 12.6 秒——你没法把它放进一个交互式 agent loop,因为没人愿意为一个假设性问题等 88 秒。一旦链条末端坐着一个人,单次调用的延迟就不再是锦上添花。
#67
@SepandD
https://x.com/SepandD/status/2099948169664852010
本轮最让人不舒服的一条观察:现在的热度周期转得够快,以至于某个人的 autoresearch 系统犯下让结果更好看的评测错误,反而是有利的。等有人发现的时候,赞美已经收完了、工作也被忘光了,没人在乎那个分数是在半个验证集上算出来的。他说自己在视觉评测结果上已经碰到好几次,所以刻意放慢了自家发布,把结果反复核了三遍。
https://x.com/SepandD/status/2099948169664852010
本轮最让人不舒服的一条观察:现在的热度周期转得够快,以至于某个人的 autoresearch 系统犯下让结果更好看的评测错误,反而是有利的。等有人发现的时候,赞美已经收完了、工作也被忘光了,没人在乎那个分数是在半个验证集上算出来的。他说自己在视觉评测结果上已经碰到好几次,所以刻意放慢了自家发布,把结果反复核了三遍。
#68
@SpenzDigital
https://x.com/SpenzDigital/status/2100612769934688377
关于非官方客户端,正确的接线方式是:沿用已有登录、一个 agent 内核、桌面端只做一层薄视图。那些偷偷塞进第二个 agent loop 的壳,每一次都以同样的方式腐烂:两套行为、一套评测,哪一套都没覆盖住。
https://x.com/SpenzDigital/status/2100612769934688377
关于非官方客户端,正确的接线方式是:沿用已有登录、一个 agent 内核、桌面端只做一层薄视图。那些偷偷塞进第二个 agent loop 的壳,每一次都以同样的方式腐烂:两套行为、一套评测,哪一套都没覆盖住。
#69
@winzheng_lab
https://x.com/winzheng_lab/status/2099684867802046467
agent loop 的轮询是额度杀手,他们在跑多步代码评测任务时也看到同样的消耗。他们的观点是跑分从来不体现每个任务的 API 成本,而这个数字大概和原始能力一样重要——本周整条 harness 对比线,正在各自独立地收敛到同一个结论上。
https://x.com/winzheng_lab/status/2099684867802046467
agent loop 的轮询是额度杀手,他们在跑多步代码评测任务时也看到同样的消耗。他们的观点是跑分从来不体现每个任务的 API 成本,而这个数字大概和原始能力一样重要——本周整条 harness 对比线,正在各自独立地收敛到同一个结论上。
#70
@AfterThe925
https://x.com/AfterThe925/status/2099928324436787361
他把 Claude Code 额度变化的算术做了一遍。夏季那次 50% 的周额度加成在 9 月 13 日结束,新的永久底线是比五月前高 25%,而相对于你整个夏天照着规划的那个额度,这大约是少了 17%。auto 模式的分类器不再消耗周额度。他给的指令很实用:如果一条命令能引发八到十二次工具调用,周上限就是产品本身——跑一下 /usage,把真实剩余写在便签上,照着那个数字规划下一个 agent loop,而不是照着营销话术。
https://x.com/AfterThe925/status/2099928324436787361
他把 Claude Code 额度变化的算术做了一遍。夏季那次 50% 的周额度加成在 9 月 13 日结束,新的永久底线是比五月前高 25%,而相对于你整个夏天照着规划的那个额度,这大约是少了 17%。auto 模式的分类器不再消耗周额度。他给的指令很实用:如果一条命令能引发八到十二次工具调用,周上限就是产品本身——跑一下 /usage,把真实剩余写在便签上,照着那个数字规划下一个 agent loop,而不是照着营销话术。
📡 生态产品雷达
生态产品雷达
Dream-RSI —— 冻结权重的递归自我改进成果,本轮至少从四个方向被讨论。
OpenResearch —— 本地优先的 autoresearch 工作区,用隔离 worktree 把 Claude Code、Codex、OpenCode 变成研究 agent。
Claude Code —— 仍然是这些循环底下的默认底座,也是本轮那笔额度算术的主角。
Codex —— 被人逐行读的那个循环,用来搞清楚一个真正发货的 agent 运行时到底怎么搭。
Jev —— 带类型决策的模型,正被接成决策层,而生成被彻底移出循环。
DeepSeek Harness —— 彻底解耦的 harness,连 agent loop 本身都是可替换插件。
Pi —— 最小化的 harness,在每一次 harness 对比的成本那一半里都在赢。
Hermes —— 主打自进化技能的 harness,现在上线了经过审核、带 SHA 固定的插件目录。
MCP —— 这些东西底下的连接层,现在正被往支付轨道方向延伸。
Dream-RSI —— 冻结权重的递归自我改进成果,本轮至少从四个方向被讨论。
OpenResearch —— 本地优先的 autoresearch 工作区,用隔离 worktree 把 Claude Code、Codex、OpenCode 变成研究 agent。
Claude Code —— 仍然是这些循环底下的默认底座,也是本轮那笔额度算术的主角。
Codex —— 被人逐行读的那个循环,用来搞清楚一个真正发货的 agent 运行时到底怎么搭。
Jev —— 带类型决策的模型,正被接成决策层,而生成被彻底移出循环。
DeepSeek Harness —— 彻底解耦的 harness,连 agent loop 本身都是可替换插件。
Pi —— 最小化的 harness,在每一次 harness 对比的成本那一半里都在赢。
Hermes —— 主打自进化技能的 harness,现在上线了经过审核、带 SHA 固定的插件目录。
MCP —— 这些东西底下的连接层,现在正被往支付轨道方向延伸。
评论