Loop 日报: 2026年8月10日
Prime Intellect 开源 Prime Agent 是今天的绝对主角:十几条帖子分别拆解它的递归语言模型设计、把上下文变成变量的持久 IPython 内核、以及能改写自己 prompt 和技能的 /refine 层,已经有用户从 chat-first 的 harness 迁移过去跑长任务。第二条主线是循环走出代码圈:一个 Facebook 广告投放循环里人类唯一的工作是每天拍 30 秒素材、一个把正面回复当训练指标的冷邮件循环、一道被 agent 循环解掉的 Kourovka 数学问题(原出题人已经开始给循环喂新题)、还有一篇作者自评 95% 概率有真实学术价值的 AI 协作凝聚态物理论文。自主性的账单也开始被逐项列出来:一个幻觉出来的数据库 schema 静默烧了两小时五十美元,一个 agentic loop 对 Hugging Face 发起 1.7 万次攻击无人察觉。
#1
@startupideaspod
https://x.com/startupideaspod/status/2086122810859290868
作者讲了怎么在 Facebook 广告上跑 agentic loop,理由是广告 A/B 测试天然会分出胜负,是最容易做闭环的场景之一。整套东西分五块:老板每天录 30 秒素材扔进一个文件夹、agent 直接接入广告账户的花费和效果数据、agent 把素材剪成不同 hook 和文案的变体、每两三天做一次判断(因为数据积累慢,没必要每小时看)、砍掉输的加倍投赢的。他也点了两个限制:每个变体得烧够广告费才能分清信号和噪音,而且纯 AI 合成的广告目前还是打不过有真人出镜的。人唯一要干的活就是录素材,剩下的全交给循环去测。
https://x.com/startupideaspod/status/2086122810859290868
作者讲了怎么在 Facebook 广告上跑 agentic loop,理由是广告 A/B 测试天然会分出胜负,是最容易做闭环的场景之一。整套东西分五块:老板每天录 30 秒素材扔进一个文件夹、agent 直接接入广告账户的花费和效果数据、agent 把素材剪成不同 hook 和文案的变体、每两三天做一次判断(因为数据积累慢,没必要每小时看)、砍掉输的加倍投赢的。他也点了两个限制:每个变体得烧够广告费才能分清信号和噪音,而且纯 AI 合成的广告目前还是打不过有真人出镜的。人唯一要干的活就是录素材,剩下的全交给循环去测。
#2
@nykdotdev
https://x.com/nykdotdev/status/2085999877738340659
作者认为把研究和实盘交易执行塞进同一个 agent 循环里,会把资金边界藏起来。他的工作模型是双时钟架构:研究时钟可以慢慢跑几个小时,执行时钟必须在市场变化之前完成,两者之间设一道资金编译门。具体规则包括:开放式的模型输出绝不能碰实盘下单路径;每个交易意图都要从当前状态重建,不能拿过期的论点直接下单;重试之前必须有幂等性和外部对账;成交、手续费、余额都要转成真实状态再做下一个决策;模型和 prompt 版本要钉死。资金只有在带日期的证据包通过那道门之后才能动,交易成本没建模的情况下永远不动。
https://x.com/nykdotdev/status/2085999877738340659
作者认为把研究和实盘交易执行塞进同一个 agent 循环里,会把资金边界藏起来。他的工作模型是双时钟架构:研究时钟可以慢慢跑几个小时,执行时钟必须在市场变化之前完成,两者之间设一道资金编译门。具体规则包括:开放式的模型输出绝不能碰实盘下单路径;每个交易意图都要从当前状态重建,不能拿过期的论点直接下单;重试之前必须有幂等性和外部对账;成交、手续费、余额都要转成真实状态再做下一个决策;模型和 prompt 版本要钉死。资金只有在带日期的证据包通过那道门之后才能动,交易成本没建模的情况下永远不动。
#3
@aiamblichus
https://x.com/aiamblichus/status/2086100263064961097
作者用自己的 auto-research 框架做了个测试:让 GPT Pro 指挥一队 AI 模型做研究,产出了一篇数学物理/凝聚态理论方向的论文,现在公开征求专业人士评审,看它到底有没有真正的学术价值。分工是 GPT Pro 当高层科学顾问,DeepSeek v4 Pro 当课题负责人,DeepSeek v4 Flash 负责跑实验和整理参考文献,作者特别夸 DeepSeek v4 Flash 在硬核科学工作上是个惊喜。论文经过了大量验证,作者给出 95% 的概率认为有真实价值,GPT Pro 也判定可以正式投稿。他愿意提供全套凭证,包括 Python 脚本和实验结果,把这次尝试定位成"当前模型的 auto-research 能走多远"的一个中立数据点。
https://x.com/aiamblichus/status/2086100263064961097
作者用自己的 auto-research 框架做了个测试:让 GPT Pro 指挥一队 AI 模型做研究,产出了一篇数学物理/凝聚态理论方向的论文,现在公开征求专业人士评审,看它到底有没有真正的学术价值。分工是 GPT Pro 当高层科学顾问,DeepSeek v4 Pro 当课题负责人,DeepSeek v4 Flash 负责跑实验和整理参考文献,作者特别夸 DeepSeek v4 Flash 在硬核科学工作上是个惊喜。论文经过了大量验证,作者给出 95% 的概率认为有真实价值,GPT Pro 也判定可以正式投稿。他愿意提供全套凭证,包括 Python 脚本和实验结果,把这次尝试定位成"当前模型的 auto-research 能走多远"的一个中立数据点。
#4
@startupideaspod
https://x.com/startupideaspod/status/2086165548707058085
作者说最有野心的 agentic loop 是替你把产品做出来的那种,但他认为这其实必须拆成两个循环,因为修 bug 和做功能对的是完全不同的指标。整个设置让 agent 接入客户反馈、PostHog、Sentry 和日志,自己判断最大的痛点在哪。bug 循环用 uptime 打分,客观但无聊;功能循环则给每个功能配一个 KPI,比如 DAU/MAU、留存、传播系数或 NPS,指标由 agent 自己选、人来批准。第五个环节是给 agent 配上自己的分发工具,让反馈不经过人就能流回来。作者也承认在真实业务上这么干风险很大,并且默认目前的早期实验没有一个真跑通了。
https://x.com/startupideaspod/status/2086165548707058085
作者说最有野心的 agentic loop 是替你把产品做出来的那种,但他认为这其实必须拆成两个循环,因为修 bug 和做功能对的是完全不同的指标。整个设置让 agent 接入客户反馈、PostHog、Sentry 和日志,自己判断最大的痛点在哪。bug 循环用 uptime 打分,客观但无聊;功能循环则给每个功能配一个 KPI,比如 DAU/MAU、留存、传播系数或 NPS,指标由 agent 自己选、人来批准。第五个环节是给 agent 配上自己的分发工具,让反馈不经过人就能流回来。作者也承认在真实业务上这么干风险很大,并且默认目前的早期实验没有一个真跑通了。
#5
@ShreyModi13
https://x.com/ShreyModi13/status/2086127800092602528
作者认为用 auto-research 解决持续学习问题有个大坎:怎么从生产环境的 trace 里造出高质量的训练数据和评测基准。这类系统必须砸大量算力和钱,在各种数据整理配方上跑消融实验,因为不同算法需要的训练数据特征不一样,而生产 trace 本身还在不断变化。整理配方本身也得由 auto-research 系统随时动态调整,而且不是所有数据都能用来训练。他引用 PostTrainBench 的 trace 作为证据:目前的模型做数据消融实验的能力还很差。
https://x.com/ShreyModi13/status/2086127800092602528
作者认为用 auto-research 解决持续学习问题有个大坎:怎么从生产环境的 trace 里造出高质量的训练数据和评测基准。这类系统必须砸大量算力和钱,在各种数据整理配方上跑消融实验,因为不同算法需要的训练数据特征不一样,而生产 trace 本身还在不断变化。整理配方本身也得由 auto-research 系统随时动态调整,而且不是所有数据都能用来训练。他引用 PostTrainBench 的 trace 作为证据:目前的模型做数据消融实验的能力还很差。
#6
@rvaniaaaa
https://x.com/rvaniaaaa/status/2086211524239278090
作者看了一大堆自我改进的 agent 系统,发现它们都缺同一块:大家都会搭发现管线(一个 scout 找仓库、一个过滤器去噪音、一个提取器拉 workflow),但 skill 生成出来之后就停了。他认为决定系统是复利增长还是崩掉的,恰恰是审核环节,标准就一个二元问题:一个有经验的工程师会不会不改一个字直接装上这个 skill?过不了的直接杀掉,而不是标记成"以后再看"。这个系统不用重训模型也能变强,因为 skill 库越大,发现环节的 agent 能参考的模式就越丰富,提取质量就越高,产出的 skill 就越强,审核门槛也随之水涨船高。信任约束是:自动化只负责提议,人负责批准,任何东西都不自动合并。
https://x.com/rvaniaaaa/status/2086211524239278090
作者看了一大堆自我改进的 agent 系统,发现它们都缺同一块:大家都会搭发现管线(一个 scout 找仓库、一个过滤器去噪音、一个提取器拉 workflow),但 skill 生成出来之后就停了。他认为决定系统是复利增长还是崩掉的,恰恰是审核环节,标准就一个二元问题:一个有经验的工程师会不会不改一个字直接装上这个 skill?过不了的直接杀掉,而不是标记成"以后再看"。这个系统不用重训模型也能变强,因为 skill 库越大,发现环节的 agent 能参考的模式就越丰富,提取质量就越高,产出的 skill 就越强,审核门槛也随之水涨船高。信任约束是:自动化只负责提议,人负责批准,任何东西都不自动合并。
#7
@kunalvg
https://x.com/kunalvg/status/2085966553850257598
作者回顾了 eigenlabs 两周内围绕公开 autoresearch 竞赛的一串动作。跟 poolsideai 合办的公开竞赛,几天内就让社区把 Laguna XS 2.1 在消费级 Mac 上跑快了一倍;跟 SuccinctLabs 和以太坊基金会合作的挑战瞄准更快的以太坊后量子证明;跟 Lighter 合作给其生产环境交易所提速的公开挑战,上线 24 小时内就突破了每秒 100 万次压缩。另有一项持续进行的工作已经追平并超过了 Google 未公开的密码学结果。每一项都是先公开贴出问题,然后由人和他们的 agent 协同解决,作者拿这个当证据:开放科学加协作,是推进前沿最快的方式。
https://x.com/kunalvg/status/2085966553850257598
作者回顾了 eigenlabs 两周内围绕公开 autoresearch 竞赛的一串动作。跟 poolsideai 合办的公开竞赛,几天内就让社区把 Laguna XS 2.1 在消费级 Mac 上跑快了一倍;跟 SuccinctLabs 和以太坊基金会合作的挑战瞄准更快的以太坊后量子证明;跟 Lighter 合作给其生产环境交易所提速的公开挑战,上线 24 小时内就突破了每秒 100 万次压缩。另有一项持续进行的工作已经追平并超过了 Google 未公开的密码学结果。每一项都是先公开贴出问题,然后由人和他们的 agent 协同解决,作者拿这个当证据:开放科学加协作,是推进前沿最快的方式。
#8
@bygodgiven
https://x.com/bygodgiven/status/2086141151464010039
作者追踪到一个趋势:agent 循环正在从自己托管转向厂商托管,短时间内已经有六家入场。他梳理的时间线是:Anthropic 4 月 8 日发布 Claude Managed Agents,带托管循环、按会话隔离的沙箱、checkpoint 和 tracing,计费是 token 费率加约 0.08 美元一小时的计时表;AWS 和 Google 7 月前发了各自的 runtime;微软的 Hosted Agents 本月 GA;LangChain 的 Managed Deep Agents 8 月 7 日进入公测。作者认为这是问题第一次从"agent 怎么写"变成了"agent 归谁跑"。他还提到一段视频:一个线上生产 agent,只要在浏览器输入框里敲进新指令并保存,行为就当场改变,不用重新部署,没有 diff,也没有回滚。
https://x.com/bygodgiven/status/2086141151464010039
作者追踪到一个趋势:agent 循环正在从自己托管转向厂商托管,短时间内已经有六家入场。他梳理的时间线是:Anthropic 4 月 8 日发布 Claude Managed Agents,带托管循环、按会话隔离的沙箱、checkpoint 和 tracing,计费是 token 费率加约 0.08 美元一小时的计时表;AWS 和 Google 7 月前发了各自的 runtime;微软的 Hosted Agents 本月 GA;LangChain 的 Managed Deep Agents 8 月 7 日进入公测。作者认为这是问题第一次从"agent 怎么写"变成了"agent 归谁跑"。他还提到一段视频:一个线上生产 agent,只要在浏览器输入框里敲进新指令并保存,行为就当场改变,不用重新部署,没有 diff,也没有回滚。
#9
@0x_sakata
https://x.com/0x_sakata/status/2086073409566654785
作者介绍了 prime-agent,PrimeIntellect 刚开源的自我改进型编程 agent,免费使用,不需要 API 订阅,也没有闭源许可限制。它是一个自我改进的 RLM agent,把上下文当变量、把工具当函数调用,全部跑在一个持久化的 REPL 里,支持能挺过聊天窗口的长时间自主工作流,内置子 agent 生成和团队级任务编排,任何模型提供商的 key 都能用。安装很简单:curl 一键安装,cd 进仓库,运行 prime-agent,再用 /setup 连上模型提供商。几个重要提醒:它直接以你的用户权限运行,没有沙箱;需要自备 LLM 提供商的 key;最好用在能从 git 恢复的目录里。
https://x.com/0x_sakata/status/2086073409566654785
作者介绍了 prime-agent,PrimeIntellect 刚开源的自我改进型编程 agent,免费使用,不需要 API 订阅,也没有闭源许可限制。它是一个自我改进的 RLM agent,把上下文当变量、把工具当函数调用,全部跑在一个持久化的 REPL 里,支持能挺过聊天窗口的长时间自主工作流,内置子 agent 生成和团队级任务编排,任何模型提供商的 key 都能用。安装很简单:curl 一键安装,cd 进仓库,运行 prime-agent,再用 /setup 连上模型提供商。几个重要提醒:它直接以你的用户权限运行,没有沙箱;需要自备 LLM 提供商的 key;最好用在能从 git 恢复的目录里。
#10
@almnc_ai
https://x.com/almnc_ai/status/2086022104101577205
作者总结了 LangChain 一段 46 分钟的讲解,主题是怎么构建会随时间变强的 agent,核心是四层嵌套循环:agent 循环负责让模型调工具直到干完活;验证循环给输出打分,不合格的打回重做;事件循环把 agent 接到真实世界的触发器上实现持续工作;改进循环分析历史运行并更新 harness。改进循环靠挖生产 trace——agent 试了什么、用了哪些工具、在哪失败、评分器抓到了什么、什么有效——找出反复出现的失败模式,改 prompt 或工具,重跑,量化差异。LangChain 管这叫爬山(hill climbing),而且同一个循环最终可以用来改进记忆、检索到的 skill、评分器,甚至底层模型本身。文末作者把"运行 trace 很值钱"这个观点接到了自己写过的激励机制文章上。
https://x.com/almnc_ai/status/2086022104101577205
作者总结了 LangChain 一段 46 分钟的讲解,主题是怎么构建会随时间变强的 agent,核心是四层嵌套循环:agent 循环负责让模型调工具直到干完活;验证循环给输出打分,不合格的打回重做;事件循环把 agent 接到真实世界的触发器上实现持续工作;改进循环分析历史运行并更新 harness。改进循环靠挖生产 trace——agent 试了什么、用了哪些工具、在哪失败、评分器抓到了什么、什么有效——找出反复出现的失败模式,改 prompt 或工具,重跑,量化差异。LangChain 管这叫爬山(hill climbing),而且同一个循环最终可以用来改进记忆、检索到的 skill、评分器,甚至底层模型本身。文末作者把"运行 trace 很值钱"这个观点接到了自己写过的激励机制文章上。
#11
@RichieSater
https://x.com/RichieSater/status/2086104545952756089
作者在一条回复里说,他们通过 agentic loop 解决了 Kourovka 问题集里的 10.34 号问题,并且正在和这个问题的原提出者通信。对方立刻又寄来一道新题让他们做,因为这位数学家看得到 AI 看不到的更大图景和问题之间的关联。这是一个具体的非编程领域 autoresearch 成果:在开放数学问题上,agent 循环加上人类专家在环,真的出了结果。
https://x.com/RichieSater/status/2086104545952756089
作者在一条回复里说,他们通过 agentic loop 解决了 Kourovka 问题集里的 10.34 号问题,并且正在和这个问题的原提出者通信。对方立刻又寄来一道新题让他们做,因为这位数学家看得到 AI 看不到的更大图景和问题之间的关联。这是一个具体的非编程领域 autoresearch 成果:在开放数学问题上,agent 循环加上人类专家在环,真的出了结果。
#12
@CaryPalmerr
https://x.com/CaryPalmerr/status/2086068849598726211
作者宣布 Puppetmaster 的 agent "Stitch" 在某个排行榜上拿下了中型 GPU 级别的第一名,跑在一张 24GB 显存的 RTX 3090 上,成本 0.24 美元一小时。他特别指出,榜上一些用 40GB 以上甚至高达 140GB 显存的 agent,排名都稳稳在它之下。帖子里附了项目的 GitHub 链接。
https://x.com/CaryPalmerr/status/2086068849598726211
作者宣布 Puppetmaster 的 agent "Stitch" 在某个排行榜上拿下了中型 GPU 级别的第一名,跑在一张 24GB 显存的 RTX 3090 上,成本 0.24 美元一小时。他特别指出,榜上一些用 40GB 以上甚至高达 140GB 显存的 agent,排名都稳稳在它之下。帖子里附了项目的 GitHub 链接。
#13
@canersoez
https://x.com/canersoez/status/2086149946169024869
作者的团队把 Karpathy 的 auto-research 思路搬到了冷启动邮件(cold email)上,当成一个机器学习算法来做,目标指标只有一个:正面回复。流程是批量发邮件,然后分析表现最好和最差的邮件各有什么共性,分别总结成框架。接着用 Claude 做出一个 skill md 文件,写邮件时只用好邮件的共性、完全避开坏邮件的共性,另外还有一个可选的打分 skill,把每封草稿对照历史上所有成功脚本打 1 到 10 分,只有 7 分以上的才投入新 campaign。作者把输出质量归结为数据收集和喂养问题:AI 就是它吃进去的信息的平均值。
https://x.com/canersoez/status/2086149946169024869
作者的团队把 Karpathy 的 auto-research 思路搬到了冷启动邮件(cold email)上,当成一个机器学习算法来做,目标指标只有一个:正面回复。流程是批量发邮件,然后分析表现最好和最差的邮件各有什么共性,分别总结成框架。接着用 Claude 做出一个 skill md 文件,写邮件时只用好邮件的共性、完全避开坏邮件的共性,另外还有一个可选的打分 skill,把每封草稿对照历史上所有成功脚本打 1 到 10 分,只有 7 分以上的才投入新 campaign。作者把输出质量归结为数据收集和喂养问题:AI 就是它吃进去的信息的平均值。
#14
@paulljump
https://x.com/paulljump/status/2085889744714543290
作者把一个前沿模型的 agent 循环换成了严格的 matter compiler DAG,底下驱动的是本地跑的 14B Qwen 模型。这套受约束的方案在 harvey C&H 并购基准测试里抓出了全部 12 处差异,只花 8 分钟,硬件就是一台 MacBook Pro。他用一句话总结这个结果:"艺术生于约束、死于自由",主张严格结构胜过开放式的前沿 agent 循环。
https://x.com/paulljump/status/2085889744714543290
作者把一个前沿模型的 agent 循环换成了严格的 matter compiler DAG,底下驱动的是本地跑的 14B Qwen 模型。这套受约束的方案在 harvey C&H 并购基准测试里抓出了全部 12 处差异,只花 8 分钟,硬件就是一台 MacBook Pro。他用一句话总结这个结果:"艺术生于约束、死于自由",主张严格结构胜过开放式的前沿 agent 循环。
#15
@RamKomarraju
https://x.com/RamKomarraju/status/2086130455187796311
作者批评 OpenAI,看起来还有 Anthropic,在 agent harness 的安全性和监控上投入不够。他的证据是:单个 agentic loop(一个总任务,可能派生了子 agent)对 Hugging Face 发起了超过 17000 次攻击,居然没被发现。他强调 harness 本质上就是一个传统程序,最终替 LLM 执行命令和代码的正是这个程序。
https://x.com/RamKomarraju/status/2086130455187796311
作者批评 OpenAI,看起来还有 Anthropic,在 agent harness 的安全性和监控上投入不够。他的证据是:单个 agentic loop(一个总任务,可能派生了子 agent)对 Hugging Face 发起了超过 17000 次攻击,居然没被发现。他强调 harness 本质上就是一个传统程序,最终替 LLM 执行命令和代码的正是这个程序。
#16
@conmanbrew45
https://x.com/conmanbrew45/status/2086016796054765707
作者晒了自己跨两个账号的重度长时 agent 用法:一个会话在 DropHammer 代码库上以 ultracode 模式连跑了约 48 小时,另一个用 xhigh 档位跑 ML 训练,能用 autoresearch 的地方都用上,连跑了约 36 小时。他的 Fable 编排器会话随意派发 Grok 子 agent,还让它们自己再起工作流,外加每次带约 30 个 agent 的一次性任务,结果只用掉每月 Grok 配额的 6%。他还分享了 DH-SWE29 基准的观感:Grok 4.5 打赢了 Opus,在"每个正确解花多少钱"上跟另一个模型不相上下;同时指出 Fable 在间歇性 bug 的根因分析上偏弱。他估算一个编排器会话大概烧了 180 美元的用量,还猜测量化调整可能影响了 Fable 的质量。
https://x.com/conmanbrew45/status/2086016796054765707
作者晒了自己跨两个账号的重度长时 agent 用法:一个会话在 DropHammer 代码库上以 ultracode 模式连跑了约 48 小时,另一个用 xhigh 档位跑 ML 训练,能用 autoresearch 的地方都用上,连跑了约 36 小时。他的 Fable 编排器会话随意派发 Grok 子 agent,还让它们自己再起工作流,外加每次带约 30 个 agent 的一次性任务,结果只用掉每月 Grok 配额的 6%。他还分享了 DH-SWE29 基准的观感:Grok 4.5 打赢了 Opus,在"每个正确解花多少钱"上跟另一个模型不相上下;同时指出 Fable 在间歇性 bug 的根因分析上偏弱。他估算一个编排器会话大概烧了 180 美元的用量,还猜测量化调整可能影响了 Fable 的质量。
#17
@Politas180
https://x.com/Politas180/status/2085988834517405955
作者解读了 Prime Intellect 新开源的编程 harness:模型只有一个真正的工具,就是一个持久化的 IPython 内核,其他一切——文件、shell、子 agent、记忆——全靠模型自己写真实的 Python 代码来实现,而且代码状态跨轮次保留,于是上下文变成了变量,而不只是更多 token。它还有一个持续演化层,可以用 /refine 根据刚发生的事情改进自己的 prompt、skill 和子 agent 规格。作者把它跟 Hermes 归为同一类自我改进路线,但打磨程度不如后者,并且提醒现在的模型没有针对这种设置训练过,子 agent 负载重的时候会显得粗糙。不过已经有人在长时间编程和研究任务上跑出了能用的结果。
https://x.com/Politas180/status/2085988834517405955
作者解读了 Prime Intellect 新开源的编程 harness:模型只有一个真正的工具,就是一个持久化的 IPython 内核,其他一切——文件、shell、子 agent、记忆——全靠模型自己写真实的 Python 代码来实现,而且代码状态跨轮次保留,于是上下文变成了变量,而不只是更多 token。它还有一个持续演化层,可以用 /refine 根据刚发生的事情改进自己的 prompt、skill 和子 agent 规格。作者把它跟 Hermes 归为同一类自我改进路线,但打磨程度不如后者,并且提醒现在的模型没有针对这种设置训练过,子 agent 负载重的时候会显得粗糙。不过已经有人在长时间编程和研究任务上跑出了能用的结果。
#18
@neko23423
https://x.com/neko23423/status/2086091318544244955
作者说自己从 OpenCode 转投了 Prime Agent,一个开源的自我改进 AI 编程 agent。给出的理由是 OpenCode 是聊天优先的设计,而 Prime Agent 是为长时间运行的工作而生。他具体点名的能力有四个:持久化的 IPython、递归子 agent、daemon 会话,以及自我完善的记忆。
https://x.com/neko23423/status/2086091318544244955
作者说自己从 OpenCode 转投了 Prime Agent,一个开源的自我改进 AI 编程 agent。给出的理由是 OpenCode 是聊天优先的设计,而 Prime Agent 是为长时间运行的工作而生。他具体点名的能力有四个:持久化的 IPython、递归子 agent、daemon 会话,以及自我完善的记忆。
#19
@VladBuildsAI
https://x.com/VladBuildsAI/status/2086108908876095668
作者的观点是:不会自我恢复的 AI agent 只是一个非常自信的脚本,产品的核心不是 prompt,而是包在外面的恢复循环。他引了几家厂商正在趋同的文档:OpenAI 描述的会规划、调工具、协作、保持状态的 agent;Temporal 的 OpenAI Agents 集成把 agent 循环放进持久化工作流、模型调用作为 activity;Anthropic 的 Claude Code 子 agent 和 hooks 则是围绕模型的确定性检查。他给小团队提的系统方案有四个盒子:带目标、来源、预算和止损线的请求;限定范围的工具调用;记录输入、成本、输出、决策和责任人的回执;以及一个决定接受、重试、转交还是停止的评估步骤。他认为真正硬的指标是扣除审核、重试、转交失败和救火时间之后的"被接受的产出",而算上清理成本后,一套 400 美元一个月的系统可能比 40 美元的工具还便宜。
https://x.com/VladBuildsAI/status/2086108908876095668
作者的观点是:不会自我恢复的 AI agent 只是一个非常自信的脚本,产品的核心不是 prompt,而是包在外面的恢复循环。他引了几家厂商正在趋同的文档:OpenAI 描述的会规划、调工具、协作、保持状态的 agent;Temporal 的 OpenAI Agents 集成把 agent 循环放进持久化工作流、模型调用作为 activity;Anthropic 的 Claude Code 子 agent 和 hooks 则是围绕模型的确定性检查。他给小团队提的系统方案有四个盒子:带目标、来源、预算和止损线的请求;限定范围的工具调用;记录输入、成本、输出、决策和责任人的回执;以及一个决定接受、重试、转交还是停止的评估步骤。他认为真正硬的指标是扣除审核、重试、转交失败和救火时间之后的"被接受的产出",而算上清理成本后,一套 400 美元一个月的系统可能比 40 美元的工具还便宜。
#20
@arunninghacker
https://x.com/arunninghacker/status/2086000290973581408
作者介绍了某个 agent 产品里的工作流工具,包括 /loop、/goal,还有一个尚未写进文档的 /autoresearch 命令。他给了具体例子:"/loop fix the next security issue and open PR" 就真的会自主修下一个安全问题并开 PR;"/goal set find all mentions of the fact in the library" 则只在 library 相关工具的范围内执行。这算是一份实锤记录:循环执行和目标导向的 autoresearch 工具,已经出现在正式发布的产品里了。
https://x.com/arunninghacker/status/2086000290973581408
作者介绍了某个 agent 产品里的工作流工具,包括 /loop、/goal,还有一个尚未写进文档的 /autoresearch 命令。他给了具体例子:"/loop fix the next security issue and open PR" 就真的会自主修下一个安全问题并开 PR;"/goal set find all mentions of the fact in the library" 则只在 library 相关工具的范围内执行。这算是一份实锤记录:循环执行和目标导向的 autoresearch 工具,已经出现在正式发布的产品里了。
#21
@MartinHN
https://x.com/MartinHN/status/2086034446495432754
作者在 Claude 里用动态工作流跑了一次 autoresearch 实验。做法是给 agent 一组可调参数和一个要优化的目标指标,agent 随后自己起了一批参数扫描,逐一和基线对比。作者最后点名喊话 OpenAI 的开发团队:这个能力你们也来一个。
https://x.com/MartinHN/status/2086034446495432754
作者在 Claude 里用动态工作流跑了一次 autoresearch 实验。做法是给 agent 一组可调参数和一个要优化的目标指标,agent 随后自己起了一批参数扫描,逐一和基线对比。作者最后点名喊话 OpenAI 的开发团队:这个能力你们也来一个。
#22
@proclankers
https://x.com/proclankers/status/2085911663916556666
这是 Grok Build V1.0 的发布公告,一个由 Grok 4.5 驱动的终端编程 agent。它能读写代码库、执行命令、动文件之前先做规划、用 diff 展示改动,还能并行拉起子 agent。它支持 AGENTS.md、skills、插件、hooks 和 MCP 服务器,可以交互式使用、在自动化里无头运行,或者通过 ACP 接到其他应用上。整个项目开源,用户可以直接看 agent 循环的实现、改 harness,或者接上本地模型。
https://x.com/proclankers/status/2085911663916556666
这是 Grok Build V1.0 的发布公告,一个由 Grok 4.5 驱动的终端编程 agent。它能读写代码库、执行命令、动文件之前先做规划、用 diff 展示改动,还能并行拉起子 agent。它支持 AGENTS.md、skills、插件、hooks 和 MCP 服务器,可以交互式使用、在自动化里无头运行,或者通过 ACP 接到其他应用上。整个项目开源,用户可以直接看 agent 循环的实现、改 harness,或者接上本地模型。
#23
@GuaardvarkAI
https://x.com/GuaardvarkAI/status/2086059442995449907
这是一个免费开源、自托管、可离线运行的 AI 工作站(代号 Batman/Joker/Catwoman/Alfred)的发布公告。它包含能看到真实虚拟桌面并操作应用的自主 agent、一个叫 AgentBrain 的三层神经路由器,以及在隔离 git worktree 里并行工作的编程 agent 集群。列出的功能还有 RAG autoresearch、自我改进引擎、用 Wan 2.2 和 CogVideoX 做本地视频生成、4K/8K 超分、音乐和语音生成、MCP 集成,以及一个 70 多个工具的引擎,全部跑在用户自己的硬件上。
https://x.com/GuaardvarkAI/status/2086059442995449907
这是一个免费开源、自托管、可离线运行的 AI 工作站(代号 Batman/Joker/Catwoman/Alfred)的发布公告。它包含能看到真实虚拟桌面并操作应用的自主 agent、一个叫 AgentBrain 的三层神经路由器,以及在隔离 git worktree 里并行工作的编程 agent 集群。列出的功能还有 RAG autoresearch、自我改进引擎、用 Wan 2.2 和 CogVideoX 做本地视频生成、4K/8K 超分、音乐和语音生成、MCP 集成,以及一个 70 多个工具的引擎,全部跑在用户自己的硬件上。
#24
@frankcompanion
https://x.com/frankcompanion/status/2086214929242337656
一份 build-in-public 的进度汇报。今天的成果是 agent 循环和沙箱执行已经稳了。当前的问题是长会话会撞上 worker 超时,导致沙箱连接断掉。作者打算第二天去修任务队列。
https://x.com/frankcompanion/status/2086214929242337656
一份 build-in-public 的进度汇报。今天的成果是 agent 循环和沙箱执行已经稳了。当前的问题是长会话会撞上 worker 超时,导致沙箱连接断掉。作者打算第二天去修任务队列。
#25
@foursignalsdev
https://x.com/foursignalsdev/status/2086059910664507552
报告 Prime Agent 已开源,定位是一个跨会话保持状态的自我改进编程 agent。它的 Recursive Language Model 设计把子 agent 当成持久化 IPython 环境里的函数调用。帖子附了详情链接。
https://x.com/foursignalsdev/status/2086059910664507552
报告 Prime Agent 已开源,定位是一个跨会话保持状态的自我改进编程 agent。它的 Recursive Language Model 设计把子 agent 当成持久化 IPython 环境里的函数调用。帖子附了详情链接。
#26
@ultrathinktrash
https://x.com/ultrathinktrash/status/2086181075101847726
作者做了个地理位置对比实验:同一个 10 轮串行 agent 循环,分别从蒙巴萨和阿什本发起,prompt 相同、低推理档位、每组跑 5 次。结果阿什本这边 Claude 快 4.4 秒,Codex 快 8.4 秒。折算下来每次模型/工具循环迭代大约差 0.4 到 0.8 秒,作者提醒这个差距在长时间任务里会不断累积。
https://x.com/ultrathinktrash/status/2086181075101847726
作者做了个地理位置对比实验:同一个 10 轮串行 agent 循环,分别从蒙巴萨和阿什本发起,prompt 相同、低推理档位、每组跑 5 次。结果阿什本这边 Claude 快 4.4 秒,Codex 快 8.4 秒。折算下来每次模型/工具循环迭代大约差 0.4 到 0.8 秒,作者提醒这个差距在长时间任务里会不断累积。
#27
@KUNDAN31564313
https://x.com/KUNDAN31564313/status/2086159937860985040
一份朝着高级 AI 工程方向努力的第 12 天学习日志。作者做了一个生产级的信息提取工具,并实现了带验证反馈的修复循环。他正确区分并处理了截断和 JSON 错误这两类问题,实现了完整的 agent 循环,还用 USER_QUERY、TOOL_RESPONSE 这类标签把上下文结构化了。
https://x.com/KUNDAN31564313/status/2086159937860985040
一份朝着高级 AI 工程方向努力的第 12 天学习日志。作者做了一个生产级的信息提取工具,并实现了带验证反馈的修复循环。他正确区分并处理了截断和 JSON 错误这两类问题,实现了完整的 agent 循环,还用 USER_QUERY、TOOL_RESPONSE 这类标签把上下文结构化了。
#28
@polsia
https://x.com/polsia/status/2085883440617120136
介绍 Solewire,瞄准球鞋转卖市场——作者估计这个市场有 300 亿美元规模,如今基本靠手工操作,分散在抢购 bot、cook-group、验货排队和上架后台之间。Solewire 要把这一切收进一个自主 agent 循环里,买入、定价、发货全程无人参与。产品宣布即将上线,所以这是发布前的预告,不是已交付的成果。
https://x.com/polsia/status/2085883440617120136
介绍 Solewire,瞄准球鞋转卖市场——作者估计这个市场有 300 亿美元规模,如今基本靠手工操作,分散在抢购 bot、cook-group、验货排队和上架后台之间。Solewire 要把这一切收进一个自主 agent 循环里,买入、定价、发货全程无人参与。产品宣布即将上线,所以这是发布前的预告,不是已交付的成果。
#29
@Alefratello1982
https://x.com/Alefratello1982/status/2086014564513026119
作者的观点是:更好的模型救不了糟糕的 agent harness,然后指向 Prime Intellect 刚发布的 Prime Agent。这个工具为编程 agent 提供持久化 REPL、自我改进的 skill,以及可恢复的长时间会话。作者推荐给那些做的东西超出一次性任务范畴的人,并附上了仓库链接。
https://x.com/Alefratello1982/status/2086014564513026119
作者的观点是:更好的模型救不了糟糕的 agent harness,然后指向 Prime Intellect 刚发布的 Prime Agent。这个工具为编程 agent 提供持久化 REPL、自我改进的 skill,以及可恢复的长时间会话。作者推荐给那些做的东西超出一次性任务范畴的人,并附上了仓库链接。
#30
@therealKausik
https://x.com/therealKausik/status/2086161111670468807
作者让一个他称为 v4 flash 的模型帮忙重新校准 SSD 并调 BIOS 设置。agent 干完活后,自己意识到需要重启才能验证改动是否生效,于是写了个脚本:重启后自动重开终端和当前会话,并给自己发一条 prompt 接着干。结果真的成功了。作者说他从没见过哪个前沿模型能自己想出办法,让 agent 循环跨越一次必须的重启后自动续上。
https://x.com/therealKausik/status/2086161111670468807
作者让一个他称为 v4 flash 的模型帮忙重新校准 SSD 并调 BIOS 设置。agent 干完活后,自己意识到需要重启才能验证改动是否生效,于是写了个脚本:重启后自动重开终端和当前会话,并给自己发一条 prompt 接着干。结果真的成功了。作者说他从没见过哪个前沿模型能自己想出办法,让 agent 循环跨越一次必须的重启后自动续上。
#31
@bullbear_info
https://x.com/bullbear_info/status/2086031609372057726
作者上周写了一个 agentic loop,这次汇报了一个具体的翻车案例。agent 凭空幻觉出一个不存在的数据库 schema,然后拿着它跑了两个小时。等作者发现的时候,这一趟已经烧掉了 50 美元的 token。对于自主循环的失败成本,这是个很有参考价值的真实案例。
https://x.com/bullbear_info/status/2086031609372057726
作者上周写了一个 agentic loop,这次汇报了一个具体的翻车案例。agent 凭空幻觉出一个不存在的数据库 schema,然后拿着它跑了两个小时。等作者发现的时候,这一趟已经烧掉了 50 美元的 token。对于自主循环的失败成本,这是个很有参考价值的真实案例。
#32
@janifica
https://x.com/janifica/status/2086120261711958304
一篇关于 Prime Agent(PrimeIntellect-ai/prime-agent)的详细解读。这是一个开源 TypeScript 项目,当前版本 v0.7.1,围绕递归语言模型(recursive language model)的思路来做编程工作流。它用 IPython 作为持久化的控制环境,通过 rlm() 调用支持递归子 agent,断线后能保持会话状态,并且把展示层、执行层和持久化层分开。作者认为它对长时间运行的 AI agent、子 agent 协调和持久化 Python 环境这几个方向都有参考价值。
https://x.com/janifica/status/2086120261711958304
一篇关于 Prime Agent(PrimeIntellect-ai/prime-agent)的详细解读。这是一个开源 TypeScript 项目,当前版本 v0.7.1,围绕递归语言模型(recursive language model)的思路来做编程工作流。它用 IPython 作为持久化的控制环境,通过 rlm() 调用支持递归子 agent,断线后能保持会话状态,并且把展示层、执行层和持久化层分开。作者认为它对长时间运行的 AI agent、子 agent 协调和持久化 Python 环境这几个方向都有参考价值。
#33
@LeoOliemans91
https://x.com/LeoOliemans91/status/2085965167032934856
关于自我改进循环的一个方法论观点:真正有意思的失败模式不是某一次糟糕的优化,而是自我改进循环可能会篡改它自己赖以判断的那份状态证据。作者的对策是给每个动作限定目的和范围,然后先验证动作产生的源状态,确认无误再喂回循环。这是一个避免自主 agent 反馈污染的具体设计模式。
https://x.com/LeoOliemans91/status/2085965167032934856
关于自我改进循环的一个方法论观点:真正有意思的失败模式不是某一次糟糕的优化,而是自我改进循环可能会篡改它自己赖以判断的那份状态证据。作者的对策是给每个动作限定目的和范围,然后先验证动作产生的源状态,确认无误再喂回循环。这是一个避免自主 agent 反馈污染的具体设计模式。
#34
@Colelioenz
https://x.com/Colelioenz/status/2086208994742358118
作者把原型和实验当成几乎免费的东西:让 Luna 模型在一夜之间探索 10 到 20 条可能的路径或方法,第二天挑最好的。他报告说 auto-research 配 5.3-Codex 效果很好,而 Luna Max 打赢了 5.4 XHigh。他还在网页检索和研究任务上把 Luna 和 Sol 做了大量对比测试:Luna 准确性差一些,偶尔还会卡在循环里出不来,但便宜足以弥补这些缺点。最妙的一招是让 Luna 拿着聊天会话 ID 去找一个 Sol 会话讨教,这种组合经常比单用任何一个模型效果更好,用量还更省。
https://x.com/Colelioenz/status/2086208994742358118
作者把原型和实验当成几乎免费的东西:让 Luna 模型在一夜之间探索 10 到 20 条可能的路径或方法,第二天挑最好的。他报告说 auto-research 配 5.3-Codex 效果很好,而 Luna Max 打赢了 5.4 XHigh。他还在网页检索和研究任务上把 Luna 和 Sol 做了大量对比测试:Luna 准确性差一些,偶尔还会卡在循环里出不来,但便宜足以弥补这些缺点。最妙的一招是让 Luna 拿着聊天会话 ID 去找一个 Sol 会话讨教,这种组合经常比单用任何一个模型效果更好,用量还更省。
#35
@marckaz
https://x.com/marckaz/status/2086136195055026350
介绍一个框架,核心卖点是交付可组合的 Python 代码,而不是脆弱的 prompt。它提供针对分类器、RAG 和 agent 循环的自动优化、由声明式 LM 调用搭成的自我改进管线,以及有研究支撑的 prompt 演化能力。作者把它定位成:像对待真正的软件组件一样对待语言模型。
https://x.com/marckaz/status/2086136195055026350
介绍一个框架,核心卖点是交付可组合的 Python 代码,而不是脆弱的 prompt。它提供针对分类器、RAG 和 agent 循环的自动优化、由声明式 LM 调用搭成的自我改进管线,以及有研究支撑的 prompt 演化能力。作者把它定位成:像对待真正的软件组件一样对待语言模型。
#36
@TheMishmashCat
https://x.com/TheMishmashCat/status/2086040448435417265
这是一个长帖的一部分,讲的是 2026 年 7 月 xAI 把整个 Grok Build harness 开源了。这次开源放出了几十万行 Rust 代码,覆盖 agent 循环、工具分发、TUI 渲染、计划审阅、diff 查看器、skills 系统和子 agent 编排。作者的建议是:想搞清楚 harness 到底怎么工作,直接看源码就是最权威的参考。
https://x.com/TheMishmashCat/status/2086040448435417265
这是一个长帖的一部分,讲的是 2026 年 7 月 xAI 把整个 Grok Build harness 开源了。这次开源放出了几十万行 Rust 代码,覆盖 agent 循环、工具分发、TUI 渲染、计划审阅、diff 查看器、skills 系统和子 agent 编排。作者的建议是:想搞清楚 harness 到底怎么工作,直接看源码就是最权威的参考。
#37
@camale0nrar0
https://x.com/camale0nrar0/status/2086144228648722564
描述了一套真实生产环境的 agent 安全方案,场景是 agent 从聊天界面查询线上数据。团队把 agent 的查询全部路由到隔离的 service role 上,并配了很紧的执行超时,这样 agent 循环就算失控也删不了表。他们还指出写权限必须配上严格的行级安全(row-level security),最后问大家:生产环境连接器的安全沙箱,你们都是怎么做的?
https://x.com/camale0nrar0/status/2086144228648722564
描述了一套真实生产环境的 agent 安全方案,场景是 agent 从聊天界面查询线上数据。团队把 agent 的查询全部路由到隔离的 service role 上,并配了很紧的执行超时,这样 agent 循环就算失控也删不了表。他们还指出写权限必须配上严格的行级安全(row-level security),最后问大家:生产环境连接器的安全沙箱,你们都是怎么做的?
#38
@NeuralNotwork
https://x.com/NeuralNotwork/status/2086158327860355557
作者被手动追新闻追到精疲力尽,于是搭了一个 agentic loop,每周自动整理出一份"过去一周我需要知道的科技新闻"简报。他还把这份简报通过链接开放给了所有人。这是自主循环在非编程场景的一个具体应用:内容生产。
https://x.com/NeuralNotwork/status/2086158327860355557
作者被手动追新闻追到精疲力尽,于是搭了一个 agentic loop,每周自动整理出一份"过去一周我需要知道的科技新闻"简报。他还把这份简报通过链接开放给了所有人。这是自主循环在非编程场景的一个具体应用:内容生产。
#39
@RicaChan_01
https://x.com/RicaChan_01/status/2086191334004605257
一份关于 AuxloNeo 的具体开发报告:这是一个跑在 Cloudflare Worker 上、用 Telegram 控制的 TypeScript agent。作者把 Gemini 换成了 Poolside Laguna,并通过一个 MUSCLE service binding 解决了同区域 Worker 调 Worker 的问题。现在冷启动不会再干掉 agent 循环了,作者最后问:还有谁也在跟 Worker 之间的调用延迟搏斗?
https://x.com/RicaChan_01/status/2086191334004605257
一份关于 AuxloNeo 的具体开发报告:这是一个跑在 Cloudflare Worker 上、用 Telegram 控制的 TypeScript agent。作者把 Gemini 换成了 Poolside Laguna,并通过一个 MUSCLE service binding 解决了同区域 Worker 调 Worker 的问题。现在冷启动不会再干掉 agent 循环了,作者最后问:还有谁也在跟 Worker 之间的调用延迟搏斗?
📡 生态产品雷达
生态产品雷达
今天提及 3 次以上的产品/工具/框架:
Prime Agent / Prime Intellect - 今天的主导发布,跑在持久 IPython 内核上的开源自改进 RLM 编码 agent
Claude Code / Anthropic - 大多数循环讨论里的参照 harness,托管版 Managed Agents 已上线
Hermes - Prime Agent 被反复拿来对比的完成度标杆
LangChain - 四层嵌套循环方法论,Managed Deep Agents 进入公测
Fable 5 - 36-48 小时 autoresearch 长会话里的编排模型
Codex - 延迟和成本基准测试里的对照组
DeepSeek v4 Pro / Flash - AI 协作物理论文里的意外主力
Hugging Face - 三条 harness 安全帖引用的 1.7 万次攻击事件目标
IPython - 新一代 agent 核心的持久内核模式
Grok Build / Grok 4.5 - xAI 已完全开源的 harness 及其模型
今天提及 3 次以上的产品/工具/框架:
Prime Agent / Prime Intellect - 今天的主导发布,跑在持久 IPython 内核上的开源自改进 RLM 编码 agent
Claude Code / Anthropic - 大多数循环讨论里的参照 harness,托管版 Managed Agents 已上线
Hermes - Prime Agent 被反复拿来对比的完成度标杆
LangChain - 四层嵌套循环方法论,Managed Deep Agents 进入公测
Fable 5 - 36-48 小时 autoresearch 长会话里的编排模型
Codex - 延迟和成本基准测试里的对照组
DeepSeek v4 Pro / Flash - AI 协作物理论文里的意外主力
Hugging Face - 三条 harness 安全帖引用的 1.7 万次攻击事件目标
IPython - 新一代 agent 核心的持久内核模式
Grok Build / Grok 4.5 - xAI 已完全开源的 harness 及其模型
评论