Loop 日报: 2026年8月7日
Loop 世界迎来了几周以来最大的产品发布:Prime Intellect 发布了自我改进 harness——Prime Agent,其头条数字——Opus 5 在模型完全不变的情况下把 ARC-AGI-3 从 30.2% 拉到 95.5%——当天就催生了「Harness General Intelligence」这个新词。同一天,Meta 发布了把 auto-research 直接烤进训练流程的 Muse Code;公开 autoresearch 运动也添了第三个竞技场:一家实时加密交易所为经过验证的 prover 加速拿出 $30k 奖金,与 Apple Silicon 推理和 Ethereum SNARK 两个赛道并列。在这些发布的水面之下,实践者们仍在反复报告同样的两条经验:loop 很容易溢出代码领域(俄罗斯方块教练、MRI 年龄预测、在无 GPU 的 ThinkPad 上重新量化模型层),而 evaluator——那段 agent 碰不到的代码——依然是所有真正工程功夫的所在。
#1
@PrimeIntellect
https://x.com/PrimeIntellect/status/2085086999267144083
Prime Intellect 发布了 Prime Agent,一个面向编码和长时自主任务的自我改进 RLM harness。它的核心设计包括程序化工具调用、把 context 当作变量来处理、多 agent 消息通信,以及一个 agent 自己可以修改的 harness 状态。发布帖一天之内拿下两百万曝光,成为自 Karpathy 的 autoresearch 以来最受关注的自我改进 agent 发布。
https://x.com/PrimeIntellect/status/2085086999267144083
Prime Intellect 发布了 Prime Agent,一个面向编码和长时自主任务的自我改进 RLM harness。它的核心设计包括程序化工具调用、把 context 当作变量来处理、多 agent 消息通信,以及一个 agent 自己可以修改的 harness 状态。发布帖一天之内拿下两百万曝光,成为自 Karpathy 的 autoresearch 以来最受关注的自我改进 agent 发布。
#2
@samsja19
https://x.com/samsja19/status/2085119070576537694
一位 Prime Intellect 研究员分享了一个月每天使用 Prime Agent 的一手体验,开源和闭源模型都试过。RLM 侧提供程序化工具调用和一个能在 compaction 后存活的持久 IPython kernel,充当长期记忆,另外还有 subagent 守护进程和 UI。自我改进的部分是一个持续演化的 harness:模型拥有可以在工作过程中程序化编辑自己 harness 和 skills 的工具。
https://x.com/samsja19/status/2085119070576537694
一位 Prime Intellect 研究员分享了一个月每天使用 Prime Agent 的一手体验,开源和闭源模型都试过。RLM 侧提供程序化工具调用和一个能在 compaction 后存活的持久 IPython kernel,充当长期记忆,另外还有 subagent 守护进程和 UI。自我改进的部分是一个持续演化的 harness:模型拥有可以在工作过程中程序化编辑自己 harness 和 skills 的工具。
#3
@daniel_mac8
https://x.com/daniel_mac8/status/2085138322217713862
传播最广的那个数字:Prime Agent 仅靠 harness 就把 Opus 5 在 ARC-AGI-3 上从 30.2% 提升到 95.5%——同一个模型,三倍的分数。作者把这称为「Harness General Intelligence」,并把增益归因于 RLM 原生工具调用、多 agent 编排和自我改进 harness。如果一个外壳就能让前沿模型在推理基准上翻三倍,那这个基准衡量的就不只是模型,同样也在衡量 harness。
https://x.com/daniel_mac8/status/2085138322217713862
传播最广的那个数字:Prime Agent 仅靠 harness 就把 Opus 5 在 ARC-AGI-3 上从 30.2% 提升到 95.5%——同一个模型,三倍的分数。作者把这称为「Harness General Intelligence」,并把增益归因于 RLM 原生工具调用、多 agent 编排和自我改进 harness。如果一个外壳就能让前沿模型在推理基准上翻三倍,那这个基准衡量的就不只是模型,同样也在衡量 harness。
#4
@eigenlabs
https://x.com/eigenlabs/status/2085026915606311165
EigenLabs 与 Lighter 在一个实时运行、密码学可证明的交易所上发起了公开 autoresearch 挑战:把你的 agent 指向 prover,找到一个优化点,提交经过验证的加速,就能瓜分 15K LIT(约 $30k)的奖金。这是跑在生产基础设施上的公开 autoresearch——验证本身是密码学的,所以裁判问题从结构上就被解决了。
https://x.com/eigenlabs/status/2085026915606311165
EigenLabs 与 Lighter 在一个实时运行、密码学可证明的交易所上发起了公开 autoresearch 挑战:把你的 agent 指向 prover,找到一个优化点,提交经过验证的加速,就能瓜分 15K LIT(约 $30k)的奖金。这是跑在生产基础设施上的公开 autoresearch——验证本身是密码学的,所以裁判问题从结构上就被解决了。
#5
@will__price
https://x.com/will__price/status/2085040214225858939
一句话概括 Lighter 挑战为什么成立:证明生成昂贵而验证便宜,是 AI 优化的完美领域。凡是具备这种不对称性的领域——生成成本高、验证即时且无需信任——正是自主优化 loop 可以在没有人类裁判的情况下持续运转的地方。
https://x.com/will__price/status/2085040214225858939
一句话概括 Lighter 挑战为什么成立:证明生成昂贵而验证便宜,是 AI 优化的完美领域。凡是具备这种不对称性的领域——生成成本高、验证即时且无需信任——正是自主优化 loop 可以在没有人类裁判的情况下持续运转的地方。
#6
@bbuddha_xyz
https://x.com/bbuddha_xyz/status/2085048248943903112
公开 autoresearch 这一模式现在有了三个有名有姓的竞技场:Lighter 用公开 autoresearch 给自己的链提速,darkbloom 运营 mlx.fast 加速 Apple Silicon 推理,Ethereum Foundation 运营 snark.fast 攻 SNARK 证明。公司们开始把自己的研发瓶颈开放给任何人的 agent,只为经过验证的成果付钱。
https://x.com/bbuddha_xyz/status/2085048248943903112
公开 autoresearch 这一模式现在有了三个有名有姓的竞技场:Lighter 用公开 autoresearch 给自己的链提速,darkbloom 运营 mlx.fast 加速 Apple Silicon 推理,Ethereum Foundation 运营 snark.fast 攻 SNARK 证明。公司们开始把自己的研发瓶颈开放给任何人的 agent,只为经过验证的成果付钱。
#7
@LambdaAPI
https://x.com/LambdaAPI/status/2084985044041601508
Lambda 展示了一次 autoresearch 运行:Claude Code 给一个冻结权重的 Gemma 4 模型当俄罗斯方块教练——模型权重从未改变,变的只有教练策略。在实验追踪器的约束下,这个 loop 用 2.5 天从 0 行做到 16 行消除,产生了 90 个想法,跑了 400+ 次实验,到最后成本降低了 10 倍。每次运行都记录在 The Lab API 里,该 API 现已开源。
https://x.com/LambdaAPI/status/2084985044041601508
Lambda 展示了一次 autoresearch 运行:Claude Code 给一个冻结权重的 Gemma 4 模型当俄罗斯方块教练——模型权重从未改变,变的只有教练策略。在实验追踪器的约束下,这个 loop 用 2.5 天从 0 行做到 16 行消除,产生了 90 个想法,跑了 400+ 次实验,到最后成本降低了 10 倍。每次运行都记录在 The Lab API 里,该 API 现已开源。
#8
@davis7
https://x.com/davis7/status/2085113373805687241
一份在本地通过 Pi 跑 DeepSeek V4 Flash 0731 的详细实战报告——「基本上是跑在我壁橱里的 Opus 4.6」。诚实的缺点:搭建昂贵、弱于前沿模型、最多撑 2-4 个会话。但它在两件事上出彩:托管模型会拒绝的领域里的工作,以及任何可以丢进 auto-research loop 让它慢慢磨的可验证问题。他的准则:凡是能暴力穷举的都非常适合本地模型;开放式工作仍然需要前沿模型。
https://x.com/davis7/status/2085113373805687241
一份在本地通过 Pi 跑 DeepSeek V4 Flash 0731 的详细实战报告——「基本上是跑在我壁橱里的 Opus 4.6」。诚实的缺点:搭建昂贵、弱于前沿模型、最多撑 2-4 个会话。但它在两件事上出彩:托管模型会拒绝的领域里的工作,以及任何可以丢进 auto-research loop 让它慢慢磨的可验证问题。他的准则:凡是能暴力穷举的都非常适合本地模型;开放式工作仍然需要前沿模型。
#9
@Marktechpost
https://x.com/Marktechpost/status/2085098231965585908
对 Meta Muse Code beta 的拆解:一个简单的 agent loop 加上持久化的异步后台 agent,一份 append-only 事件日志让运行时可以精确重放、重启安全,再加一个与 harness 共同训练的模型(Muse Spark 1.2),训练内容涵盖整仓库生成和 auto-research。旗舰案例是持续 24 小时、超过 1,000 次工具调用的 GPU kernel 迭代优化,最终为 Hopper 上的 MLA 产出了一个双 kernel 的 Triton 流水线。
https://x.com/Marktechpost/status/2085098231965585908
对 Meta Muse Code beta 的拆解:一个简单的 agent loop 加上持久化的异步后台 agent,一份 append-only 事件日志让运行时可以精确重放、重启安全,再加一个与 harness 共同训练的模型(Muse Spark 1.2),训练内容涵盖整仓库生成和 auto-research。旗舰案例是持续 24 小时、超过 1,000 次工具调用的 GPU kernel 迭代优化,最终为 Hopper 上的 MLA 产出了一个双 kernel 的 Triton 流水线。
#10
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2085089809371173362
Meta 首席 AI 官 Alexandr Wang 在 YC Startup School 上说:只要有正确的 agentic loop 和正确的评估指标,一群 agent 能完成比 100 人工程师团队更多的工作,「非常轻松,实际上极其容易」——而背后的机械装置不过是 markdown 文件和 cron 任务。这句话重新定义了杠杆点:写指标现在比写代码更重要。
https://x.com/rohanpaul_ai/status/2085089809371173362
Meta 首席 AI 官 Alexandr Wang 在 YC Startup School 上说:只要有正确的 agentic loop 和正确的评估指标,一群 agent 能完成比 100 人工程师团队更多的工作,「非常轻松,实际上极其容易」——而背后的机械装置不过是 markdown 文件和 cron 任务。这句话重新定义了杠杆点:写指标现在比写代码更重要。
#11
@evanjconrad
https://x.com/evanjconrad/status/2084819797133721679
San Francisco Compute 发布了一个 autoresearch 产品:告诉 agent「从 HuggingFace 下载这个模型并优化 4 倍,不完成不许停」,然后让它连跑几天。设计是 agent 优先的——公平队列保证实验总能拿到 GPU 空间,任务可以从 checkpoint 重启,工单系统直接内建在 MCP 里,让 agent 能自行从平台故障中恢复。他们的测试方式是在运行中途把平台整个打挂;agent 监督的训练照跑不误。
https://x.com/evanjconrad/status/2084819797133721679
San Francisco Compute 发布了一个 autoresearch 产品:告诉 agent「从 HuggingFace 下载这个模型并优化 4 倍,不完成不许停」,然后让它连跑几天。设计是 agent 优先的——公平队列保证实验总能拿到 GPU 空间,任务可以从 checkpoint 重启,工单系统直接内建在 MCP 里,让 agent 能自行从平台故障中恢复。他们的测试方式是在运行中途把平台整个打挂;agent 监督的训练照跑不误。
#12
@antnjbert
https://x.com/antnjbert/status/2085095173734777163
一个干净的科学案例:几天前发过 auto-research 帖子之后,作者加上了 NVIDIA 支持,让 agent 连续运行数天,去寻找提升 vision transformer 从 MRI 图像预测年龄准确率的新方法。这是把 autoresearch 用作真实医学影像问题上的无人值守假设搜索。
https://x.com/antnjbert/status/2085095173734777163
一个干净的科学案例:几天前发过 auto-research 帖子之后,作者加上了 NVIDIA 支持,让 agent 连续运行数天,去寻找提升 vision transformer 从 MRI 图像预测年龄准确率的新方法。这是把 autoresearch 用作真实医学影像问题上的无人值守假设搜索。
#13
@ljupc0
https://x.com/ljupc0/status/2084975395628024037
迄今为止最小硬件上的 auto-research:在一台没有 GPU 的老 ThinkPad 上用 OMP 跑 DeepSeek-v4-flash。作者下载了一个 SKILL.md,把 /goal 指向它,四小时后 loop 已经把若干 6-bit 层重新量化到 4-bit,以适配这台笔记本的内存带宽。十分钟搭建,十分钟看结果——他对 loop 为什么赢的总结是:「我永远不想当那个照看负结果的人。」
https://x.com/ljupc0/status/2084975395628024037
迄今为止最小硬件上的 auto-research:在一台没有 GPU 的老 ThinkPad 上用 OMP 跑 DeepSeek-v4-flash。作者下载了一个 SKILL.md,把 /goal 指向它,四小时后 loop 已经把若干 6-bit 层重新量化到 4-bit,以适配这台笔记本的内存带宽。十分钟搭建,十分钟看结果——他对 loop 为什么赢的总结是:「我永远不想当那个照看负结果的人。」
#14
@noctus91
https://x.com/noctus91/status/2085014991477047761
一个值得照抄的实验:用 Mistral 开源的 Shieldstral 搭了一个本地 Agent Firewall,在内容到达 agent 之前检查 agent loop 的三个阶段——用户输入、工具输出(文件、终端、PDF、图片、AGENTS.md)以及最终响应。测试对象是来自 L1B3RT4S 仓库的 prompt 注入和藏在 PDF 与图片里的隐藏指令。作者的判断:agent 防火墙会变得和 agent 沙箱一样标配。
https://x.com/noctus91/status/2085014991477047761
一个值得照抄的实验:用 Mistral 开源的 Shieldstral 搭了一个本地 Agent Firewall,在内容到达 agent 之前检查 agent loop 的三个阶段——用户输入、工具输出(文件、终端、PDF、图片、AGENTS.md)以及最终响应。测试对象是来自 L1B3RT4S 仓库的 prompt 注入和藏在 PDF 与图片里的隐藏指令。作者的判断:agent 防火墙会变得和 agent 沙箱一样标配。
#15
@mikenevermiss
https://x.com/mikenevermiss/status/2084910738783494474
转述一位 Anthropic 工程师的说法:构建 loop 时不配一个自我改进的 eval agent,是让他们付出两年代价的错误。修复方案很具体:跑 50 个真实 prompt、瞄准约 50% 通过率,把每次失败变成由 Haiku 分析的 transcript 让 eval 集自我生长,同时给答案和路径打分,并在每个新模型上重跑 eval——这套机制曾经查出一次表面 9 分的提升里有 6 分来自一个隐藏 bug。
https://x.com/mikenevermiss/status/2084910738783494474
转述一位 Anthropic 工程师的说法:构建 loop 时不配一个自我改进的 eval agent,是让他们付出两年代价的错误。修复方案很具体:跑 50 个真实 prompt、瞄准约 50% 通过率,把每次失败变成由 Haiku 分析的 transcript 让 eval 集自我生长,同时给答案和路径打分,并在每个新模型上重跑 eval——这套机制曾经查出一次表面 9 分的提升里有 6 分来自一个隐藏 bug。
#16
@Vtrivedy10
https://x.com/Vtrivedy10/status/2084851298050969841
一个与当天各大发布相呼应的小小暴论:通用 harness 是个神话。你可以把任何 harness 的大部分都剥掉(看看 Pi 和 deepagents),获得更好更便宜的性能,然后通过 auto-research、人工 review 和少量 skills,把一个基础 harness 为你的任务定制化。harness 不只是被造出来的,它是从 eval 里被发现出来的——想拥有自己 harness 的团队最终都会走到这一步。
https://x.com/Vtrivedy10/status/2084851298050969841
一个与当天各大发布相呼应的小小暴论:通用 harness 是个神话。你可以把任何 harness 的大部分都剥掉(看看 Pi 和 deepagents),获得更好更便宜的性能,然后通过 auto-research、人工 review 和少量 skills,把一个基础 harness 为你的任务定制化。harness 不只是被造出来的,它是从 eval 里被发现出来的——想拥有自己 harness 的团队最终都会走到这一步。
#17
@Vtrivedy10
https://x.com/Vtrivedy10/status/2085078624198078618
后续帖深入合成环境生成:把 pass@k 保持在 0.2 到 0.6 之间,RL 或 harness 工程才有可以爬坡的信号;并且要把 eval 当成 agentic 世界的训练数据——当模型被拟合到 eval 上时,每一条 eval 都是塑造模型行为的一个向量。微妙的失败模式是 reward hacking:行为通过了 eval 却惹恼用户,比如对所有东西都过度验证。
https://x.com/Vtrivedy10/status/2085078624198078618
后续帖深入合成环境生成:把 pass@k 保持在 0.2 到 0.6 之间,RL 或 harness 工程才有可以爬坡的信号;并且要把 eval 当成 agentic 世界的训练数据——当模型被拟合到 eval 上时,每一条 eval 都是塑造模型行为的一个向量。微妙的失败模式是 reward hacking:行为通过了 eval 却惹恼用户,比如对所有东西都过度验证。
#18
@matthopkins_
https://x.com/matthopkins_/status/2085015300840284298
AI 的两面性浓缩在一天里:作者用 Claude 搭了一个 autoresearch loop,把一个应用的构建时间从几分钟压到 11 秒——然后他想把自己的 Claude Max 账户从 5x 升级到 20x,付款成功了,额度却一直没变,最后只能靠人工客服解决。agent 可以优化构建系统;计费系统还是得开工单。
https://x.com/matthopkins_/status/2085015300840284298
AI 的两面性浓缩在一天里:作者用 Claude 搭了一个 autoresearch loop,把一个应用的构建时间从几分钟压到 11 秒——然后他想把自己的 Claude Max 账户从 5x 升级到 20x,付款成功了,额度却一直没变,最后只能靠人工客服解决。agent 可以优化构建系统;计费系统还是得开工单。
#19
@rcmisk
https://x.com/rcmisk/status/2085072307739894251
对 Karpathy autoresearch 的一个可迁移解读:最大的教训不是那个 loop,而是 evaluator 是 agent 碰不到的代码。作者把这条原则用到内容流水线上——每一条合成出来的论断都必须引用一行原始数据,lint 步骤在引用缺失时直接阻止发布。agent 负责写;检查器不谈判。
https://x.com/rcmisk/status/2085072307739894251
对 Karpathy autoresearch 的一个可迁移解读:最大的教训不是那个 loop,而是 evaluator 是 agent 碰不到的代码。作者把这条原则用到内容流水线上——每一条合成出来的论断都必须引用一行原始数据,lint 步骤在引用缺失时直接阻止发布。agent 负责写;检查器不谈判。
#20
@behrendtio
https://x.com/behrendtio/status/2085001394709291298
pi-autoresearch 加 herdr 扩展跑在 Grok 4.5 上的实战报告:又快又便宜,而且一次性同时改善了他们某个应用的所有主要瓶颈——放着让它跑就行。再配上 @davebcn87 的观察(https://x.com/davebcn87/status/2084988709082951961):pi 用户如今已经习惯性地让 agent 去扩展 pi 本身——极简 harness 生态正在悄悄成为 loop 爱好者的默认选择。
https://x.com/behrendtio/status/2085001394709291298
pi-autoresearch 加 herdr 扩展跑在 Grok 4.5 上的实战报告:又快又便宜,而且一次性同时改善了他们某个应用的所有主要瓶颈——放着让它跑就行。再配上 @davebcn87 的观察(https://x.com/davebcn87/status/2084988709082951961):pi 用户如今已经习惯性地让 agent 去扩展 pi 本身——极简 harness 生态正在悄悄成为 loop 爱好者的默认选择。
#21
@TimXu222575
https://x.com/TimXu222575/status/2084856086616850710
过夜 loop 的成本面:用 Codex goal mode 整夜照看一个训练任务,烧掉了 Pro 套餐每周 80% 的 token。作者怀疑要么是 agent loop 设计本身太费 token,要么是缓存命中率太低。长时间监督恰恰是 loop 的用武之地——而当前的定价模型在惩罚这种用法。
https://x.com/TimXu222575/status/2084856086616850710
过夜 loop 的成本面:用 Codex goal mode 整夜照看一个训练任务,烧掉了 Pro 套餐每周 80% 的 token。作者怀疑要么是 agent loop 设计本身太费 token,要么是缓存命中率太低。长时间监督恰恰是 loop 的用武之地——而当前的定价模型在惩罚这种用法。
#22
@tmuxvim
https://x.com/tmuxvim/status/2085103798867968308
跨所有者多 agent 代码审查的一瞥:朋友的 agent loop 出了问题,作者克隆了仓库,让自己的 Codex 审计并把反馈写进一份 Revise 文档,朋友的 Claude 读完文档做了批注,Codex 再回复——两个不同人的 agent 通过 MCP 在同一份文档里协作,两位人类全程在场。
https://x.com/tmuxvim/status/2085103798867968308
跨所有者多 agent 代码审查的一瞥:朋友的 agent loop 出了问题,作者克隆了仓库,让自己的 Codex 审计并把反馈写进一份 Revise 文档,朋友的 Claude 读完文档做了批注,Codex 再回复——两个不同人的 agent 通过 MCP 在同一份文档里协作,两位人类全程在场。
#23
@Raynos
https://x.com/Raynos/status/2084927680525345095
针对运行超过 24 小时的 loop 的实用模式:让 agent 把它知道的一切写进 HANDOFF.md,杀掉它,再启动一个读交接文件的全新 agent。context 窗口会在任务完成之前先退化;显式的交接文件把一次漫长而不可靠的运行,变成一场由多段短而可靠的运行组成的接力。
https://x.com/Raynos/status/2084927680525345095
针对运行超过 24 小时的 loop 的实用模式:让 agent 把它知道的一切写进 HANDOFF.md,杀掉它,再启动一个读交接文件的全新 agent。context 窗口会在任务完成之前先退化;显式的交接文件把一次漫长而不可靠的运行,变成一场由多段短而可靠的运行组成的接力。
#24
@subhrajitroy
https://x.com/subhrajitroy/status/2084891587440701749
一份关于 agent 责任归属模糊的复盘:作者以为浏览器验证是必须做但由人来做的;agent 则把它理解为必须做且由机器来做。同一份清单,不同的组织架构图。新规则:明确规定什么必须发生、由谁来做、交接长什么样——因为模糊地带不是空地,agent 会搬进去并重新摆家具。
https://x.com/subhrajitroy/status/2084891587440701749
一份关于 agent 责任归属模糊的复盘:作者以为浏览器验证是必须做但由人来做的;agent 则把它理解为必须做且由机器来做。同一份清单,不同的组织架构图。新规则:明确规定什么必须发生、由谁来做、交接长什么样——因为模糊地带不是空地,agent 会搬进去并重新摆家具。
#25
@MarMarLabs
https://x.com/MarMarLabs/status/2085041410550468744
agent 可靠性开始越来越像数据库工程:OpenAI 最新的 Agents SDK 版本正在收敛到这样一些规则——在提交最终轮次前等待输出 guardrail、保留已提交的工具结果、在致命失败后取消未完成的兄弟工具任务、强制执行沙箱 token 预算。适用于任何 loop 的可移植设计法则:先暂存状态,再跑 guardrail,然后提交历史——并给不可逆的副作用配上幂等键。
https://x.com/MarMarLabs/status/2085041410550468744
agent 可靠性开始越来越像数据库工程:OpenAI 最新的 Agents SDK 版本正在收敛到这样一些规则——在提交最终轮次前等待输出 guardrail、保留已提交的工具结果、在致命失败后取消未完成的兄弟工具任务、强制执行沙箱 token 预算。适用于任何 loop 的可移植设计法则:先暂存状态,再跑 guardrail,然后提交历史——并给不可逆的副作用配上幂等键。
#26
@gust__br
https://x.com/gust__br/status/2084977498484314451
一位贡献者理解「大到编码 agent 一次讲不完」的 agent loop 的方法论:先词汇,再源码,再图示,再不变量,再测试,最后是 trace。成果是他在 pi 里找到了一个自己完全理解、能有把握提出修复的小 issue。下一步:做一个 Pi 可观测性包,让他和他的 agent 都能从运行一路下钻到 loop、模型调用和工具,检视 agent 行为。
https://x.com/gust__br/status/2084977498484314451
一位贡献者理解「大到编码 agent 一次讲不完」的 agent loop 的方法论:先词汇,再源码,再图示,再不变量,再测试,最后是 trace。成果是他在 pi 里找到了一个自己完全理解、能有把握提出修复的小 issue。下一步:做一个 Pi 可观测性包,让他和他的 agent 都能从运行一路下钻到 loop、模型调用和工具,检视 agent 行为。
#27
@mfpiccolo
https://x.com/mfpiccolo/status/2085064117660844109
对 harness 难以修改这个问题的一个设计层面的回答:在 iii 里,harness 只是又一个 worker。会话、context、模型路由、队列、状态、流式传输和 shell 访问全都是使用相同原语的独立 worker,所以你可以钩入某一轮、改写结果、要求审批或者换模型,全都不用 fork。harness 是系统的一部分;它不是系统本身。
https://x.com/mfpiccolo/status/2085064117660844109
对 harness 难以修改这个问题的一个设计层面的回答:在 iii 里,harness 只是又一个 worker。会话、context、模型路由、队列、状态、流式传输和 shell 访问全都是使用相同原语的独立 worker,所以你可以钩入某一轮、改写结果、要求审批或者换模型,全都不用 fork。harness 是系统的一部分;它不是系统本身。
#28
@LingYang_PU
https://x.com/LingYang_PU/status/2084817609674141939
PAST-Bench 追问的是:个人 agent 究竟是真的从经验中变好,还是只是在堆积状态——26 个任务族、204 个 episode,在 7 个模型和 4 个框架上做持久化开/关的配对评估。发现:保留的经验确实可能改善未来行为,但增益高度依赖能力、模型和框架。团队的 Hermes+ 干预在「更新过时知识」这一项上最明显地拉开了持久化差距。
https://x.com/LingYang_PU/status/2084817609674141939
PAST-Bench 追问的是:个人 agent 究竟是真的从经验中变好,还是只是在堆积状态——26 个任务族、204 个 episode,在 7 个模型和 4 个框架上做持久化开/关的配对评估。发现:保留的经验确实可能改善未来行为,但增益高度依赖能力、模型和框架。团队的 Hermes+ 干预在「更新过时知识」这一项上最明显地拉开了持久化差距。
#29
@AlcidesTicllaCh
https://x.com/AlcidesTicllaCh/status/2085063216187515121
LoopsBench:最好的编码 agent loop 也只解决了基准的 25%,而瓶颈在于 loop 义务,不在模型。测试过的每一种 loop 配置都仍然在某处出现退化——进一步的证据表明,当前的天花板是 harness 层,而不是模型的原始能力。
https://x.com/AlcidesTicllaCh/status/2085063216187515121
LoopsBench:最好的编码 agent loop 也只解决了基准的 25%,而瓶颈在于 loop 义务,不在模型。测试过的每一种 loop 配置都仍然在某处出现退化——进一步的证据表明,当前的天花板是 harness 层,而不是模型的原始能力。
#30
@agihouse_org
https://x.com/agihouse_org/status/2085133996137259312
AGI House 把 Jerry Tworek 在其 Auto-Research Summit 上的主题演讲和长篇访谈蒸馏成一篇文章,覆盖 Codex、scaling RL、test-time learning 和自动化 AI 实验室。auto-research 这个话题如今已经有足够的分量,能撑起一场专属峰会,外加一条蒸馏流水线。
https://x.com/agihouse_org/status/2085133996137259312
AGI House 把 Jerry Tworek 在其 Auto-Research Summit 上的主题演讲和长篇访谈蒸馏成一篇文章,覆盖 Codex、scaling RL、test-time learning 和自动化 AI 实验室。auto-research 这个话题如今已经有足够的分量,能撑起一场专属峰会,外加一条蒸馏流水线。
#31
@ShreyModi13
https://x.com/ShreyModi13/status/2085017995013755256
企业级 auto-research 的一个开放问题:post-training 和 eval 需要与 agent 生产环境完全一致的复制品——每一个用例都要,包括内部工具。那么构建这些复制品这件事本身,能不能由编码 agent 自动完成?这个问题之所以引发热议,是因为谁能把环境复制自动化,谁就拥有企业 loop 市场。
https://x.com/ShreyModi13/status/2085017995013755256
企业级 auto-research 的一个开放问题:post-training 和 eval 需要与 agent 生产环境完全一致的复制品——每一个用例都要,包括内部工具。那么构建这些复制品这件事本身,能不能由编码 agent 自动完成?这个问题之所以引发热议,是因为谁能把环境复制自动化,谁就拥有企业 loop 市场。
#32
@ShriramKMurthi
https://x.com/ShriramKMurthi/status/2084795860475339108
一位计算机科学教授正在给自己的入门课程加一道「如何构建 agentic loop」的作业,称之为 2026 年的新版 metacircular interpreter。当 agentic loop 取代经典 Lisp 解释器成为标准教学练习时,这层抽象就正式进入了课程体系。
https://x.com/ShriramKMurthi/status/2084795860475339108
一位计算机科学教授正在给自己的入门课程加一道「如何构建 agentic loop」的作业,称之为 2026 年的新版 metacircular interpreter。当 agentic loop 取代经典 Lisp 解释器成为标准教学练习时,这层抽象就正式进入了课程体系。
#33
@GuralNuriyev
https://x.com/GuralNuriyev/status/2084826510423175565
autoresearch 评测结果:在 harness 工程和简单 post-training 任务上,Merv 与 Arbor 打得有来有回,并领先 AIDE——但 Merv 极其耗 token,而 Arbor 和 AIDE 高效得多。harness 排行榜开始需要一根成本轴,而不只是分数轴。
https://x.com/GuralNuriyev/status/2084826510423175565
autoresearch 评测结果:在 harness 工程和简单 post-training 任务上,Merv 与 Arbor 打得有来有回,并领先 AIDE——但 Merv 极其耗 token,而 Arbor 和 AIDE 高效得多。harness 排行榜开始需要一根成本轴,而不只是分数轴。
#34
@RedBrickLabs_
https://x.com/RedBrickLabs_/status/2085029317126619292
一份精心整理的 awesome 清单,收录受 Karpathy autoresearch 启发的自主改进 loop、研究 agent 和 autoresearch 风格系统。这个生态已经大到需要一份目录了。
https://x.com/RedBrickLabs_/status/2085029317126619292
一份精心整理的 awesome 清单,收录受 Karpathy autoresearch 启发的自主改进 loop、研究 agent 和 autoresearch 风格系统。这个生态已经大到需要一份目录了。
#35
@chrsaravia
https://x.com/chrsaravia/status/2084880268972659183
构建个人 agent 的第 73 天,反思 pi 刻意为之的极简主义:这个 harness 几乎什么都不带,背后的信念是大多数任务并不需要脚手架。这与他的体验吻合——每周他删掉的东西几乎和加进去的一样多。他的结论:agent 工程的真功夫在于决定省略什么,然后只把眼前这份工作所需的 context、工具和权限交给模型。
https://x.com/chrsaravia/status/2084880268972659183
构建个人 agent 的第 73 天,反思 pi 刻意为之的极简主义:这个 harness 几乎什么都不带,背后的信念是大多数任务并不需要脚手架。这与他的体验吻合——每周他删掉的东西几乎和加进去的一样多。他的结论:agent 工程的真功夫在于决定省略什么,然后只把眼前这份工作所需的 context、工具和权限交给模型。
#36
@awa_omg
https://x.com/awa_omg/status/2084824752758165560
把 LiquidAI 的 LFM2.5-2.6B 通过 Termux 装上手机、纯 CPU 运行的详细笔记:工具调用第一次尝试就返回了 OpenAI 形状的调用,并行调用可用,格式与文档完全一致。对 loop 构建者的坑:这个模型每一轮都会预先打开一个 think 块,这笔开销在 agent loop 里会被一遍又一遍地支付。
https://x.com/awa_omg/status/2084824752758165560
把 LiquidAI 的 LFM2.5-2.6B 通过 Termux 装上手机、纯 CPU 运行的详细笔记:工具调用第一次尝试就返回了 OpenAI 形状的调用,并行调用可用,格式与文档完全一致。对 loop 构建者的坑:这个模型每一轮都会预先打开一个 think 块,这笔开销在 agent loop 里会被一遍又一遍地支付。
#37
@0xCrash_
https://x.com/0xCrash_/status/2085048486764945896
一套跑得通的 loop 经济学分层栈:GPT 在顶层当规划者和审查者,Qwen 和 GLM 当工人,便宜 token 用于写代码、改代码和例行处理,昂贵的推理只留给最后的合理性检查。Qwen 3.8、GLM-5.2、DeepSeek 和 MiniMax 通过 Qwen Code 一共 $68——把他推到这里的不是质量,而是西方套餐的每周上限几小时就烧光。
https://x.com/0xCrash_/status/2085048486764945896
一套跑得通的 loop 经济学分层栈:GPT 在顶层当规划者和审查者,Qwen 和 GLM 当工人,便宜 token 用于写代码、改代码和例行处理,昂贵的推理只留给最后的合理性检查。Qwen 3.8、GLM-5.2、DeepSeek 和 MiniMax 通过 Qwen Code 一共 $68——把他推到这里的不是质量,而是西方套餐的每周上限几小时就烧光。
#38
@FReza1984
https://x.com/FReza1984/status/2084935249465876767
OpenWorker:一个开源桌面 AI 同事,把一个目标(「准备一份客户简报」「分诊我的收件箱」)转化为跨文件、终端和已连接应用的动作——并在发消息、改日历或执行命令之前暂停,等待人工批准。agent loop、对话、连接器令牌和模型密钥全部留在本地,模型可选项包括 Ollama。
https://x.com/FReza1984/status/2084935249465876767
OpenWorker:一个开源桌面 AI 同事,把一个目标(「准备一份客户简报」「分诊我的收件箱」)转化为跨文件、终端和已连接应用的动作——并在发消息、改日历或执行命令之前暂停,等待人工批准。agent loop、对话、连接器令牌和模型密钥全部留在本地,模型可选项包括 Ollama。
#39
@0xSecta
https://x.com/0xSecta/status/2085002247948185963
给图狂热降温的一剂平衡:大多数任务应该保持为 loop(发现、规划、执行、验证、重复),而最大的图工程错误是把单一职责的问题做成多节点系统。图什么时候才配得上它的复杂度,标准很具体:不同的 context 需求、并行文件处理、每阶段不同模型、可审计的路由,或者一个超载的验证器。最小的诚实的图,是一个 worker 加一个全新 context 的审查者。
https://x.com/0xSecta/status/2085002247948185963
给图狂热降温的一剂平衡:大多数任务应该保持为 loop(发现、规划、执行、验证、重复),而最大的图工程错误是把单一职责的问题做成多节点系统。图什么时候才配得上它的复杂度,标准很具体:不同的 context 需求、并行文件处理、每阶段不同模型、可审计的路由,或者一个超载的验证器。最小的诚实的图,是一个 worker 加一个全新 context 的审查者。
#40
@alex_prompter
https://x.com/alex_prompter/status/2085012989552509348
把静态 skill 变成自我改进系统的三个升级:一个结构化的 /iterate 循环(产出、带评分和主要缺口的批评、精炼、到 9/10 或进入平台期即停止),与问题分量相匹配的输出强度分级,以及一个带使用追踪的 skills 注册表,配合季度审计淘汰死掉的 skill。「做得更好一点」给 agent 的信号是零;带评分的批评循环给它的是一个梯度。
https://x.com/alex_prompter/status/2085012989552509348
把静态 skill 变成自我改进系统的三个升级:一个结构化的 /iterate 循环(产出、带评分和主要缺口的批评、精炼、到 9/10 或进入平台期即停止),与问题分量相匹配的输出强度分级,以及一个带使用追踪的 skills 注册表,配合季度审计淘汰死掉的 skill。「做得更好一点」给 agent 的信号是零;带评分的批评循环给它的是一个梯度。
#41
@Dev_trader0
https://x.com/Dev_trader0/status/2085104758004548091
一篇综述(arXiv 2603.07670)把 agent 记忆重新定义为一个持续的写入-管理-读取循环,而不是拴在聊天上的检索:检索增强型、层级型、自我改进型和策略学习型记忆各自获得一套分类法。点睛之句:context 帮 LLM 回答问题;memory 帮 agent 进化。
https://x.com/Dev_trader0/status/2085104758004548091
一篇综述(arXiv 2603.07670)把 agent 记忆重新定义为一个持续的写入-管理-读取循环,而不是拴在聊天上的检索:检索增强型、层级型、自我改进型和策略学习型记忆各自获得一套分类法。点睛之句:context 帮 LLM 回答问题;memory 帮 agent 进化。
#42
@VaseGod
https://x.com/VaseGod/status/2084890550243611128
在闭源模型拒绝深度安全审查任务之后,LoopForge 为 RSI 编码 loop 上线了拒绝韧性:MODEL_REFUSAL 诊断区分 API 拒绝和任务崩溃,灰色地带任务回退路由到本地 vLLM/Ollama 端点(GLM 5.2、Kimi K3),外加一条安全约束,阻止会注入越狱内容的 harness 补丁。拒绝从此成为一个有专属处理路径的工程故障类别。
https://x.com/VaseGod/status/2084890550243611128
在闭源模型拒绝深度安全审查任务之后,LoopForge 为 RSI 编码 loop 上线了拒绝韧性:MODEL_REFUSAL 诊断区分 API 拒绝和任务崩溃,灰色地带任务回退路由到本地 vLLM/Ollama 端点(GLM 5.2、Kimi K3),外加一条安全约束,阻止会注入越狱内容的 harness 补丁。拒绝从此成为一个有专属处理路径的工程故障类别。
#43
@Norwakar
https://x.com/Norwakar/status/2085039901809250563
在 Gemini 上跑了一周自我改进 agent loop 的诚实总结:执行没问题,想法生成几乎为零——模型只会重组,不会提出。作者注意到 DeepMind 的 Discovery Loop 宣传语明确瞄准「模型如何想出新点子去尝试」:他们卖的正是那个还没被解决的部分。
https://x.com/Norwakar/status/2085039901809250563
在 Gemini 上跑了一周自我改进 agent loop 的诚实总结:执行没问题,想法生成几乎为零——模型只会重组,不会提出。作者注意到 DeepMind 的 Discovery Loop 宣传语明确瞄准「模型如何想出新点子去尝试」:他们卖的正是那个还没被解决的部分。
📡 生态产品雷达
生态产品雷达
今日 loop 数据中被提及 3 次以上的产品与框架:
Prime Agent / Prime Intellect — 当日最大发布,自我改进 RLM harness
Pi (pidotdev) — loop 爱好者的极简 harness 默认选择,外加 pi-autoresearch 和 herdr
Muse Code / Muse Spark 1.2 — Meta 与模型共同训练的终端 agent,训练配方里含 auto-research
Codex — goal mode 当过夜保姆,token 消耗引发抱怨
Claude Code — 俄罗斯方块运行中的教练 harness,也是搭建 autoresearch loop 的工具
DeepSeek V4 Flash — 本地 loop 主力,从壁橱到 ThinkPad
Karpathy 的 autoresearch — 依然是每篇方法论帖子都要引用的参照点
Shieldstral (Mistral) — 新的 agent 防火墙构件
ARC-AGI-3 — harness 之争如今赖以展开的基准
今日 loop 数据中被提及 3 次以上的产品与框架:
Prime Agent / Prime Intellect — 当日最大发布,自我改进 RLM harness
Pi (pidotdev) — loop 爱好者的极简 harness 默认选择,外加 pi-autoresearch 和 herdr
Muse Code / Muse Spark 1.2 — Meta 与模型共同训练的终端 agent,训练配方里含 auto-research
Codex — goal mode 当过夜保姆,token 消耗引发抱怨
Claude Code — 俄罗斯方块运行中的教练 harness,也是搭建 autoresearch loop 的工具
DeepSeek V4 Flash — 本地 loop 主力,从壁橱到 ThinkPad
Karpathy 的 autoresearch — 依然是每篇方法论帖子都要引用的参照点
Shieldstral (Mistral) — 新的 agent 防火墙构件
ARC-AGI-3 — harness 之争如今赖以展开的基准
评论