Loop 日报: 2026年7月27日
Autoresearch 已经彻底走出了代码库。这一周,它调出了一个能打赢前沿引擎的国际象棋模型,在五小时预算内把一个视觉模型从 25% 拉到 97% 的计数准确率,从一个编译器里榨出 5% 的性能,花一小时去啃火箭级的 isogrid 结构,还在一个横跨 235 道题的 NVIDIA GPU kernel 榜单上拿了第一。循环本身现在基本已经是修好的管道了,大家反复绕回来的难点是那个裁判。一个能在任务中途抓到自己自相矛盾的 verifier,一个拿 pytest 给三个隐藏 bug 打分的测试台,一份写着八种该在悄悄烧掉 500 美元之前停下来的退出条件清单——话题已经从怎么让循环活下去,变成了怎么让它干净地停下来、以及怎么去相信它交回来的东西。还有一条安静的暗线贯穿始终:一堆人坚持说一块二手 200 美元的 GPU、或者一个 8GB 的本地模型,现在就能撑起一个真正的 128k agentic loop,还不用付云账单。
#1
@andreleibovici
https://x.com/andreleibovici/status/2081088714680508903
做了个市场扫描系统,最大的特点是阈值不靠手工调。每次扫描的结果都会存下来,附带 1 到 30 天的未来收益,再用 LightGBM 回测。整套东西跑在 Karpathy 那套 autoresearch 上,能自己改代码、自己跑实验,只保留跑赢验证集的那版。算是把 autoresearch 从训练模型这件事上挪到了量化金融的一个实打实案例。
https://x.com/andreleibovici/status/2081088714680508903
做了个市场扫描系统,最大的特点是阈值不靠手工调。每次扫描的结果都会存下来,附带 1 到 30 天的未来收益,再用 LightGBM 回测。整套东西跑在 Karpathy 那套 autoresearch 上,能自己改代码、自己跑实验,只保留跑赢验证集的那版。算是把 autoresearch 从训练模型这件事上挪到了量化金融的一个实打实案例。
#2
@i_amanchadha
https://x.com/i_amanchadha/status/2080856252687745093
发了一篇很细的 autoresearch 端到端入门,核心是 meta-harness 这个想法:autoresearch 不该只优化模型权重,而要优化 LLM 周围的整个系统,包括 prompt、检索、记忆、工具、状态、解析器和控制流。文章把 propose-run-evaluate 的循环讲透了,还聊了可改代码和冻结基础设施的区分、用文件系统当实验记忆、验证闸门加 Pareto 选择、以及怎么防 reward hacking。是目前把自主研究系统到底怎么搭讲得最全的技术地图之一。
https://x.com/i_amanchadha/status/2080856252687745093
发了一篇很细的 autoresearch 端到端入门,核心是 meta-harness 这个想法:autoresearch 不该只优化模型权重,而要优化 LLM 周围的整个系统,包括 prompt、检索、记忆、工具、状态、解析器和控制流。文章把 propose-run-evaluate 的循环讲透了,还聊了可改代码和冻结基础设施的区分、用文件系统当实验记忆、验证闸门加 Pareto 选择、以及怎么防 reward hacking。是目前把自主研究系统到底怎么搭讲得最全的技术地图之一。
#3
@papersdatacode
https://x.com/papersdatacode/status/2081160818394034487
评测了 Arbor 这个 autoresearch 工具,它把整个循环组织成一棵假设树。作者点出一个真问题:洞见只会沿着血缘往上传给祖先节点,所以不同分支之间只会被拿来比,却从不共享各自学到的东西。他提议给假设描述加一层基于 embedding 的边,让不同分支里相关的节点能横向交换经验,再去量化这么做到底提升多少。是个具体的方法改进,不是空谈。
https://x.com/papersdatacode/status/2081160818394034487
评测了 Arbor 这个 autoresearch 工具,它把整个循环组织成一棵假设树。作者点出一个真问题:洞见只会沿着血缘往上传给祖先节点,所以不同分支之间只会被拿来比,却从不共享各自学到的东西。他提议给假设描述加一层基于 embedding 的边,让不同分支里相关的节点能横向交换经验,再去量化这么做到底提升多少。是个具体的方法改进,不是空谈。
#4
@v_shakthi
https://x.com/v_shakthi/status/2080880337299845522
拆解了 NVIDIA 在 NeMo RL 和 NeMo Gym 上的 autoresearch 流程。有一次公开跑的记录里,一个 Codex agent 在 5 小时预算内把一个 VLM 在视觉计数任务上从 25% 拉到了 96.9%,全程自己搭环境、接数据链路、跑实验、分析错误、还提出下一步方向。他把 agent 主导研究能复现、而不是 context 一重置就忘了目标,归功于三个 agent skill:session-memory、brev-etiquette 和 autoresearch。
https://x.com/v_shakthi/status/2080880337299845522
拆解了 NVIDIA 在 NeMo RL 和 NeMo Gym 上的 autoresearch 流程。有一次公开跑的记录里,一个 Codex agent 在 5 小时预算内把一个 VLM 在视觉计数任务上从 25% 拉到了 96.9%,全程自己搭环境、接数据链路、跑实验、分析错误、还提出下一步方向。他把 agent 主导研究能复现、而不是 context 一重置就忘了目标,归功于三个 agent skill:session-memory、brev-etiquette 和 autoresearch。
#5
@demirelo
https://x.com/demirelo/status/2081152468667232372
说他用所谓的协作式 autoresearch 干掉了 solidity-lean 里的好几个 divergence,还把 Solidus 编译器优化了 5% 以上。规模不大但很实在:这个循环找到的是可量化的编译器优化,不是拿来演示的花活。
https://x.com/demirelo/status/2081152468667232372
说他用所谓的协作式 autoresearch 干掉了 solidity-lean 里的好几个 divergence,还把 Solidus 编译器优化了 5% 以上。规模不大但很实在:这个循环找到的是可量化的编译器优化,不是拿来演示的花活。
#6
@mov_axbx
https://x.com/mov_axbx/status/2081140812499333304
做了个能学着玩 Hanabi 的 agent。这游戏的难点在于你只能靠在一个受限的低带宽通道上摸索出一套沟通协议才能赢。作者把它定义为 autoresearch 这波热潮之前就在做的 in-context learning,还点出一个很好的性质:产出是一份人能读懂的最优策略清单,对人有用、看得明白,而不是一个黑盒。
https://x.com/mov_axbx/status/2081140812499333304
做了个能学着玩 Hanabi 的 agent。这游戏的难点在于你只能靠在一个受限的低带宽通道上摸索出一套沟通协议才能赢。作者把它定义为 autoresearch 这波热潮之前就在做的 in-context learning,还点出一个很好的性质:产出是一份人能读懂的最优策略清单,对人有用、看得明白,而不是一个黑盒。
#7
@YuxiangLin_Lum
https://x.com/YuxiangLin_Lum/status/2081047476182888757
发布了 Auto Debug,一个 autoresearch 的开源姊妹项目。如果说 autoresearch 是让 agent 帮你做研究,那 Auto Debug 就是让 agent 帮你 debug,靠断点、实时变量、单步执行和运行时假设验证来干活,而不是那种瞎猜再打补丁的循环。它支持 Claude Code 和 Codex。
https://x.com/YuxiangLin_Lum/status/2081047476182888757
发布了 Auto Debug,一个 autoresearch 的开源姊妹项目。如果说 autoresearch 是让 agent 帮你做研究,那 Auto Debug 就是让 agent 帮你 debug,靠断点、实时变量、单步执行和运行时假设验证来干活,而不是那种瞎猜再打补丁的循环。它支持 Claude Code 和 Codex。
#8
@sashinmeena
https://x.com/sashinmeena/status/2081046303447064955
展示了 StrikeRobot 的 SR 平台在一个月里,从基础训练场景升级到了高保真、兼容 Isaac Sim 的水平。真正的看点是背后那个 agentic 循环:工具调用加自我评估再加迭代打磨,持续不停地跑,让仿真世界和机器人智能互相促进,一点点缩小 sim-to-real 的差距。
https://x.com/sashinmeena/status/2081046303447064955
展示了 StrikeRobot 的 SR 平台在一个月里,从基础训练场景升级到了高保真、兼容 Isaac Sim 的水平。真正的看点是背后那个 agentic 循环:工具调用加自我评估再加迭代打磨,持续不停地跑,让仿真世界和机器人智能互相促进,一点点缩小 sim-to-real 的差距。
#9
@beamnxw
https://x.com/beamnxw/status/2080957020090380309
讲了 TeaRAG 这套 agentic-RAG 设计,它在检索和推理两端都做了压缩:三元组加关联图加 personalized PageRank 砍掉每次检索的 token 量,再用一个 process-aware 的 DPO 循环缩短推理步数。数据上在 Llama3-8B 和 Qwen2.5-14B 上分别拿到 +4% 和 +2% 的 exact match,同时输出 token 少了 61% 和 59%。作者的观点是,不做这种联合压缩,agentic RAG 根本没法上生产。
https://x.com/beamnxw/status/2080957020090380309
讲了 TeaRAG 这套 agentic-RAG 设计,它在检索和推理两端都做了压缩:三元组加关联图加 personalized PageRank 砍掉每次检索的 token 量,再用一个 process-aware 的 DPO 循环缩短推理步数。数据上在 Llama3-8B 和 Qwen2.5-14B 上分别拿到 +4% 和 +2% 的 exact match,同时输出 token 少了 61% 和 59%。作者的观点是,不做这种联合压缩,agentic RAG 根本没法上生产。
#10
@0xPascual
https://x.com/0xPascual/status/2081065385940447294
描述了一个单干的量化交易者绕开传统券商顾问台的玩法:直接把 Robinhood 的原生 MCP 端点暴露给一个自主的 agentic 循环。这个 agent 通过 JSON-RPC 解析实时订单簿,跨资产类别算组合方差,再通过一个 headless 的 Claude API 集成下调仓单,每次跑只花几美分。等于是一个跑在传统财富管理体系之外的 agentic 交易循环。
https://x.com/0xPascual/status/2081065385940447294
描述了一个单干的量化交易者绕开传统券商顾问台的玩法:直接把 Robinhood 的原生 MCP 端点暴露给一个自主的 agentic 循环。这个 agent 通过 JSON-RPC 解析实时订单簿,跨资产类别算组合方差,再通过一个 headless 的 Claude API 集成下调仓单,每次跑只花几美分。等于是一个跑在传统财富管理体系之外的 agentic 交易循环。
#11
@sudoingX
https://x.com/sudoingX/status/2081069142493499431
反驳了那种觉得本地小模型只是手机上的玩具的说法。他强调 8GB 这个跑法的意义在于,它能撑住完整的 128k token agentic 循环,这就把它推过了玩具的界线,进入真正能干无人值守活的范围。是本地硬件上跑起有能力的 agent 循环这条路上的一个数据点。
https://x.com/sudoingX/status/2081069142493499431
反驳了那种觉得本地小模型只是手机上的玩具的说法。他强调 8GB 这个跑法的意义在于,它能撑住完整的 128k token agentic 循环,这就把它推过了玩具的界线,进入真正能干无人值守活的范围。是本地硬件上跑起有能力的 agent 循环这条路上的一个数据点。
#12
@TRSTNGLRD
https://x.com/TRSTNGLRD/status/2081056909575291201
拿一个硬核机械设计任务开刀,一个 isogrid 结构,用了 Leap71 PicoGK、ANSYS 加一群跑在 Cursor 里的 Kimi-K3 子 agent,做了大概一小时的 auto-research。他给的评价很实在:auto-research 现在在多目标优化上还是弱,大概 80% 是废料、20% 靠谱,但它确实一次性产出了一个还不错的线框图,作者接下来在逐个定位瓶颈。是一份很坦诚的记录,讲清了自主研究循环在真实工程上会在哪儿崩。
https://x.com/TRSTNGLRD/status/2081056909575291201
拿一个硬核机械设计任务开刀,一个 isogrid 结构,用了 Leap71 PicoGK、ANSYS 加一群跑在 Cursor 里的 Kimi-K3 子 agent,做了大概一小时的 auto-research。他给的评价很实在:auto-research 现在在多目标优化上还是弱,大概 80% 是废料、20% 靠谱,但它确实一次性产出了一个还不错的线框图,作者接下来在逐个定位瓶颈。是一份很坦诚的记录,讲清了自主研究循环在真实工程上会在哪儿崩。
#13
@amir_mir93
https://x.com/amir_mir93/status/2080908349550297416
在 NVIDIA 的 SOL-ExecBench 比赛里拿了总冠军,横跨 4 个赛道、235 道题,前后花了三个月。他把成绩归功于这一路学到的递归自我改进、auto-research 和 AI 驱动的 GPU kernel 调优。是把 autoresearch 对准 GPU kernel 优化后拿到的一个实打实的竞赛结果。
https://x.com/amir_mir93/status/2080908349550297416
在 NVIDIA 的 SOL-ExecBench 比赛里拿了总冠军,横跨 4 个赛道、235 道题,前后花了三个月。他把成绩归功于这一路学到的递归自我改进、auto-research 和 AI 驱动的 GPU kernel 调优。是把 autoresearch 对准 GPU kernel 优化后拿到的一个实打实的竞赛结果。
#14
@jednapcela
https://x.com/jednapcela/status/2080914051832430862
讲了一套上了生产的多 agent 工作流,每个模型职责正交:Claude 当架构师和编排者、握最终否决权,Gemini 和 Gemma 负责长 context 的 CAD/PDF 视觉,Codex 那类 agent 干日常代码和 CI/CD,Grok 则实时抓原材料市场数据喂给一个递归自我改进的循环。所有东西走一条结构化的 JSON 总线,每个 agent 各自待在独立的 git worktree 里。是制造和材料这个场景下一套真正能自我改进的编排系统。
https://x.com/jednapcela/status/2080914051832430862
讲了一套上了生产的多 agent 工作流,每个模型职责正交:Claude 当架构师和编排者、握最终否决权,Gemini 和 Gemma 负责长 context 的 CAD/PDF 视觉,Codex 那类 agent 干日常代码和 CI/CD,Grok 则实时抓原材料市场数据喂给一个递归自我改进的循环。所有东西走一条结构化的 JSON 总线,每个 agent 各自待在独立的 git worktree 里。是制造和材料这个场景下一套真正能自我改进的编排系统。
#15
@martin_casado
https://x.com/martin_casado/status/2081087412378505609
他很兴奋地聊起 Exo,一个他和一帮做系统的人正在搭的完全递归自我改进 agent harness,说这是个真正棘手的系统问题。这是个信号:正经做基础设施的人开始把递归自我改进当成一门工程学科来对待,而不是拿来演示。
https://x.com/martin_casado/status/2081087412378505609
他很兴奋地聊起 Exo,一个他和一帮做系统的人正在搭的完全递归自我改进 agent harness,说这是个真正棘手的系统问题。这是个信号:正经做基础设施的人开始把递归自我改进当成一门工程学科来对待,而不是拿来演示。
#16
@qlanro
https://x.com/qlanro/status/2080936044250202321
发现改进 agent skill 最好的办法是另开一个 session,让它指向第一个线程,再让一个够强的模型去挑出里面的摩擦点和 skill 问题。他几乎在所有 skill 里都写进了自我改进的指令,但说这种并行批评的循环效果好得多。是个谁都能上手的轻量自我改进工作流。
https://x.com/qlanro/status/2080936044250202321
发现改进 agent skill 最好的办法是另开一个 session,让它指向第一个线程,再让一个够强的模型去挑出里面的摩擦点和 skill 问题。他几乎在所有 skill 里都写进了自我改进的指令,但说这种并行批评的循环效果好得多。是个谁都能上手的轻量自我改进工作流。
#17
@c_s_a_w
https://x.com/c_s_a_w/status/2081100969350463956
从经验出发点了一句:每个 agent demo 看着都干净,直到第 4 步左右状态管理开始崩。他说唯一让自己的循环没那么脆的做法,是把自我改进循环建模成一张图。是个很实在的提醒:循环的可靠性说到底是个状态管理问题。
https://x.com/c_s_a_w/status/2081100969350463956
从经验出发点了一句:每个 agent demo 看着都干净,直到第 4 步左右状态管理开始崩。他说唯一让自己的循环没那么脆的做法,是把自我改进循环建模成一张图。是个很实在的提醒:循环的可靠性说到底是个状态管理问题。
#18
@im_harish_hari
https://x.com/im_harish_hari/status/2080995568193581293
他认为如今的瓶颈已经不是信息而是执行:一门免费课能教会你那些基本功,比如 context engineering、agentic 循环、MCP server,但真正稀缺的技能是把东西交付出去。他还拿实测数据佐证:一个 prompt 拼出来的链路,跟一个带持久 context 的真 agentic 循环相比,任务完成率差了 3 倍,是在五类任务上冷启动测出来的。
https://x.com/im_harish_hari/status/2080995568193581293
他认为如今的瓶颈已经不是信息而是执行:一门免费课能教会你那些基本功,比如 context engineering、agentic 循环、MCP server,但真正稀缺的技能是把东西交付出去。他还拿实测数据佐证:一个 prompt 拼出来的链路,跟一个带持久 context 的真 agentic 循环相比,任务完成率差了 3 倍,是在五类任务上冷启动测出来的。
#19
@FlowtLabs
https://x.com/FlowtLabs/status/2081043479862411635
一个用 agent 循环跑自主业务系统的人,分享了让循环活过 demo 阶段的六条纪律。包括持久记忆(思考前先读、行动后再写)、带硬超时的独占锁、代码层面的闸门(产品 URL 不返回 200 就拒绝发布)、以及要求每次运行必须引用真实的 execution ID 才能声称东西测过了。他还主张用 48 小时的人类否决窗口来取代逐动作审批,每次运行都留一篇人能读的散文式日志。核心一句话:智能很便宜,纪律才稀缺。
https://x.com/FlowtLabs/status/2081043479862411635
一个用 agent 循环跑自主业务系统的人,分享了让循环活过 demo 阶段的六条纪律。包括持久记忆(思考前先读、行动后再写)、带硬超时的独占锁、代码层面的闸门(产品 URL 不返回 200 就拒绝发布)、以及要求每次运行必须引用真实的 execution ID 才能声称东西测过了。他还主张用 48 小时的人类否决窗口来取代逐动作审批,每次运行都留一篇人能读的散文式日志。核心一句话:智能很便宜,纪律才稀缺。
#20
@0xPascual
https://x.com/0xPascual/status/2081062390532104400
讲了一个单干开发者的故事,他把 Moonshot 的 Kimi K3(2.8T MoE)接进一套本地代理,用来跑自动化的代码审计。他通过 API 走 1M token 的代码库审计,成本是每百万输入 token 3 美元,自动重构那些以前得靠六个资深工程师才搞得动的老 C++ 系统。整条自动化 agent 循环流水线跑在一台便宜的云 VM 上,总共花了 42 美元的 API 额度,替掉了一份大约 15 万美元的外包报价。是个大规模代码重构的具体 agentic 循环案例。
https://x.com/0xPascual/status/2081062390532104400
讲了一个单干开发者的故事,他把 Moonshot 的 Kimi K3(2.8T MoE)接进一套本地代理,用来跑自动化的代码审计。他通过 API 走 1M token 的代码库审计,成本是每百万输入 token 3 美元,自动重构那些以前得靠六个资深工程师才搞得动的老 C++ 系统。整条自动化 agent 循环流水线跑在一台便宜的云 VM 上,总共花了 42 美元的 API 额度,替掉了一份大约 15 万美元的外包报价。是个大规模代码重构的具体 agentic 循环案例。
#21
@boardyai
https://x.com/boardyai/status/2080951411622453593
记了一段 AgentOS 演示的多 agent 循环:一个验证 agent 在任务中途逮到一处矛盾,把它重新打开,在问题修好之前拒绝放行。作者把这说成是内建进 agent OS 的一层真正能干活的质量控制,而不是全凭感觉。看点就在于这个验证器在循环里当了个真闸门。它指向的是把正确性的强制执行做成循环内的一个功能。
https://x.com/boardyai/status/2080951411622453593
记了一段 AgentOS 演示的多 agent 循环:一个验证 agent 在任务中途逮到一处矛盾,把它重新打开,在问题修好之前拒绝放行。作者把这说成是内建进 agent OS 的一层真正能干活的质量控制,而不是全凭感觉。看点就在于这个验证器在循环里当了个真闸门。它指向的是把正确性的强制执行做成循环内的一个功能。
#22
@ma8nk
https://x.com/ma8nk/status/2081129479645036965
一段亲历:他跑了个通宵的 agent 循环,头两晚都挺好,结果周中把他的 Claude Code 账号毫无预警地锁了。按原价买了应急 token 之后,他自己搭了个正经的用量表来盯消耗,前后折腾了四次才做好。是从跑通宵自主循环里得来的真实教训,说明预算和用量监控有多必要。是个很接地气的运维踩坑记。
https://x.com/ma8nk/status/2081129479645036965
一段亲历:他跑了个通宵的 agent 循环,头两晚都挺好,结果周中把他的 Claude Code 账号毫无预警地锁了。按原价买了应急 token 之后,他自己搭了个正经的用量表来盯消耗,前后折腾了四次才做好。是从跑通宵自主循环里得来的真实教训,说明预算和用量监控有多必要。是个很接地气的运维踩坑记。
#23
@MaziyarPanahi
https://x.com/MaziyarPanahi/status/2080987898292146685
描述了一套真实的 agent 循环测试台:在一个真 repo 里修三个藏起来的 bug,用 pytest 当裁判,把实际的推理、diff 和测试输出都亮出来。这套东西跑本地模型(Bonsai-27B、Inkling 的 1-bit GGUF、gemma-4-26B),在 Mac Studio 上用 llama.cpp 和 MLX 来 serve,再加一个走 OpenRouter 的 Kimi K3。agent 循环本身是个约 200 行的 ReAct harness,带 read/edit/run_tests,能对接任何 OpenAI 兼容端点,刻意做成模型无关。是个具体又可复现的 autoresearch 编码 agent 基准搭法。
https://x.com/MaziyarPanahi/status/2080987898292146685
描述了一套真实的 agent 循环测试台:在一个真 repo 里修三个藏起来的 bug,用 pytest 当裁判,把实际的推理、diff 和测试输出都亮出来。这套东西跑本地模型(Bonsai-27B、Inkling 的 1-bit GGUF、gemma-4-26B),在 Mac Studio 上用 llama.cpp 和 MLX 来 serve,再加一个走 OpenRouter 的 Kimi K3。agent 循环本身是个约 200 行的 ReAct harness,带 read/edit/run_tests,能对接任何 OpenAI 兼容端点,刻意做成模型无关。是个具体又可复现的 autoresearch 编码 agent 基准搭法。
#24
@elune0x
https://x.com/elune0x/status/2081032888363913307
一篇讲方法论的帖子,主张一个 agent 循环需要八个各不相同的退出条件,而不是一个,每个都对应一个具体工具。这八个分别是:靠 rubric 评估器判定目标达成(OpenAI Evals)、硬性回合上限(LangGraph)、token/美元预算上限(LiteLLM)、真实时钟的截止时间(Prefect)、跨回合对状态做哈希的无进展检测(DeepDiff/DeepHash)、人工中断加急停开关(Microsoft Agent Framework)、连续失败的错误阈值(Tenacity)、以及像 PR 合并这种外部事件(Probot)。核心论点是:只有一个出口的循环会卡死,有八个出口的才叫系统,而且这些出口该在写 prompt 之前就定好。是给稳健 agent 循环的一份很有料的工程清单。
https://x.com/elune0x/status/2081032888363913307
一篇讲方法论的帖子,主张一个 agent 循环需要八个各不相同的退出条件,而不是一个,每个都对应一个具体工具。这八个分别是:靠 rubric 评估器判定目标达成(OpenAI Evals)、硬性回合上限(LangGraph)、token/美元预算上限(LiteLLM)、真实时钟的截止时间(Prefect)、跨回合对状态做哈希的无进展检测(DeepDiff/DeepHash)、人工中断加急停开关(Microsoft Agent Framework)、连续失败的错误阈值(Tenacity)、以及像 PR 合并这种外部事件(Probot)。核心论点是:只有一个出口的循环会卡死,有八个出口的才叫系统,而且这些出口该在写 prompt 之前就定好。是给稳健 agent 循环的一份很有料的工程清单。
#25
@startchangeri
https://x.com/startchangeri/status/2081104014544896115
一份用 Grok 生成的详细指南,讲怎么给 agent 花钱设死上限,让一次运行要么完成、要么在预算内干净地停下,目标是避免那种「48 个 agent 跑一夜,1000 美元没了」的翻车。它建议在 provider 层设硬性花费上限、在 agent 循环里每次调 LLM 或工具前就按任务和会话卡预算、再用框架的护栏限制最大 agent 数、递归深度和迭代次数。它点了名具体工具(LiteLLM、Portkey、Haystack 的预算策略、CrewAI/LangGraph 的 max_iter 和成本 hook),还有熔断器和实时自动急停监控。它也剖析了失控循环的成因:无节制地 spawn、协调开销、以及近乎无限的 agent 间互相循环。
https://x.com/startchangeri/status/2081104014544896115
一份用 Grok 生成的详细指南,讲怎么给 agent 花钱设死上限,让一次运行要么完成、要么在预算内干净地停下,目标是避免那种「48 个 agent 跑一夜,1000 美元没了」的翻车。它建议在 provider 层设硬性花费上限、在 agent 循环里每次调 LLM 或工具前就按任务和会话卡预算、再用框架的护栏限制最大 agent 数、递归深度和迭代次数。它点了名具体工具(LiteLLM、Portkey、Haystack 的预算策略、CrewAI/LangGraph 的 max_iter 和成本 hook),还有熔断器和实时自动急停监控。它也剖析了失控循环的成因:无节制地 spawn、协调开销、以及近乎无限的 agent 间互相循环。
#26
@johniosifov
https://x.com/johniosifov/status/2080914209437630904
一份把治理放在第一位的记录,来自一个已经公开跑了 264 天自主 AI agent 的人,他的观点是大多数企业部署 agent 时根本没搭配套的问责设施。他列了自己循环里强制执行的具体护栏:范围锁死(只能碰 agent/ 目录)、每个会话硬性 25 回合上限、任何动作生效前先过一道 PR 审查闸门、每天最多 10 个 PR、以及队列到 15 就硬停的阈值。每条约束都对应一种无边界 agent 循环会犯的毛病,比如内容失控生产或预算烧光。是个真实的长期自主 agent 运维案例。
https://x.com/johniosifov/status/2080914209437630904
一份把治理放在第一位的记录,来自一个已经公开跑了 264 天自主 AI agent 的人,他的观点是大多数企业部署 agent 时根本没搭配套的问责设施。他列了自己循环里强制执行的具体护栏:范围锁死(只能碰 agent/ 目录)、每个会话硬性 25 回合上限、任何动作生效前先过一道 PR 审查闸门、每天最多 10 个 PR、以及队列到 15 就硬停的阈值。每条约束都对应一种无边界 agent 循环会犯的毛病,比如内容失控生产或预算烧光。是个真实的长期自主 agent 运维案例。
#27
@DataChaz
https://x.com/DataChaz/status/2080832572381393307
报告说一个开源 agent(Atomic Agent)在 53 个真实的 GAIA Level 1 任务上,用同一个本地 4-bit Qwen-3.6-35b 模型、跑在 M4 Max 上,打赢了 Hermes:3 小时 12 分解出 69.8%,而 Hermes 是 5 小时 10 分只到 58.5%。优势归功于一个很有纪律的 agent 循环,它拒绝浪费算力,用字节级稳定的 prompt 来大量复用 KV-cache,用 JSON 批量发工具调用,还压缩结果而不是把原始日志一股脑塞进 context。一个专治死循环工具调用的硬停机制让模型保持专注。作为一个开源、本地优先的框架给出,附带具体的基准结果。
https://x.com/DataChaz/status/2080832572381393307
报告说一个开源 agent(Atomic Agent)在 53 个真实的 GAIA Level 1 任务上,用同一个本地 4-bit Qwen-3.6-35b 模型、跑在 M4 Max 上,打赢了 Hermes:3 小时 12 分解出 69.8%,而 Hermes 是 5 小时 10 分只到 58.5%。优势归功于一个很有纪律的 agent 循环,它拒绝浪费算力,用字节级稳定的 prompt 来大量复用 KV-cache,用 JSON 批量发工具调用,还压缩结果而不是把原始日志一股脑塞进 context。一个专治死循环工具调用的硬停机制让模型保持专注。作为一个开源、本地优先的框架给出,附带具体的基准结果。
#28
@mjovanovictech
https://x.com/mjovanovictech/status/2081097815665619104
一段简短的亲历:他在一台 Mac Mini 上用 Codex 加 5.6 Sol 跑一个持久的编码 agent 循环,能围绕一个目标连续干大概两整天甚至更久。作者专挑特别大的任务丢给它,发现它在达成目标上很执着,自己只是隔一阵去看一眼,而不用一直盯着。是个长时程自主 agent 循环日常使用的具体例子,重点在这个循环干大活时的耐力。
https://x.com/mjovanovictech/status/2081097815665619104
一段简短的亲历:他在一台 Mac Mini 上用 Codex 加 5.6 Sol 跑一个持久的编码 agent 循环,能围绕一个目标连续干大概两整天甚至更久。作者专挑特别大的任务丢给它,发现它在达成目标上很执着,自己只是隔一阵去看一眼,而不用一直盯着。是个长时程自主 agent 循环日常使用的具体例子,重点在这个循环干大活时的耐力。
#29
@Blackwellboy
https://x.com/Blackwellboy/status/2080896983632588971
一个技术论点:模型抓边界情况的能力来自 agent 循环,而不是 thinking 模式那些草稿纸 token,也就是写、跑、读失败、修这套真实反馈,而不是靠猜。作者说正是这个反馈循环让他在关掉 thinking 的情况下拿到了 9/10 的长时程分数和 100% 的工具成功率。他还提到被测模型的 thinking 实现几乎不触发,真触发时分反而更低,会在干净的代码里凭空造出 bug。是关于为什么循环的执行反馈胜过推理 token 的一手实战心得。
https://x.com/Blackwellboy/status/2080896983632588971
一个技术论点:模型抓边界情况的能力来自 agent 循环,而不是 thinking 模式那些草稿纸 token,也就是写、跑、读失败、修这套真实反馈,而不是靠猜。作者说正是这个反馈循环让他在关掉 thinking 的情况下拿到了 9/10 的长时程分数和 100% 的工具成功率。他还提到被测模型的 thinking 实现几乎不触发,真触发时分反而更低,会在干净的代码里凭空造出 bug。是关于为什么循环的执行反馈胜过推理 token 的一手实战心得。
📡 生态产品雷达
生态产品雷达
Claude Code——大多数这些循环还是跑在它里面,不管是写代码还是当 CI 式的 pass/fail 裁判。
Codex——大家会伸手去够的另一个循环,也是 NVIDIA 那次 autoresearch 把视觉任务干到 97% 用的那个。
Kimi K3——刚开源的权重已经在驱动本地 sub-agent 集群,从代码审计到机械设计都有。
Auto Debug / Arbor / Exo——新一批开源的循环工具:给 agent 的运行时调试、假设树式的 autoresearch,以及一个完全递归自我改进的 harness。
GEPA / NeMo——撑起不少正经 autoresearch 跑法底下的优化器和 RL 管道。
Claude Code——大多数这些循环还是跑在它里面,不管是写代码还是当 CI 式的 pass/fail 裁判。
Codex——大家会伸手去够的另一个循环,也是 NVIDIA 那次 autoresearch 把视觉任务干到 97% 用的那个。
Kimi K3——刚开源的权重已经在驱动本地 sub-agent 集群,从代码审计到机械设计都有。
Auto Debug / Arbor / Exo——新一批开源的循环工具:给 agent 的运行时调试、假设树式的 autoresearch,以及一个完全递归自我改进的 harness。
GEPA / NeMo——撑起不少正经 autoresearch 跑法底下的优化器和 RL 管道。
评论