2026年8月28日loop

Loop 日报: 2026-08-28

这周 autoresearch 不再只是 Karpathy 的 Demo,开始以能跑出真实数字的基础设施出现。一家量化交易所让一个 Claude 的 agentic loop 对着自己的行情系统跑了几个月,把分发延迟从一分钟多压到 250 毫秒;一个产品工程师把 agent 指向自家 App 的性能指标,现在每天早上醒来都像在「捡宝」;alphaxiv 把任意 arXiv 论文变成用一大群 Claude 和 Codex 代理复现并超越的实验树。今天有两种形态最突出:金融/运营那批人把 autoresearch 跑在回测和交易循环上,harness 和 graph 那批人则在论证——裸 agent loop 会遗忘、会卡死,真正的活是包在它外面的记忆和验证结构。一个反复出现的告诫被不止一个人直白地说出:autoresearch loop 会不惜一切地对着你的指标优化,指标有漏洞就会被无情利用。
💡#1
@jaredbroad
https://x.com/jaredbroad/status/2092660263212274167
QuantConnect 把实时美股期权和指数数据源免费开放,有意思的是他们怎么把延迟降下来的。他们用 Claude 搭了一个 agentic loop,让它能访问自家 ticker-plant 的 beta 环境——能构建、迭代、读日志。经过几个月和几次死胡同,OPRA 分发的峰值延迟从一分钟多降到 250 毫秒,而且这些收益外溢到所有其他资产类别,把它们的延迟也降了最多 50%。一个过夜 agent 对着真实基础设施跑循环、跑出硬核可量化结果的少见案例。
💡#2
@PremiumGoblin
https://x.com/PremiumGoblin/status/2092463138306204006
一个产品工程师把 Karpathy 的 autoresearch loop 复刻到移动 App 的性能指标上——这个领域不做大规模实验根本没法验证结果。他让一个 agent 跑长期目标去读代码库、找 A/B 机会,还搭了个本地小型实验平台,能模拟上千次运行、写入本地 DB,再查询重建生产环境的性能指标。结果是方向性的、不是定论,但足以给他信心去追 agent 提出的最好想法。他一句话点透为什么行得通:性能是大厂里少数几乎不需要对齐的领域——没有设计稿、不改数据用法、对用户基本不可见——还容易验证,所以最适合丢给自主循环。
💡#3
@askalphaxiv
https://x.com/askalphaxiv/status/2093045986696609829
alphaxiv 上线了针对 arXiv 论文的 autoresearch:用一大群 Claude 和 Codex 代理复现并在任意论文上做实验。做后训练时,你的代理可以通过 tinker 启动并发的 RL 运行,你看着实验树长出来。已经在他们的 OpenResearch 平台上线。这是迄今 autoresearch 作为产品、而非个人脚本的最清晰例子——把一篇静态论文变成一个能运行、能分叉的实验。
💡#4
@RoundtableSpace
https://x.com/RoundtableSpace/status/2092986744568176923
一个叫 Ornith 1.5 的 9B 模型在 Wi-Fi 关闭的情况下跑完了一个完整的 agentic loop——读了三张表格、交叉核对月度汇总、写出一份营收分析,没有一个字节离开这台 Mac。完全气隙隔离,干真实的分析活。这是对「agentic loop 必须用前沿云端模型」这个假设的一记有力反驳;一个小的本地模型闭合一个真实的多步分析循环,本身就是一种里程碑。
💡#5
@sabeshbharathi
https://x.com/sabeshbharathi/status/2092536717287055576
一个完全跑在 Apple 神经引擎上的端侧 agentic loop,离线且免费。模型访问 HealthKit 和 MapKit:取当天步数,算出 1 万步目标,计算补齐差距所需的距离,再调地图 API 找附近能走到的咖啡店。看一个小模型在一个 agentic loop 里串起 HealthKit、算术和地图调用,是端侧个人代理走向何方的具体一瞥。
💡#6
@charliejhills
https://x.com/charliejhills/status/2092632122888732972
对 Anthropic 四种 agent loop 类型的清晰拆解,每一种都把更多工作交出去:turn-based(你发提示、它做完就停)、goal-based(你设停止条件和轮数上限)、time-based(用 /loop 设一个间隔)、proactive(用 /schedule 由事件或计划触发、搬到云端)。承重的教训来自他自己的痛:每个循环都需要一个停止条件,跳过它正是让他过夜烧 token 的原因——Claude 在一个没完没了的循环里批判自己的作品。解法是一个上限:「试 5 次后停」。
💡#7
@guybedo
https://x.com/guybedo/status/2092308945599975894
一个回测平台作者给他的 Edgefound 桌面应用加了个 autoresearch 工具,现在 GPT 5.6 自己做大部分研究、有意思的东西出现时才 ping 他。它在一台双路 EPYC、1TB 内存的机器上跑回测和优化扫描。量化金融里一个具体的非编码 autoresearch 案例:agent 自主跑研究循环、只把信号浮出来,人从操作者变成了中断处理器。
💡#8
@phon_ro
https://x.com/phon_ro/status/2092910308709019756
一套真正实验性的配置:Hermes 机器人加 autoresearch 循环,每个都有自己的代码仓库和交易工具,半自主运行、自我进化。他在考虑给它们接支付通道,等它们赚够钱后自己去订阅。这是自主编码加交易加自导向的 autoresearch 循环,一开始故意保持很宽——一个诚实的样本,看一个人放手让 agent 循环开放式地跑、看会涌现出什么。
💡#9
@JonasBadalic
https://x.com/JonasBadalic/status/2093036644903297523
一个在真实代码上干净利落的 autoresearch 结果:他把 Grok 指向 Karpathy 的 autoresearch 文档,让它用 pprof 优化程序。这个循环带来 61% 的提升、33% 的实验成功率。要点是 Go 的性能工具链在 agentic 世界里非常好使——一个 profiler 加一个明确指标,就把优化变成了可自动化的实验循环。
💡#10
@kadirnardev
https://x.com/kadirnardev/status/2092928073532322133
他从 Karpathy 的 autoresearch 项目获得灵感,开始做 fast-kernel 库:一条命令就能优化你想优化的所有模型。附了第一次尝试的结果。又一个 autoresearch 模式从原始 Demo 泛化成可复用优化工具的实例。
💡#11
@marfinxx
https://x.com/marfinxx/status/2092222137926864992
对一篇 Google 论文的有力解读,它通过从失败和成功轨迹中蒸馏策略,把静态 LLM 变成自我改进的代理。ReasoningBank 存储结构化的推理条目(标题、描述、理由),能迁移到没见过的网站和代码库;MaTTS 通过并行自对比 rollout 扩展测试时算力;失败被转成预防性规则。在 WebArena、Mind2Web 和 SWE-Bench-Verified 上验证,相对成功率涨了 20%,冗余步骤减少 26.9%。值得记住的论点:终身代理来自把失败蒸馏成可复用的推理单元,而不是把原始日志塞进长上下文。
💡#12
@askalphaxiv
https://x.com/askalphaxiv/status/2092335890198663370
Prime Agent:一个自我改进的 RLM harness,给代理一个持久的 Python REPL、递归子代理、直接通信,以及跨轨迹存活的落盘记忆和技能。它不做权重更新就实现自我改进——代理把经验变成可复用的状态和更好的未来行为。用 Prime Agent,Opus 5 在 ARC-AGI-3 上达到 95.5%,而参考 harness 只有 30.2%。这个数字就是论证本身:是 harness、而非权重,在承担大部分工作。
💡#13
@aiclawbots
https://x.com/aiclawbots/status/2092628136517345414
一份 OpenClaw 上自我改进技能的真实一个月使用报告。ClawHub 上 pskoett 做的「Self Improving Agent」技能会捕获你的纠正、打标签,并在类似任务出现时把相关经验重新注入上下文。他用了一个月后的判断:复利是真的——以前一周要纠正三次的东西,最近十天一次都没纠正过。关于「纠正捕获」循环在日常使用中到底值不值,这是一个不吹嘘、接地气的数据点。
💡#14
@GeoffreyHuntley
https://x.com/GeoffreyHuntley/status/2092975233556996212
一个在生产里跑 LLM 系统的人给出的方法论告诫:他希望更多人别 100% 依赖 agentic loop,而是把 Temporal 式的工作流引擎当作阶段来用。对某一步该用 LLM 循环还是确定性工作流,是有讲究的——而且两者可以都用,魔法在于正确地组合它们。「确定性处理无聊的 90%,agentic loop 处理麻烦的 10%」这个框架在回复里反复出现。
💡#15
@atomic_chat_hq
https://x.com/atomic_chat_hq/status/2092759022390632660
一个具体的本地代理基准:一个 1-bit 的 Qwen 3.8 Flash Next(79GB)在 MacBook Pro M5 Max 上以 30 tok/s 跑了一个 8 分钟的 agent loop,包含 6 次网络搜索、3 次 Python 运行和 5 张带来源的表格。一个真实、计时的演示:一个重度量化的本地模型能撑住一个多工具 agent loop,长到足以做有用的研究。
💡#16
@bountyAIhunter
https://x.com/bountyAIhunter/status/2092992146231996796
一个量化级的仔细测试,看 agent loop 到底在哪断。跨量化档位重跑一套 60 任务的 agent 集,他发现 1-bit 的下降不是「文笔略差」——模型在约三分之一的轮次里停止闭合 tool-call 的 JSON,所以 agent loop 在答案还没错之前就死了。分数:Q4_K_XL 38/60、IQ4_XS 37/60,一路降到 IQ1_M 24/60。给跑本地 agent loop 的人的洞见:杀死循环的失败模式是 JSON 闭合可靠性,不是文笔质量。
💡#17
@philadelphiafed
https://x.com/philadelphiafed/status/2093074830006305155
费城联储发布了一篇工作论文,标题是《一个可审计的实证经济学 AI Agent Loop:预测组合案例研究》。autoresearch 出现在一家央行研究部门、并把可审计性作为头号要求,是一个有分量的信号:agent-loop 模式正在进入那些每一步都必须可追溯、可辩护的领域。
💡#18
@nibzard
https://x.com/nibzard/status/2093099826502050240
一个漂亮的 autoresearch 风味工作流:在做新 API 时,他意识到可以从 OpenAPI JSON(它本身又是从一个可用的 Notion 页面生成的)mock 出整个产品,喂给一个 agent loop 去 dogfood、分析会话、在实现任何东西之前就迭代改进 API。他已经让代理把这个抽成一个独立产品。本质上是把 autoresearch 用在 API 设计上——在真东西写下一行之前,让循环去压测和打磨规格。
📡 生态产品雷达
生态产品雷达
今天 autoresearch/loop 帖子里被提到 3 次以上的工具、模型和框架。

Claude Code / Codex — 大家做 autoresearch 时扇出的默认代理工人。
Karpathy 的 autoresearch(文档/仓库)— 几乎每个爬山案例都引用的参考模式。
alphaxiv OpenResearch — 把 arXiv 论文变成可复现的实验树。
tinker(@tinkerapi)— 后训练 autoresearch 演示背后的 RL 运行启动器。
Prime Agent — 自我改进 RLM harness(Opus 5 在 ARC-AGI-3 达 95.5%),全天被引用。
Temporal — 大家用来搭配 agentic loop、处理可靠那 90% 的确定性工作流引擎。
DGX Spark / 本地 Qwen — 端侧和气隙 agent loop 背后的硬件和模型。
← 上一篇
超级用户日报: 2026-08-28
下一篇 →
灵感雷达: 2026-08-28
← 返回所有文章

评论

加载中...
>_