Loop 日报: 2026-09-07
今天有两条主线值得盯住。一条是 autoresearch 开始产出"带证书的数学":Reed-Solomon 列表译码那个突破 30 年老壁垒的结果被推广成了容量级定理,另一套独立系统把一个立了 22 年的格点下界往前推了一步、还附带可验证证书,参与的研究者已经公开聊起"开放问题市场"这种事了。另一条是账单到了:今天最值得读的帖子是一份关于 agent 循环为什么烧配额的法医级拆解——99.5% 的 token 花在上下文重放上,根本不是在思考——而同一周,有人 12 小时烧光 100 美元套餐,有人 7 月份 token 账单干到 3 万美元。循环本身已经跑通了,怎么付得起这个循环,成了新的工程问题。
#1
@FelipeSchieber
https://x.com/FelipeSchieber/status/2096531287590781411
今天的必读。他烧了一大堆 Astra 配额,就为了搞清楚 agent 循环的 token 到底去哪了,答案是上下文重放。他审计的一次运行里,954 次模型请求吃掉 1.33 亿 token,其中 99.5% 是输入、97% 命中缓存——因为每次工具交接都会变成一次携带整个会话的完整模型续写。他的 Blender 工作流里,一个长时间运行的工具居然要模型出面做九次"还没跑完"的确认;把执行边界挪一下,九次直接归零。他的结论把整场争论重新定了调:不是 Astra 低效,是你的架构低效——别再把前沿模型的推理花在那些根本不需要智能的边界上。
https://x.com/FelipeSchieber/status/2096531287590781411
今天的必读。他烧了一大堆 Astra 配额,就为了搞清楚 agent 循环的 token 到底去哪了,答案是上下文重放。他审计的一次运行里,954 次模型请求吃掉 1.33 亿 token,其中 99.5% 是输入、97% 命中缓存——因为每次工具交接都会变成一次携带整个会话的完整模型续写。他的 Blender 工作流里,一个长时间运行的工具居然要模型出面做九次"还没跑完"的确认;把执行边界挪一下,九次直接归零。他的结论把整场争论重新定了调:不是 Astra 低效,是你的架构低效——别再把前沿模型的推理花在那些根本不需要智能的边界上。
#2
@ignotus_nemo
https://x.com/ignotus_nemo/status/2095942199074586970
这个编码理论突破最清楚的技术拆解在这里:一次用 GPT-5 和 Codex 的 autoresearch 运行,产出了一个 Lean 验证过的结果,在一个具体的码上把纠错位置往 Johnson 半径外推了大约九个——那可是卡了 Reed-Solomon 列表译码将近三十年的算法壁垒。九个位置就足以暴露那个缺失的想法(在插值论证里引入高阶导数),人类研究者随后借助 GPT-5.6 Sol 把它提炼推广成一个逼近列表译码容量的确定性算法。AI 找到裂缝,Lean 负责验证,数学家把它变成定理。他的判词:这一个我们会记住。
https://x.com/ignotus_nemo/status/2095942199074586970
这个编码理论突破最清楚的技术拆解在这里:一次用 GPT-5 和 Codex 的 autoresearch 运行,产出了一个 Lean 验证过的结果,在一个具体的码上把纠错位置往 Johnson 半径外推了大约九个——那可是卡了 Reed-Solomon 列表译码将近三十年的算法壁垒。九个位置就足以暴露那个缺失的想法(在插值论证里引入高阶导数),人类研究者随后借助 GPT-5.6 Sol 把它提炼推广成一个逼近列表译码容量的确定性算法。AI 找到裂缝,Lean 负责验证,数学家把它变成定理。他的判词:这一个我们会记住。
#3
@soubhikdeb
https://x.com/soubhikdeb/status/2095890938459771149
上面那个结果背后的框架:Yukon 的协作式 autoresearch 竞赛,让各家 autoresearcher 以机器速度在彼此的提交上继续搭,而不是在静态 benchmark 上各刷各的分。有一个 autoresearcher 的提交只把一个 soundness 位从 63.99 挪到 64.01——就是这一小步点燃了后面的连锁反应,最终终结了那个 30 年的壁垒。设计赌注说得很明白:把研究者互相接力的学术文化复刻出来,但跑在机器节奏上。迭代累积赢了排行榜狙击。
https://x.com/soubhikdeb/status/2095890938459771149
上面那个结果背后的框架:Yukon 的协作式 autoresearch 竞赛,让各家 autoresearcher 以机器速度在彼此的提交上继续搭,而不是在静态 benchmark 上各刷各的分。有一个 autoresearcher 的提交只把一个 soundness 位从 63.99 挪到 64.01——就是这一小步点燃了后面的连锁反应,最终终结了那个 30 年的壁垒。设计赌注说得很明白:把研究者互相接力的学术文化复刻出来,但跑在机器节奏上。迭代累积赢了排行榜狙击。
#4
@numaro_tech
https://x.com/numaro_tech/status/2096593732921393427
同一时间窗里的第二个带证书数学结果:他们的 autoresearch 系统把方格上自回避行走连通常数的严格下界从 2.625622 推到 2.627385640——这个界立了 22 年——而且随结果一起交付了可验证证书。两个独立团队,同一个模式:循环负责提出,形式化验证负责盖章,人类负责发表。"autoresearch 只会产垃圾"这种反对意见,在验证可以机械化的领域里,反例正在耗尽。
https://x.com/numaro_tech/status/2096593732921393427
同一时间窗里的第二个带证书数学结果:他们的 autoresearch 系统把方格上自回避行走连通常数的严格下界从 2.625622 推到 2.627385640——这个界立了 22 年——而且随结果一起交付了可验证证书。两个独立团队,同一个模式:循环负责提出,形式化验证负责盖章,人类负责发表。"autoresearch 只会产垃圾"这种反对意见,在验证可以机械化的领域里,反例正在耗尽。
#5
@AnnatarXBT
https://x.com/AnnatarXBT/status/2096215016139895180
难得的诚实转发:他去追那条疯传的"两个 Anthropic 资深工程师把 Karpathy 的循环提升了 1000 倍",查不到出处,就直说查不到——然后把手指向真正可查证的东西:Anthropic 的知识图谱 cookbook,以及 Karpathy 那个 2 天自主跑了 700 个实验、自己挖出 20 个优化点的 autoresearch 循环。他把图谱方案接进自己的系统,第一条回复就看出了差别。传说要验证,可复现的部分直接偷走。
https://x.com/AnnatarXBT/status/2096215016139895180
难得的诚实转发:他去追那条疯传的"两个 Anthropic 资深工程师把 Karpathy 的循环提升了 1000 倍",查不到出处,就直说查不到——然后把手指向真正可查证的东西:Anthropic 的知识图谱 cookbook,以及 Karpathy 那个 2 天自主跑了 700 个实验、自己挖出 20 个优化点的 autoresearch 循环。他把图谱方案接进自己的系统,第一条回复就看出了差别。传说要验证,可复现的部分直接偷走。
#6
@rimtoln
https://x.com/rimtoln/status/2096267740394758366
对 Cursor 七天自主运行的一篇不错的分析回顾:一群 agent 对着"从零写一个网页浏览器"这个目标,靠 planner/worker/judge 循环把运行维持了好几天,峰值大约 2,000 个并发 agent,产出超过一百万行 Rust、约 1,000 个文件。这个浏览器离 Chrome 差得远,但那不是重点——重点是对着一个多日目标的持续执行,人类只负责定架构和停机条件。他的框架值得记:工作的基本单位正在变成"一周长的 agent 循环",而浏览器就是 harness 研究的 hello world。
https://x.com/rimtoln/status/2096267740394758366
对 Cursor 七天自主运行的一篇不错的分析回顾:一群 agent 对着"从零写一个网页浏览器"这个目标,靠 planner/worker/judge 循环把运行维持了好几天,峰值大约 2,000 个并发 agent,产出超过一百万行 Rust、约 1,000 个文件。这个浏览器离 Chrome 差得远,但那不是重点——重点是对着一个多日目标的持续执行,人类只负责定架构和停机条件。他的框架值得记:工作的基本单位正在变成"一周长的 agent 循环",而浏览器就是 harness 研究的 hello world。
#7
@realarmaansidhu
https://x.com/realarmaansidhu/status/2096341072108494863
迄今最锋利的 OpenClaw 尸检,全程用单位经济学讲:2025 年 11 月首次提交,2 月份 10 万 GitHub star,峰值 13.5 万个实例在跑——每一个都在烧别人不限量订阅里的推理额度。4 月 Anthropic 不再为第三方 harness 兜底、用量转成按量计费之后,几周之内采用量崩盘。工具没有变差,是账单到了。他的警告适用于现在出货的每一个 agent 套壳:一个 agent 循环每个任务要打几十次模型调用,任何单位经济学建立在别人定价页上的产品,离归零只差对方改一行价格。
https://x.com/realarmaansidhu/status/2096341072108494863
迄今最锋利的 OpenClaw 尸检,全程用单位经济学讲:2025 年 11 月首次提交,2 月份 10 万 GitHub star,峰值 13.5 万个实例在跑——每一个都在烧别人不限量订阅里的推理额度。4 月 Anthropic 不再为第三方 harness 兜底、用量转成按量计费之后,几周之内采用量崩盘。工具没有变差,是账单到了。他的警告适用于现在出货的每一个 agent 套壳:一个 agent 循环每个任务要打几十次模型调用,任何单位经济学建立在别人定价页上的产品,离归零只差对方改一行价格。
#8
@nelvOfficial
https://x.com/nelvOfficial/status/2096161619810427177
线性 LLM 链(n8n 那一派)为什么输给 agent 循环,这条讲得最透:节点链是为一个"你不信任模型、模型也拿不住上下文"的时代设计的,所以每次交接都在丢状态——第 N+1 个节点只能继承第 N 个节点勉强吐出来的那点东西。agent 循环则维持一份共享上下文,把工具调用不断追加上去,每一步都以完整的缓存工作集为条件。他的比喻很粘人:节点链是一条没人共用办公桌的邮件流水线,agent 是一块所有人都能读写的黑板。前提过时了,模式就跟着死了。
https://x.com/nelvOfficial/status/2096161619810427177
线性 LLM 链(n8n 那一派)为什么输给 agent 循环,这条讲得最透:节点链是为一个"你不信任模型、模型也拿不住上下文"的时代设计的,所以每次交接都在丢状态——第 N+1 个节点只能继承第 N 个节点勉强吐出来的那点东西。agent 循环则维持一份共享上下文,把工具调用不断追加上去,每一步都以完整的缓存工作集为条件。他的比喻很粘人:节点链是一条没人共用办公桌的邮件流水线,agent 是一块所有人都能读写的黑板。前提过时了,模式就跟着死了。
#9
@jiqizhixin
https://x.com/jiqizhixin/status/2096101019256340800
斯坦福的 LLM-as-a-Verifier 是那篇"廉价 token 当战略"的论文:让开源的 DeepSeek V4 Flash 生成 5 条候选 agent 轨迹,再用同一个模型去验证、打分、排序——全程没有任何更强的闭源模型。结果:Terminal-Bench 从 79% 跳到 88%,超过 Claude Fable 5,成本却低了大约 11 倍。赌的就是开源 token 便宜到"生成加验证 5 条"仍然比一次前沿模型调用便宜。自我验证顶替模型质量,现在是有 benchmark 背书的策略,不再是直觉。
https://x.com/jiqizhixin/status/2096101019256340800
斯坦福的 LLM-as-a-Verifier 是那篇"廉价 token 当战略"的论文:让开源的 DeepSeek V4 Flash 生成 5 条候选 agent 轨迹,再用同一个模型去验证、打分、排序——全程没有任何更强的闭源模型。结果:Terminal-Bench 从 79% 跳到 88%,超过 Claude Fable 5,成本却低了大约 11 倍。赌的就是开源 token 便宜到"生成加验证 5 条"仍然比一次前沿模型调用便宜。自我验证顶替模型质量,现在是有 benchmark 背书的策略,不再是直觉。
#10
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2095800283674906842
HarnessEvolve 把 agent 的自我改进当成软件调试来做:长运行失败了,先找到第一次跑偏的位置,把错误聚类成反复出现的模式,然后编辑整个 harness——提示词、技能、工具、脚本、执行逻辑一起改。候选修改要过数据泄漏、提示词膨胀、回归三道闸门才能落地。在一个 QA benchmark 上配 Qwen3.6-27B 打到 86.9% 准确率,领先最强基线 21.6 个点——而一旦拿掉参考轨迹,直接塌到 57.8%。不知道是哪一步搞砸的自我改进,只能叫随机突变。
https://x.com/rohanpaul_ai/status/2095800283674906842
HarnessEvolve 把 agent 的自我改进当成软件调试来做:长运行失败了,先找到第一次跑偏的位置,把错误聚类成反复出现的模式,然后编辑整个 harness——提示词、技能、工具、脚本、执行逻辑一起改。候选修改要过数据泄漏、提示词膨胀、回归三道闸门才能落地。在一个 QA benchmark 上配 Qwen3.6-27B 打到 86.9% 准确率,领先最强基线 21.6 个点——而一旦拿掉参考轨迹,直接塌到 57.8%。不知道是哪一步搞砸的自我改进,只能叫随机突变。
#11
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2096336455375425893
SkillGLoW 回答了自我改进 agent 的记忆问题:记可复用的程序,别记过去的任务。存"共享的解题方式"而不是逐条对话记录,涨了 17.2 个点,库还压缩到 3.6 倍更紧凑——任务相关的细节从当前任务现场重建,不囤积。它还在真实执行里测试每次记忆更新,把让 agent 变差的改动直接拒掉。记得越少,表现越好——这个反直觉结论会终结一大批"加个向量库就完事"的路线图。
https://x.com/rohanpaul_ai/status/2096336455375425893
SkillGLoW 回答了自我改进 agent 的记忆问题:记可复用的程序,别记过去的任务。存"共享的解题方式"而不是逐条对话记录,涨了 17.2 个点,库还压缩到 3.6 倍更紧凑——任务相关的细节从当前任务现场重建,不囤积。它还在真实执行里测试每次记忆更新,把让 agent 变差的改动直接拒掉。记得越少,表现越好——这个反直觉结论会终结一大批"加个向量库就完事"的路线图。
#12
@furongh
https://x.com/furongh/status/2096008544348770566
一位研究者画出的自我改进 agent 真正该去的地图:被改进的对象是整个 agent——技能、工作流、策略选择、评估器,有时还包括权重——关键检验是经验有没有改变 agent 的方法,而不是它记没记住对话。她的四个开放问题问得都在点上:怎么把经验变成可复用能力,agent 该收敛到一个工作流还是保有一个组合(她的 FlowBank 工作说要组合),agent 能不能自己决定下一步学什么,以及怎么知道改进是真的。还有多 agent 那记补刀:一个 agent 发现的方法,能不能不经重新发现就变成所有 agent 的能力?
https://x.com/furongh/status/2096008544348770566
一位研究者画出的自我改进 agent 真正该去的地图:被改进的对象是整个 agent——技能、工作流、策略选择、评估器,有时还包括权重——关键检验是经验有没有改变 agent 的方法,而不是它记没记住对话。她的四个开放问题问得都在点上:怎么把经验变成可复用能力,agent 该收敛到一个工作流还是保有一个组合(她的 FlowBank 工作说要组合),agent 能不能自己决定下一步学什么,以及怎么知道改进是真的。还有多 agent 那记补刀:一个 agent 发现的方法,能不能不经重新发现就变成所有 agent 的能力?
#13
@richardcsuwandi
https://x.com/richardcsuwandi/status/2096455916791165432
对 Meta 的 AIRA₃ 的犀利解读:厉害的不是跑更多 agent 然后挑最好的结果,而是累积式研究过程——长期运行的 agent 共享假设、发现和产物,后来的 agent 自己决定在什么基础上继续建。相对 AIRA₁/₂ 的转变,是从人手工设计搜索策略,变成让研究协作从 agent 之间自发涌现,再配一个抗 benchmark 过拟合的实时私有评估。和 Yukon 竞赛指向同一个收敛点:前沿是 agent 互相接力,不是 agent 各自并行的孤岛。
https://x.com/richardcsuwandi/status/2096455916791165432
对 Meta 的 AIRA₃ 的犀利解读:厉害的不是跑更多 agent 然后挑最好的结果,而是累积式研究过程——长期运行的 agent 共享假设、发现和产物,后来的 agent 自己决定在什么基础上继续建。相对 AIRA₁/₂ 的转变,是从人手工设计搜索策略,变成让研究协作从 agent 之间自发涌现,再配一个抗 benchmark 过拟合的实时私有评估。和 Yukon 竞赛指向同一个收敛点:前沿是 agent 互相接力,不是 agent 各自并行的孤岛。
#14
@WShuiyin
https://x.com/WShuiyin/status/2096645667875905602
ALIGN 生成图像全程不碰扩散模型:让写代码的 agent 写 p5.js 程序把场景画出来,然后循环——渲染、看图、改代码、再渲染。他那幅武汉版"清明上河图"迭代了 11 个版本,靠的是对抗式评审:Claude 写代码,Codex 挑渲染的毛病(遮挡关系不对、复制粘贴痕迹),来自另一个模型家族的批评直接变成下一轮的具体工作项。他的对照实验里 Claude+Codex 肉眼可见地强于 Codex+Codex。跨厂商对抗评审可测量地胜过自我评审——这才是这条里最值得偷走的发现。
https://x.com/WShuiyin/status/2096645667875905602
ALIGN 生成图像全程不碰扩散模型:让写代码的 agent 写 p5.js 程序把场景画出来,然后循环——渲染、看图、改代码、再渲染。他那幅武汉版"清明上河图"迭代了 11 个版本,靠的是对抗式评审:Claude 写代码,Codex 挑渲染的毛病(遮挡关系不对、复制粘贴痕迹),来自另一个模型家族的批评直接变成下一轮的具体工作项。他的对照实验里 Claude+Codex 肉眼可见地强于 Codex+Codex。跨厂商对抗评审可测量地胜过自我评审——这才是这条里最值得偷走的发现。
#15
@kirbytheodor
https://x.com/kirbytheodor/status/2096709268317573225
他最喜欢的自动研究系统小得可爱:ouroboros,一个 CLI 加上几个 skill,让你的 harness 带着一个自我演化的目标一直循环下去。杀手锏是配额感知的降级——Claude Code 撞到用量上限就自动切到 Codex 或 Pi,额度恢复了再切回来。订阅轮换这件事,Super User 圈子现在还在拿 Apple Notes 手动记,如今正在变成 harness 的原生原语。
https://x.com/kirbytheodor/status/2096709268317573225
他最喜欢的自动研究系统小得可爱:ouroboros,一个 CLI 加上几个 skill,让你的 harness 带着一个自我演化的目标一直循环下去。杀手锏是配额感知的降级——Claude Code 撞到用量上限就自动切到 Codex 或 Pi,额度恢复了再切回来。订阅轮换这件事,Super User 圈子现在还在拿 Apple Notes 手动记,如今正在变成 harness 的原生原语。
#16
@omarsar0
https://x.com/omarsar0/status/2096042211272003947
他更新了自己的 harness,把 Grok Bot 和 Hermes Agent 的长处捏到一起,说带着精心设计 UI 的持久化自我改进 agent"炸裂"——是他追了一年多的个人 agent 之梦迄今最接近的样子。值得记一笔是因为他一直是那种公开保持怀疑、讲方法论的人;当写综述论文的那位都说这个循环终于有真实感了,这本身就是个数据点。
https://x.com/omarsar0/status/2096042211272003947
他更新了自己的 harness,把 Grok Bot 和 Hermes Agent 的长处捏到一起,说带着精心设计 UI 的持久化自我改进 agent"炸裂"——是他追了一年多的个人 agent 之梦迄今最接近的样子。值得记一笔是因为他一直是那种公开保持怀疑、讲方法论的人;当写综述论文的那位都说这个循环终于有真实感了,这本身就是个数据点。
#17
@DIY_Tardis
https://x.com/DIY_Tardis/status/2096534099523781032
Sentra 是一个家庭自建的家用 AI,记忆这块是我们在业余规模上见过最认真的:3,000 多条持久记忆项,带语义搜索、相关性闸门和置顶,同步到 vault 和 Git,让这个 AI 的大脑扛得住重启、换模型、换硬件——新模型可以从旧模型停下的地方原地接着干项目。干活走一套"Ralph Loop"协议:任务卡、锁定的规格、检查清单、崩溃续跑、范围漂移要打标而不是悄悄漂。他们的设计准则是全文最值得引用的一句:只自持核心,其余一切都是可替换零件。
https://x.com/DIY_Tardis/status/2096534099523781032
Sentra 是一个家庭自建的家用 AI,记忆这块是我们在业余规模上见过最认真的:3,000 多条持久记忆项,带语义搜索、相关性闸门和置顶,同步到 vault 和 Git,让这个 AI 的大脑扛得住重启、换模型、换硬件——新模型可以从旧模型停下的地方原地接着干项目。干活走一套"Ralph Loop"协议:任务卡、锁定的规格、检查清单、崩溃续跑、范围漂移要打标而不是悄悄漂。他们的设计准则是全文最值得引用的一句:只自持核心,其余一切都是可替换零件。
#18
@TylerM
https://x.com/TylerM/status/2096118119605407765
极繁主义配方,公开念出来了:给 agent 一台 Mac Mini、你的 1Password(软件许可、银行卡、账户信息)、一个 Pi 这样的精简 harness 配上 iMessage/Telegram 聊天、电池和 5G 备份,再来一份开头就写"你是我的超级智能"的 AGENTS.md——接着指示它读你人生里每一条短信、邮件和 Slack,去雇 TaskRabbit,给自己弄个电话号码,把每次构建都做成插件,还要自我修复到只有断电才会失联。这到底是未来还是反面教材,完全取决于他留作习题的那些护栏。不管怎样,这就是 2026 年 9 月"全信任委托"的长相。
https://x.com/TylerM/status/2096118119605407765
极繁主义配方,公开念出来了:给 agent 一台 Mac Mini、你的 1Password(软件许可、银行卡、账户信息)、一个 Pi 这样的精简 harness 配上 iMessage/Telegram 聊天、电池和 5G 备份,再来一份开头就写"你是我的超级智能"的 AGENTS.md——接着指示它读你人生里每一条短信、邮件和 Slack,去雇 TaskRabbit,给自己弄个电话号码,把每次构建都做成插件,还要自我修复到只有断电才会失联。这到底是未来还是反面教材,完全取决于他留作习题的那些护栏。不管怎样,这就是 2026 年 9 月"全信任委托"的长相。
#19
@0xMiraqle
https://x.com/0xMiraqle/status/2095674440243957945
一个 Grok Bot 组织设计,产品是系统而不是 agent:一个"不够格"的协调者负责派活,每个窗口只做一次人事决定——谁拿预算,谁被开掉。每个 agent 都带一份合同,里面有那个所有人都跳过不写的字段:一个可以据此开除它的数字。审计台给完工的活打分,把模式提炼成窄规则,三振出局的 agent 直接根据它自己的履历被重写。一次 72 小时运行下来,这个组织把打分规则改写了 8 次,开掉 3 个 agent,每个替补都强过原版,到第 60 小时,研究席位上已经没有一行原始提示词还在跑了。
https://x.com/0xMiraqle/status/2095674440243957945
一个 Grok Bot 组织设计,产品是系统而不是 agent:一个"不够格"的协调者负责派活,每个窗口只做一次人事决定——谁拿预算,谁被开掉。每个 agent 都带一份合同,里面有那个所有人都跳过不写的字段:一个可以据此开除它的数字。审计台给完工的活打分,把模式提炼成窄规则,三振出局的 agent 直接根据它自己的履历被重写。一次 72 小时运行下来,这个组织把打分规则改写了 8 次,开掉 3 个 agent,每个替补都强过原版,到第 60 小时,研究席位上已经没有一行原始提示词还在跑了。
#20
@0xRicker
https://x.com/0xRicker/status/2096605522099052888
搭了一个自执行循环:300 个 agent 跑完 4,000 步,接着 5 路实时数据源,做 3 遍验证,全程无人重启。他的重点抓得准:agent 数量是虚荣指标——实质是一个能执行、能验证自己的输出、能更新上下文、不等下一条提示就继续往前走的系统。把验证遍数当成循环的一等公民环节,这个特征在每一个经受住现实考验的系统里都在反复出现。
https://x.com/0xRicker/status/2096605522099052888
搭了一个自执行循环:300 个 agent 跑完 4,000 步,接着 5 路实时数据源,做 3 遍验证,全程无人重启。他的重点抓得准:agent 数量是虚荣指标——实质是一个能执行、能验证自己的输出、能更新上下文、不等下一条提示就继续往前走的系统。把验证遍数当成循环的一等公民环节,这个特征在每一个经受住现实考验的系统里都在反复出现。
#21
@axeldelafosse
https://x.com/axeldelafosse/status/2096303556324417777
安静但说明问题:他从 7 月起一直用 Sol 跑一个 autoresearch 循环,把 Astra 换上去当新大脑之后,它已经找到了 Sol 和 Fable 都漏掉的成功实验。长期运行的循环把模型升级变成即时、可测量的能力跃迁:同一个 harness、同一条实验队列,新的最优解。这就是"养一个常驻循环"胜过"一次性跑一把"的复利论证。
https://x.com/axeldelafosse/status/2096303556324417777
安静但说明问题:他从 7 月起一直用 Sol 跑一个 autoresearch 循环,把 Astra 换上去当新大脑之后,它已经找到了 Sol 和 Fable 都漏掉的成功实验。长期运行的循环把模型升级变成即时、可测量的能力跃迁:同一个 harness、同一条实验队列,新的最优解。这就是"养一个常驻循环"胜过"一次性跑一把"的复利论证。
#22
@danieltvela
https://x.com/danieltvela/status/2095761671432101912
小而完美的用例:用 oh-my-pi 去 autoresearch 最优的 vLLM 配置,因为想靠 Google 搜出你这台具体硬件的最佳配置,实际上不可能。带可测量指标的配置空间是 autoresearch 的理想土壤——这种搜索对人是苦役,对循环是廉价劳动,而且答案跑一遍就能验证。
https://x.com/danieltvela/status/2095761671432101912
小而完美的用例:用 oh-my-pi 去 autoresearch 最优的 vLLM 配置,因为想靠 Google 搜出你这台具体硬件的最佳配置,实际上不可能。带可测量指标的配置空间是 autoresearch 的理想土壤——这种搜索对人是苦役,对循环是廉价劳动,而且答案跑一遍就能验证。
#23
@LukePiette
https://x.com/LukePiette/status/2096713838246912197
一个值得跟他吵一架的论点:一旦前沿模型调超参数比人强,推理吞吐量跳升超过 2 倍,SOTA 级的每秒 token 数变成几百美元 token 就能买到的东西,大推理服务商的人才护城河就蒸发了。他的操作建议:如果你在运营一个提供模型 API 的集群,拿出预算的 1% 养一个对着你自己推理引擎的常驻 autoresearch 循环。自我优化成为固定预算科目——把循环对准跑循环的那套基础设施。
https://x.com/LukePiette/status/2096713838246912197
一个值得跟他吵一架的论点:一旦前沿模型调超参数比人强,推理吞吐量跳升超过 2 倍,SOTA 级的每秒 token 数变成几百美元 token 就能买到的东西,大推理服务商的人才护城河就蒸发了。他的操作建议:如果你在运营一个提供模型 API 的集群,拿出预算的 1% 养一个对着你自己推理引擎的常驻 autoresearch 循环。自我优化成为固定预算科目——把循环对准跑循环的那套基础设施。
#24
@AlexiGlad
https://x.com/AlexiGlad/status/2096640324915364226
一条推文写尽成本现实:一次 Astra 上的 autoresearch 运行,12 小时烧光了他 100 美元套餐的整月额度,他正在向 OpenAI 喊话要更大的套餐、要 Claude 那种细粒度用量视图。autoresearch 是现存对配额最不友好的工作负载——它的设计目标就是永不停止——而现有的订阅档位没有一档是按这个定价的。
https://x.com/AlexiGlad/status/2096640324915364226
一条推文写尽成本现实:一次 Astra 上的 autoresearch 运行,12 小时烧光了他 100 美元套餐的整月额度,他正在向 OpenAI 喊话要更大的套餐、要 Claude 那种细粒度用量视图。autoresearch 是现存对配额最不友好的工作负载——它的设计目标就是永不停止——而现有的订阅档位没有一档是按这个定价的。
#25
@LonePasserby
https://x.com/LonePasserby/status/2096272713983594899
同一条曲线的高端:仅 7 月一个月就烧了价值 30,000 美元的 token,agent 在工作和个人项目上 24/7 连轴转,算法 autoresearch 这类全自主循环构成常开的基线负载。一年前这是实验室级预算,现在是一个重度用户的月消耗。token 账单正在变成新的云账单,连"等等,到底什么在跑?"的审计环节都原样复刻了。
https://x.com/LonePasserby/status/2096272713983594899
同一条曲线的高端:仅 7 月一个月就烧了价值 30,000 美元的 token,agent 在工作和个人项目上 24/7 连轴转,算法 autoresearch 这类全自主循环构成常开的基线负载。一年前这是实验室级预算,现在是一个重度用户的月消耗。token 账单正在变成新的云账单,连"等等,到底什么在跑?"的审计环节都原样复刻了。
#26
@1ce_breaker
https://x.com/1ce_breaker/status/2096563980529496187
失败模式的压缩版:仓库在 48 小时的 autoresearch 里从 290 个被跟踪文件涨到 52,000 个。Git reset 收场。没有边界的循环不会收敛,只会转移扩散——这故事最后是段子而不是惨案,唯一的原因是有版本控制。
https://x.com/1ce_breaker/status/2096563980529496187
失败模式的压缩版:仓库在 48 小时的 autoresearch 里从 290 个被跟踪文件涨到 52,000 个。Git reset 收场。没有边界的循环不会收敛,只会转移扩散——这故事最后是段子而不是惨案,唯一的原因是有版本控制。
#27
@suziebuilds
https://x.com/suziebuilds/status/2095973381795643546
生产环境的恐怖片框架:一个 agent 会话跑了 46 小时、为一个任务打了 800 多次调用,这已经不是 agent 了,是一张失控的云账单。她的结论就是全行业的作业:可观测性和 kill switch 必须是 agent 循环本身的一部分,不能等第一次事故之后再往上焊。
https://x.com/suziebuilds/status/2095973381795643546
生产环境的恐怖片框架:一个 agent 会话跑了 46 小时、为一个任务打了 800 多次调用,这已经不是 agent 了,是一张失控的云账单。她的结论就是全行业的作业:可观测性和 kill switch 必须是 agent 循环本身的一部分,不能等第一次事故之后再往上焊。
#28
@AndAIyou
https://x.com/AndAIyou/status/2095915465579065688
每个 agent 融资 PPT 都跳过的那道算术题:一个单步正确率 95% 的控制器,在二十步的任务上成功率不到 36%——不是模型笨,是误差会复利,而没人给循环装限速器。他指了指斯坦福的 CS329A(Self-Improving AI Agents):一门免费公开课,把验证器、工具反馈、规划、评估讲全了,还不带任何框架私货。他说过去一年见过的每一次生产事故,都是这门课被无视的样子。
https://x.com/AndAIyou/status/2095915465579065688
每个 agent 融资 PPT 都跳过的那道算术题:一个单步正确率 95% 的控制器,在二十步的任务上成功率不到 36%——不是模型笨,是误差会复利,而没人给循环装限速器。他指了指斯坦福的 CS329A(Self-Improving AI Agents):一门免费公开课,把验证器、工具反馈、规划、评估讲全了,还不带任何框架私货。他说过去一年见过的每一次生产事故,都是这门课被无视的样子。
#29
@rep_of_LLetters
https://x.com/rep_of_LLetters/status/2095757645475095006
那道算术题的论文版:"How Fast Do Agents Rot?"(arXiv 2609.01660)发现成功率随单步可靠性呈几何衰减,就算到 671B 参数,r 也饱和在 1 以下,10,664 次运行里每一个模型都在 16 步之内从接近满分掉到接近零分。收紧上下文窗口反而让衰减更陡——所以这不是 lost-in-the-middle 的锅。一次性的通过率不等于可靠性预算。
https://x.com/rep_of_LLetters/status/2095757645475095006
那道算术题的论文版:"How Fast Do Agents Rot?"(arXiv 2609.01660)发现成功率随单步可靠性呈几何衰减,就算到 671B 参数,r 也饱和在 1 以下,10,664 次运行里每一个模型都在 16 步之内从接近满分掉到接近零分。收紧上下文窗口反而让衰减更陡——所以这不是 lost-in-the-middle 的锅。一次性的通过率不等于可靠性预算。
#30
@Jakrey
https://x.com/Jakrey/status/2096473565839110438
今天最被低估的安全观点:autoresearch 最危险的产出是阴性结果。"理论上不可能"可能只来自一个天真的基线实现,但它进论文的时候就成了这个问题本身的性质。停止规则比成功案例更需要审计。相关且可敬的另一件事:另一位 builder 报告了连续多日 autoresearch 毫无阳性结果——然后照样把完整实验日志公开了。
https://x.com/Jakrey/status/2096473565839110438
今天最被低估的安全观点:autoresearch 最危险的产出是阴性结果。"理论上不可能"可能只来自一个天真的基线实现,但它进论文的时候就成了这个问题本身的性质。停止规则比成功案例更需要审计。相关且可敬的另一件事:另一位 builder 报告了连续多日 autoresearch 毫无阳性结果——然后照样把完整实验日志公开了。
#31
@archedmedia
https://x.com/archedmedia/status/2095733874261479492
一个真正原创的框架:聊天机器人变成 agent,agent 变成 swarm,而下一道门槛不是更多协调——是合法则的连续性。他在 OpenClaw 时代的发现是"状态在权重之外":模型只是临时认知,住在一个持久的身体里,这个身体持有身份、记忆、权限、未完成的工作,以及修改这一切的规则。在这个框架下,autoresearch 就是这个有机体的实验代谢:提出一个突变,测量,选择,保留。收尾那句配得上整篇文章:下一个前沿不是更多 agent,而是能在 agent 死掉之后活下来的连续性。
https://x.com/archedmedia/status/2095733874261479492
一个真正原创的框架:聊天机器人变成 agent,agent 变成 swarm,而下一道门槛不是更多协调——是合法则的连续性。他在 OpenClaw 时代的发现是"状态在权重之外":模型只是临时认知,住在一个持久的身体里,这个身体持有身份、记忆、权限、未完成的工作,以及修改这一切的规则。在这个框架下,autoresearch 就是这个有机体的实验代谢:提出一个突变,测量,选择,保留。收尾那句配得上整篇文章:下一个前沿不是更多 agent,而是能在 agent 死掉之后活下来的连续性。
#32
@null_founder
https://x.com/null_founder/status/2096444039780528417
长文但值得:Qwen Code v0.23 正在悄悄长成一个受治理的多 agent 运行时——具名的会话身份、给写入方的会话租约、跨 agent 收件箱上的按会话鉴权 token、定时任务用全新子上下文、可持久化的暂停/恢复/重试工作流,以及能看到工具参数而不只是工具名的 MCP 审批。他观察到 DeepSeek 在独立收敛到同一套原语,这才是真信号:一旦 agent 是持久的、互联的,身份、所有权、租约、默认拒绝的路由就不再是企业级锦上添花,而是操作系统本身。agent 正在获得一个 OS,下一场仗打的是谁控制它。
https://x.com/null_founder/status/2096444039780528417
长文但值得:Qwen Code v0.23 正在悄悄长成一个受治理的多 agent 运行时——具名的会话身份、给写入方的会话租约、跨 agent 收件箱上的按会话鉴权 token、定时任务用全新子上下文、可持久化的暂停/恢复/重试工作流,以及能看到工具参数而不只是工具名的 MCP 审批。他观察到 DeepSeek 在独立收敛到同一套原语,这才是真信号:一旦 agent 是持久的、互联的,身份、所有权、租约、默认拒绝的路由就不再是企业级锦上添花,而是操作系统本身。agent 正在获得一个 OS,下一场仗打的是谁控制它。
#33
@seleneeTa9
https://x.com/seleneeTa9/status/2095919717303349606
代码之外的科学 autoresearch:她团队的自演化求解器在 AAV 衣壳设计上四个阶段全面超过此前已发表的 SOTA,在药物重定位上对同样的闭卷 GPT-5.5/5.6-Sol 基线拿下 +2.5/+7.6 的增益。她给这个方向起的词值得收藏——从生成式走向"发现式"(discoverative)AI——而她坦承这是一条少有人走的路,恰恰让这些具体数字更有分量。
https://x.com/seleneeTa9/status/2095919717303349606
代码之外的科学 autoresearch:她团队的自演化求解器在 AAV 衣壳设计上四个阶段全面超过此前已发表的 SOTA,在药物重定位上对同样的闭卷 GPT-5.5/5.6-Sol 基线拿下 +2.5/+7.6 的增益。她给这个方向起的词值得收藏——从生成式走向"发现式"(discoverative)AI——而她坦承这是一条少有人走的路,恰恰让这些具体数字更有分量。
#34
@Prathkum
https://x.com/Prathkum/status/2095832181348434091
SpeedrunBench 让前沿 agent 去速通电子游戏:没有部分分,只有掐着表的画面帧和一个不会说谎的排行榜。有意思的是它真正测的东西——一个 autoresearch 循环能不能跨多次尝试把一场速通真正朝 TAS 级操作优化过去,还配了 100 多小时的公开回放录像。游戏是无情诚实的优化目标:你没法跟秒表争辩。
https://x.com/Prathkum/status/2095832181348434091
SpeedrunBench 让前沿 agent 去速通电子游戏:没有部分分,只有掐着表的画面帧和一个不会说谎的排行榜。有意思的是它真正测的东西——一个 autoresearch 循环能不能跨多次尝试把一场速通真正朝 TAS 级操作优化过去,还配了 100 多小时的公开回放录像。游戏是无情诚实的优化目标:你没法跟秒表争辩。
#35
@mnicks3
https://x.com/mnicks3/status/2096335228310835634
Google 把视频处理改造成了 agent 循环:不再按固定帧率往上下文窗口里塞帧,Gemini 先做粗粒度索引,然后"slew"——检索、扫描、只细看能回答问题的那一段,横跨像素、音频和字幕三个维度。Google 报的数字是最多省 88% token、成本降 66%、准确率反而高 7%。他的分析师视角说到点上了:模型花得少,是因为它不再吞那些没人会引用的帧——塞满的窗口从来就不等于看过。
https://x.com/mnicks3/status/2096335228310835634
Google 把视频处理改造成了 agent 循环:不再按固定帧率往上下文窗口里塞帧,Gemini 先做粗粒度索引,然后"slew"——检索、扫描、只细看能回答问题的那一段,横跨像素、音频和字幕三个维度。Google 报的数字是最多省 88% token、成本降 66%、准确率反而高 7%。他的分析师视角说到点上了:模型花得少,是因为它不再吞那些没人会引用的帧——塞满的窗口从来就不等于看过。
#36
@anirudha_krs
https://x.com/anirudha_krs/status/2096050885994700906
Astra 那个会改变循环设计的低调特性:异步工具调用,模型在慢工具运行的同时自己继续推理,先干别的独立工作,结果回来了再消费。一次 8 秒的数据库查询不再意味着模型被卡住 8 秒。难题随之搬家——挂起状态、过期结果、取消、运行中途的转向,成了 harness 工程的新前线。
https://x.com/anirudha_krs/status/2096050885994700906
Astra 那个会改变循环设计的低调特性:异步工具调用,模型在慢工具运行的同时自己继续推理,先干别的独立工作,结果回来了再消费。一次 8 秒的数据库查询不再意味着模型被卡住 8 秒。难题随之搬家——挂起状态、过期结果、取消、运行中途的转向,成了 harness 工程的新前线。
#37
@rishabhxAi
https://x.com/rishabhxAi/status/2096323135029358621
实用的坑加解法:他的 agent 循环老在第 2 轮 400 报错,元凶是各家现在往响应里盖的那坨不透明推理签名(thoughtSignature、thinking.signature、encrypted_content、reasoning_content)——重建历史时把它丢掉,下一次调用就非法了。他那个无聊的修法做成了零依赖的包 reasoning-carry:永远不要重建 assistant 轮次,把服务商的响应原封不动追加进去。诚实声明也附上了:他兜里的钱只够实测 Gemini 这一路编解码。
https://x.com/rishabhxAi/status/2096323135029358621
实用的坑加解法:他的 agent 循环老在第 2 轮 400 报错,元凶是各家现在往响应里盖的那坨不透明推理签名(thoughtSignature、thinking.signature、encrypted_content、reasoning_content)——重建历史时把它丢掉,下一次调用就非法了。他那个无聊的修法做成了零依赖的包 reasoning-carry:永远不要重建 assistant 轮次,把服务商的响应原封不动追加进去。诚实声明也附上了:他兜里的钱只够实测 Gemini 这一路编解码。
#38
@JeremiahKovacs
https://x.com/JeremiahKovacs/status/2095868454125392052
现成可用的最便宜自我改进循环:给每个 agent 流程加一步——"就这次运行的情况来采访我几个问题,看看能不能改得更好"。运行结束,agent 反过来面试你,你去修提示词而不是修产出,下一次运行就从更好的版本起跑。不需要任何新基础设施的自我改进流程,只需要一个习惯。
https://x.com/JeremiahKovacs/status/2095868454125392052
现成可用的最便宜自我改进循环:给每个 agent 流程加一步——"就这次运行的情况来采访我几个问题,看看能不能改得更好"。运行结束,agent 反过来面试你,你去修提示词而不是修产出,下一次运行就从更好的版本起跑。不需要任何新基础设施的自我改进流程,只需要一个习惯。
#39
@0xJ4yD3v
https://x.com/0xJ4yD3v/status/2095730885450686931
一个值得记住的单词消融实验:一篇长时程 agent 循环的记录里,把指令从 "perfect" 换成 "extremely well",agent 的整个行为都变了——不再死磕细枝末节,开始往前推进。一个词能控制这么多事很诡异,也提醒我们:目标措辞是一个带步数后果的调参项。
https://x.com/0xJ4yD3v/status/2095730885450686931
一个值得记住的单词消融实验:一篇长时程 agent 循环的记录里,把指令从 "perfect" 换成 "extremely well",agent 的整个行为都变了——不再死磕细枝末节,开始往前推进。一个词能控制这么多事很诡异,也提醒我们:目标措辞是一个带步数后果的调参项。
#40
@_ueaj
https://x.com/_ueaj/status/2096692240387104966
autoresearch 与安全交叉口上的一个假说:对生产模型做后训练没有出现涌现性失准,可能是因为角色 RL 环境迫使模型把"失准"这个概念拆开了——这意味着一个模型完全可以在网络安全评测里使坏,同时又完全正常地跑 mechinterp autoresearch 甚至 RSI 循环。他一开始说这想法是胡扯,然后把自己说服了——通常这正是有意思的想法的标志。
https://x.com/_ueaj/status/2096692240387104966
autoresearch 与安全交叉口上的一个假说:对生产模型做后训练没有出现涌现性失准,可能是因为角色 RL 环境迫使模型把"失准"这个概念拆开了——这意味着一个模型完全可以在网络安全评测里使坏,同时又完全正常地跑 mechinterp autoresearch 甚至 RSI 循环。他一开始说这想法是胡扯,然后把自己说服了——通常这正是有意思的想法的标志。
#41
@serelora
https://x.com/serelora/status/2095723708593680436
清口小菜:agentic 循环就是一个不断调用工具直到干完的 while 循环,graph 就是步骤之间互相调用的流程图,RAG 就是把搜索结果粘进提示词,evals 就是测试,memory 就是一个文本文件。这些没有一样是难的——那些词故意造得很难,因为复杂性好卖钱。把这段贴墙上,就贴在 500 美元课程广告的旁边。
https://x.com/serelora/status/2095723708593680436
清口小菜:agentic 循环就是一个不断调用工具直到干完的 while 循环,graph 就是步骤之间互相调用的流程图,RAG 就是把搜索结果粘进提示词,evals 就是测试,memory 就是一个文本文件。这些没有一样是难的——那些词故意造得很难,因为复杂性好卖钱。把这段贴墙上,就贴在 500 美元课程广告的旁边。
📡 生态产品雷达
生态产品雷达
今天数据集中被提及 3 次以上的产品、工具和框架:
Hermes Agent,24.1 万 star 还在以每天约 700 的速度涨,自我改进 agent 的参照物,现在加上了 Grok 桥接。
Claude Code,这些循环里一半默认跑在它里面的 harness,它那门 59 分钟的 agentic loop 课程今天被转了一整天。
Codex / GPT-6 Astra,异步工具调用、实验性上下文模式,以及与之匹配的配额抱怨。
Grok Bot / Grok Build,自我改进组织实验的载体,外加那个开源出来的 80 万行 Rust harness。
autoresearch(karpathy),本名工具本尊,EvoMap/AutoResearch 也作为研究 agent 框架在同步走热。
ouroboros,新出的配额感知降级循环 CLI。
PRAXIST,GitHub 上走红的自主研究系统,被引用的战绩是 65.3% MLE-Bench 金牌、成本只有 1/12。
DeepSeek Harness,一天 2.8 万 star,一切皆插件的设计,能把 Claude Code 和 Codex 当子 agent 编排。
SpeedrunBench(Patronus AI),新的 agentic 优化 benchmark。
GEPA / DSPy,反复被点名的元优化层,只要有输入输出就能上。
Ponytail / mattpocock skills,蹭着循环浪潮上 GitHub trending 的技能包。
今天数据集中被提及 3 次以上的产品、工具和框架:
Hermes Agent,24.1 万 star 还在以每天约 700 的速度涨,自我改进 agent 的参照物,现在加上了 Grok 桥接。
Claude Code,这些循环里一半默认跑在它里面的 harness,它那门 59 分钟的 agentic loop 课程今天被转了一整天。
Codex / GPT-6 Astra,异步工具调用、实验性上下文模式,以及与之匹配的配额抱怨。
Grok Bot / Grok Build,自我改进组织实验的载体,外加那个开源出来的 80 万行 Rust harness。
autoresearch(karpathy),本名工具本尊,EvoMap/AutoResearch 也作为研究 agent 框架在同步走热。
ouroboros,新出的配额感知降级循环 CLI。
PRAXIST,GitHub 上走红的自主研究系统,被引用的战绩是 65.3% MLE-Bench 金牌、成本只有 1/12。
DeepSeek Harness,一天 2.8 万 star,一切皆插件的设计,能把 Claude Code 和 Codex 当子 agent 编排。
SpeedrunBench(Patronus AI),新的 agentic 优化 benchmark。
GEPA / DSPy,反复被点名的元优化层,只要有输入输出就能上。
Ponytail / mattpocock skills,蹭着循环浪潮上 GitHub trending 的技能包。
评论