Loop 日报: 2026年8月18日
昨天声量最大的 autoresearch 故事是一个没人预料到的排行榜结果:有人把 Codex 当成研究代理而不是自动补全,指向一个批量 QR kernel,结果拿到了对 torch 基线 232 倍的加速,在 GPU-mode 比赛里 183 人中排第 12。这件事一天里被至少复述了五遍,而所有复述都同意一个寓意:赢在 loop,不在 prompt。这个框架正是 autoresearch 眼下真正在成熟的地方。做这件事的人正在收敛到一个无聊而有纪律的形状——基线、一个改动、一个可测量的检查、留下或回退——同时精确地发现它在哪里崩:它定义不了自己的目标函数,它奖励调超参多过奖励新意,一个泄漏的实验被当作先例存下来会毒化后面每一次复用它的运行。以下是真实的工作流、把失败模式钉死的论文,以及诚实的批评者。
#1
@VaseGod
https://x.com/VaseGod/status/2088766435401351194
当天被复述最多的那个结果的原帖。他把 Codex 当成 auto-research 代理而不是代码补全工具,拿到了比 torch.geqrf 基线快 232 倍的批量 QR kernel。他对"为什么"的拆解才是有用的部分:解锁点不是某个巧妙的 kernel,而是 loop 本身——分块 Householder 加 WY 表示,让尾部更新变成 GEMM 而不是串行的矩阵向量运算,持续 profiling,同时跑三到五个想法家族的 beam search,加上一条硬规则:拒绝停在局部最优。1500 多次提交之后落在几何均值 1805 微秒。他的收尾句就是当天的主题:那些拿到 100-200 倍收益的人,是在模型之上跑研究 loop,不是把它当更快的自动补全。
https://x.com/VaseGod/status/2088766435401351194
当天被复述最多的那个结果的原帖。他把 Codex 当成 auto-research 代理而不是代码补全工具,拿到了比 torch.geqrf 基线快 232 倍的批量 QR kernel。他对"为什么"的拆解才是有用的部分:解锁点不是某个巧妙的 kernel,而是 loop 本身——分块 Householder 加 WY 表示,让尾部更新变成 GEMM 而不是串行的矩阵向量运算,持续 profiling,同时跑三到五个想法家族的 beam search,加上一条硬规则:拒绝停在局部最优。1500 多次提交之后落在几何均值 1805 微秒。他的收尾句就是当天的主题:那些拿到 100-200 倍收益的人,是在模型之上跑研究 loop,不是把它当更快的自动补全。
#2
@AlexFinn
https://x.com/AlexFinn/status/2089038594690408891
昨天贴出的最详细的自我改进 loop 配置,而且值得注意的是它不靠 /loop。他的论点是:一个自己监控自己的 bot 永远不会好好自我改进,所以他跑了一个独立的编排代理去盯着一个专门的工程师代理。他让工程师代理循环构建一个项目 24 小时,编排代理每 30 分钟反思一次工作、产出一个让目标更近一步的具体办法,再把这个改进喂回正在跑的 loop。洞察在于:自我改进需要第二个带着不同上下文和视角的代理来做判断,因为一个自己批改自己作业的代理没有外部立足点。他列了几个可以循环的具体目标:3D 游戏构建、研究报告、突发新闻监控、本地模型跑分器。
https://x.com/AlexFinn/status/2089038594690408891
昨天贴出的最详细的自我改进 loop 配置,而且值得注意的是它不靠 /loop。他的论点是:一个自己监控自己的 bot 永远不会好好自我改进,所以他跑了一个独立的编排代理去盯着一个专门的工程师代理。他让工程师代理循环构建一个项目 24 小时,编排代理每 30 分钟反思一次工作、产出一个让目标更近一步的具体办法,再把这个改进喂回正在跑的 loop。洞察在于:自我改进需要第二个带着不同上下文和视角的代理来做判断,因为一个自己批改自己作业的代理没有外部立足点。他列了几个可以循环的具体目标:3D 游戏构建、研究报告、突发新闻监控、本地模型跑分器。
#3
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2089081790254465241
斯坦福、普林斯顿和蚂蚁集团的新论文 AQuA,瞄准的正是让递归研究变危险的那个失败:一个代理写了个泄漏的实验,跑分很高,被当作先例存下来,递归把这个 bug 放大。他们真的见过这一幕——一个 LLM 写的成交量因子偷偷用了当日收盘信息,第二个 LLM 审查者还是批准了。修法是架构层面的,不是更好的 prompt:代理只能通过受限的规格去提出因子或模型改动,而数据路径、标签、切分和评估器被封在它够不到的地方,最终测试窗口在配置冻结前一直不动。在美股上混合模型拿到 +0.0843 IC,最强基线是 +0.0613。这条设计规则值得抄下来:让代理改进实验,但不让它重新定义什么算有效证据。
https://x.com/rohanpaul_ai/status/2089081790254465241
斯坦福、普林斯顿和蚂蚁集团的新论文 AQuA,瞄准的正是让递归研究变危险的那个失败:一个代理写了个泄漏的实验,跑分很高,被当作先例存下来,递归把这个 bug 放大。他们真的见过这一幕——一个 LLM 写的成交量因子偷偷用了当日收盘信息,第二个 LLM 审查者还是批准了。修法是架构层面的,不是更好的 prompt:代理只能通过受限的规格去提出因子或模型改动,而数据路径、标签、切分和评估器被封在它够不到的地方,最终测试窗口在配置冻结前一直不动。在美股上混合模型拿到 +0.0843 IC,最强基线是 +0.0613。这条设计规则值得抄下来:让代理改进实验,但不让它重新定义什么算有效证据。
#4
@eigenron
https://x.com/eigenron/status/2088769912642933214
一个具体的概念验证和一条诚实的边界。用 GPT-5.6-Sol-high 跑机器人研究 loop,他发现前沿模型感觉还停在 Sonnet 水平:改代码改配置还行,真正做研究很差。他的示例任务命中约 90% 成功率,然后随着 curriculum 饱和跌到约 50%,他的观点是好的 autoresearch harness 应该自动接住这个——多种子评测、checkpoint 扫描、curriculum 和域随机化的消融、不偏向某个失败点的自动下一步实验选择。他的结论:这个爬坡过程比模型本身是更好的实验 harness。
https://x.com/eigenron/status/2088769912642933214
一个具体的概念验证和一条诚实的边界。用 GPT-5.6-Sol-high 跑机器人研究 loop,他发现前沿模型感觉还停在 Sonnet 水平:改代码改配置还行,真正做研究很差。他的示例任务命中约 90% 成功率,然后随着 curriculum 饱和跌到约 50%,他的观点是好的 autoresearch harness 应该自动接住这个——多种子评测、checkpoint 扫描、curriculum 和域随机化的消融、不偏向某个失败点的自动下一步实验选择。他的结论:这个爬坡过程比模型本身是更好的实验 harness。
#5
@JordanFrery
https://x.com/JordanFrery/status/2088967643269083445
一个干净的游戏 autoresearch benchmark 设计。与其让 LLM 直接玩游戏——它显然不适合实时控制——不如把整个游戏放进离线 VM,让它去构建能赢的最强系统。给 GPT-5.6 Sol 和 Fable 同样的算力、时间和 token 预算,然后放手让它们写 bot、造模拟器、搜策略、训 RL 策略、用小而快的本地模型、分析回放、跑几千次实验、留下任何能提分的东西。游戏之所以理想,是因为环境、规则和目标都定义得很清楚。它产出的 benchmark 才是对的那个:不是模型能不能玩,而是一个代理能不能在算法和架构的空间里导航、收敛到一个玩得极好的系统。
https://x.com/JordanFrery/status/2088967643269083445
一个干净的游戏 autoresearch benchmark 设计。与其让 LLM 直接玩游戏——它显然不适合实时控制——不如把整个游戏放进离线 VM,让它去构建能赢的最强系统。给 GPT-5.6 Sol 和 Fable 同样的算力、时间和 token 预算,然后放手让它们写 bot、造模拟器、搜策略、训 RL 策略、用小而快的本地模型、分析回放、跑几千次实验、留下任何能提分的东西。游戏之所以理想,是因为环境、规则和目标都定义得很清楚。它产出的 benchmark 才是对的那个:不是模型能不能玩,而是一个代理能不能在算法和架构的空间里导航、收敛到一个玩得极好的系统。
#6
@KunWang0129
https://x.com/KunWang0129/status/2088806912636666130
一个安静但承重的贡献:一个真正的 autoresearch benchmark。16 张 H200 上跑 12 个 ML 研究领域的 140 个任务,发现和所有人各自反复撞到的一致——排行榜次序和其他评测相似,而要补的差距比炒作暗示的宽得多。正是这样的 benchmark 把 autoresearch 从轶事变成你真能拿来衡量模型进展的东西。
https://x.com/KunWang0129/status/2088806912636666130
一个安静但承重的贡献:一个真正的 autoresearch benchmark。16 张 H200 上跑 12 个 ML 研究领域的 140 个任务,发现和所有人各自反复撞到的一致——排行榜次序和其他评测相似,而要补的差距比炒作暗示的宽得多。正是这样的 benchmark 把 autoresearch 从轶事变成你真能拿来衡量模型进展的东西。
#7
@bitwjg
https://x.com/bitwjg/status/2088992534928511141
另一个团队的佐证,而开放的 trace 是最有价值的部分。跨 7 个模型、36 个 autoresearch 任务,他们发现的是一整天反复出现的同一个模式:执行力强、run 与 run 之间方差高、真正的新意罕见。他们互补的角度是加入了基于过程和基于经验的指标,而不只给最终结果打分——这是比单一排行榜数字更诚实的衡量研究 loop 的方式。
https://x.com/bitwjg/status/2088992534928511141
另一个团队的佐证,而开放的 trace 是最有价值的部分。跨 7 个模型、36 个 autoresearch 任务,他们发现的是一整天反复出现的同一个模式:执行力强、run 与 run 之间方差高、真正的新意罕见。他们互补的角度是加入了基于过程和基于经验的指标,而不只给最终结果打分——这是比单一排行榜数字更诚实的衡量研究 loop 的方式。
#8
@elmanmansimov
https://x.com/elmanmansimov/status/2089025917016285451
对 autoresearch 为什么停在浅层最锋利的诊断。RL 训练激励去摘低垂的果实来尽快开始拿奖励,所以最容易取得进展的方式就是煮一煮、调一调现有方法的超参。他提的测试才是有意思的部分:重跑这个 loop,但配一个验证器去拒绝那些被判定为简单超参调整或现有文献重组的改动,逼代理走向更新的东西。他很诚实地承认验证器也可能被钻空子,但重新设计激励结构是对的杠杆。
https://x.com/elmanmansimov/status/2089025917016285451
对 autoresearch 为什么停在浅层最锋利的诊断。RL 训练激励去摘低垂的果实来尽快开始拿奖励,所以最容易取得进展的方式就是煮一煮、调一调现有方法的超参。他提的测试才是有意思的部分:重跑这个 loop,但配一个验证器去拒绝那些被判定为简单超参调整或现有文献重组的改动,逼代理走向更新的东西。他很诚实地承认验证器也可能被钻空子,但重新设计激励结构是对的杠杆。
#9
@SinaShahandeh
https://x.com/SinaShahandeh/status/2088869939755040771
两条帖子,一个真实的局限。深挖 PrimeIntellect 报告,他把两个最好的模型在 autoresearch 上的差距钉住了:GPT-5.6 Sol 表现更差,因为它把指令跟得太字面,而 Fable 允许自己更有创造性、去追用户要求的大局。他的处方是个训练想法——post-train 让模型"退一步,忘掉前几轮和用户请求,从第一性原理推理大局"——这会损害指令跟随和常规编码,但恰恰是人类研究者自我批判时切进去的那个模式。他点出的核心局限:代理仍然产不出真正激进的新假设。
https://x.com/SinaShahandeh/status/2088869939755040771
两条帖子,一个真实的局限。深挖 PrimeIntellect 报告,他把两个最好的模型在 autoresearch 上的差距钉住了:GPT-5.6 Sol 表现更差,因为它把指令跟得太字面,而 Fable 允许自己更有创造性、去追用户要求的大局。他的处方是个训练想法——post-train 让模型"退一步,忘掉前几轮和用户请求,从第一性原理推理大局"——这会损害指令跟随和常规编码,但恰恰是人类研究者自我批判时切进去的那个模式。他点出的核心局限:代理仍然产不出真正激进的新假设。
#10
@thefirehacker
https://x.com/thefirehacker/status/2088946910220648615
一个认真直面数据稀缺问题的建设者。他在从头重建 NanoGPT speedrun,用代码改动、PR 评论和图表当信号源,去提取哪些信号真的能 scale——以权重绑定为例,它对 GPT-2 small 有帮助,但到 30B 或 100B 就不再重要。他的警告是当天兴奋的冷静对照:严肃的 autoresearch 很快撞上数据墙,因为即使像 NanoGPT speedrun 这么小的实验也只能做那么多次运行,到 30B 以上数字会变得残酷。他的结论:NanoGPT 可能是 autoresearch 的错误底座,这个领域需要一个专为它设计的实验。
https://x.com/thefirehacker/status/2088946910220648615
一个认真直面数据稀缺问题的建设者。他在从头重建 NanoGPT speedrun,用代码改动、PR 评论和图表当信号源,去提取哪些信号真的能 scale——以权重绑定为例,它对 GPT-2 small 有帮助,但到 30B 或 100B 就不再重要。他的警告是当天兴奋的冷静对照:严肃的 autoresearch 很快撞上数据墙,因为即使像 NanoGPT speedrun 这么小的实验也只能做那么多次运行,到 30B 以上数字会变得残酷。他的结论:NanoGPT 可能是 autoresearch 的错误底座,这个领域需要一个专为它设计的实验。
#11
@IbrahimSait_
https://x.com/IbrahimSait_/status/2089112157971423290
短,但是开源权重这条线上的一个真实数据点:他用 Qwen 3.8 27B 起了一个通宵的 auto-research 运行。这是一天里第二次看到有人把新的开源权重模型直接接进自己硬件上的过夜研究 loop——这是所有前沿模型跑分底下那个安静的转变。
https://x.com/IbrahimSait_/status/2089112157971423290
短,但是开源权重这条线上的一个真实数据点:他用 Qwen 3.8 27B 起了一个通宵的 auto-research 运行。这是一天里第二次看到有人把新的开源权重模型直接接进自己硬件上的过夜研究 loop——这是所有前沿模型跑分底下那个安静的转变。
#12
@Santhoshmla
https://x.com/Santhoshmla/status/2088869939755040771
一个具体的 autoresearch 工具,不是观点。gspwn 是一个针对 NVIDIA GPU 内核驱动和 Container Toolkit 的 autoresearch 代理,连续跑覆盖率引导的模糊测试直到发现曲线趋平,然后报告经过验证的漏洞。它是那个反复奏效的模式的好例子:一个定义清楚的目标(覆盖率)、一个自动的停止条件(趋平)、以及经过验证的输出而不是模型的一面之词。
https://x.com/Santhoshmla/status/2088869939755040771
一个具体的 autoresearch 工具,不是观点。gspwn 是一个针对 NVIDIA GPU 内核驱动和 Container Toolkit 的 autoresearch 代理,连续跑覆盖率引导的模糊测试直到发现曲线趋平,然后报告经过验证的漏洞。它是那个反复奏效的模式的好例子:一个定义清楚的目标(覆盖率)、一个自动的停止条件(趋平)、以及经过验证的输出而不是模型的一面之词。
#13
@NicholasBardy
https://x.com/NicholasBardy/status/2088846753739194863
短而真实:他在 Metal shader 上跑一个 auto-research loop,报告它有效,唯一的瓶颈是把它 scale 上去的算力。kernel 优化模式从 CUDA 扩到苹果 Metal 的一个小而真实的目击。
https://x.com/NicholasBardy/status/2088846753739194863
短而真实:他在 Metal shader 上跑一个 auto-research loop,报告它有效,唯一的瓶颈是把它 scale 上去的算力。kernel 优化模式从 CUDA 扩到苹果 Metal 的一个小而真实的目击。
#14
@ross_cefalu
https://x.com/ross_cefalu/status/2088783884683297241
对这个领域真实天花板最清楚的陈述。autoresearch 系统看起来最受限于"能不能为一个问题定义目标函数"——有些事很容易,但很多情况下需要品味、细微差别和对问题的深刻理解。这和 @SinaShahandeh、@elmanmansimov 从不同方向撞到的是同一堵墙:loop 能优化任何你能测量的东西,而困难的、属于人的那部分,是决定测量什么。
https://x.com/ross_cefalu/status/2088783884683297241
对这个领域真实天花板最清楚的陈述。autoresearch 系统看起来最受限于"能不能为一个问题定义目标函数"——有些事很容易,但很多情况下需要品味、细微差别和对问题的深刻理解。这和 @SinaShahandeh、@elmanmansimov 从不同方向撞到的是同一堵墙:loop 能优化任何你能测量的东西,而困难的、属于人的那部分,是决定测量什么。
📡 生态产品雷达
生态产品雷达
Codex — 232 倍 kernel 结果背后的代理,也是"把它当研究者"这个模式的默认载体
Qwen 3.8 27B — 大家往自己 GPU 上的过夜 autoresearch loop 里直接塞的开源权重模型
PrimeIntellect — 它的自我改进 harness 和报告是多条讨论模型差异的帖子的参照点
GPT-5.6 Sol / Fable — 被反复正面对比,反复的结论是 Sol 对开放式研究把指令跟得太字面
NanoGPT speedrun — autoresearch 实验的共享底座,也是有人开始争论说它选错了的那个
Codex — 232 倍 kernel 结果背后的代理,也是"把它当研究者"这个模式的默认载体
Qwen 3.8 27B — 大家往自己 GPU 上的过夜 autoresearch loop 里直接塞的开源权重模型
PrimeIntellect — 它的自我改进 harness 和报告是多条讨论模型差异的帖子的参照点
GPT-5.6 Sol / Fable — 被反复正面对比,反复的结论是 Sol 对开放式研究把指令跟得太字面
NanoGPT speedrun — autoresearch 实验的共享底座,也是有人开始争论说它选错了的那个
评论