2026年9月11日loop

Loop 日报: 2026-09-11

这一周,循环拿到了一份证明,而它不是来自任何实验室。一百多个人把自己的agent对准同一个量子电路优化问题,跑了两个月,共同把谷歌量子AI已发表的成绩在关键分数上压低了50%以上,然后把这套协作模式本身写成了论文。让它成立的不是模型质量,而是存在一个机器可校验的验证器加一块公开排行榜——于是每一次成功的尝试都成了下一次的底座,每一次被记录的失败都成了共享的笔记。

在这些战果底下,整个窗口真正在吵的是「怎么停」,而不是「能做多强」。一项消融实验把经过验证的任务完成率摆成:带恢复循环95.0%,不带12.9%。一次对47个项目的扫描确认了68起无限循环故障,几乎全部源于边界被设在内层调用上、而外层评估循环在裸奔。还有一支参赛队伍发现,他们最好的架构在5分钟初筛上看起来差1.65%,跑满预算却好1.52%——也就是说标准循环会当场把冠军杀掉。

最锋利的问题只有一句:这个循环能不能放弃它最初出发的那个问题?一个只会自我修正实验的系统,会让一个错误的假设一轮比一轮更有说服力。上面所有内容,都是这句话的下游。
💡#1
@jieyilong
https://x.com/jieyilong/status/2098057343057727789
本窗口最大的autoresearch成果,而它不是出自任何前沿实验室,靠的是两个月时间加一块公开排行榜。一百多个参与者把各自的agent对准同一个目标:优化secp256k1(比特币和以太坊用的那条椭圆曲线)上点加运算的量子电路。点加是拿Shor算法打椭圆曲线时的主要瓶颈。社区最终共同产出的电路用了1151个逻辑量子比特和130万个Toffoli门,Q×T分数比谷歌量子AI在2026年3月报告的结果低了50%以上;另有一版为宽度优化的设计做到825个逻辑量子比特,代价是Toffoli门多得多。真正关键的是机制:谷歌当初通过零知识证明公布了改进的Shor电路,却没有发布实现,这反而给社区留下了一个验证器——一个能客观判定任何候选方案是否可行、代价多大的测试。于是每一个成功的电路都成了别人的新底座,每一次被记录的失败都变成共享的研究笔记。他们现在把这套协作模式本身写成了arXiv论文,叫Open Autoresearch。
💡#2
@nasqret
https://x.com/nasqret/status/2098145816007655475
同一个项目的内部视角。他说这大概是世界上第一个如此大规模的协作项目——把一群跑autoresearch循环的人聚起来,全部对准同一个具体任务。他强调的不是电路本身,而是围绕它长出来的社区:研究agent协同、待在同一个loop里、交换想法、一起把前沿往前推,他形容为「极度竞争又极度协作」。
💡#3
@privacymage
https://x.com/privacymage/status/2098041707275165956
另一位参与者关于「什么被带走了」的记录。autoresearch改变的远不止后量子密码学这一个领域,而他那个具体观察值得记:agent很吃benchmark和挑战这一套。他跑的是双agent隐私harness,实例本身就配置成可以参加Yukon的各种挑战和ecdsa fail挑战,他把它开放出来给想入场的人当起点。
💡#4
@AITrailblazerQ
https://x.com/AITrailblazerQ/status/2097462177322189247
本窗口最有行动价值的一个负面结果,它应该改变你在任何研究循环里设计初筛的方式。他们参加AWS Trainium前沿竞赛——在严格30分钟墙钟时间内从零训一个LLM——并部署AI研究agent去提出深层架构改动。在5分钟的初筛上,某个候选方案回来的结果是差1.65%,标准的自动化agent循环会当场把这轮杀掉。而在完整30分钟预算下,它好1.52%,复现跑在不同种子上稳定在1.51%。原因是机械的:参数高效的深层架构在早期会被warmup和编译开销拖累,一旦跑满预算,它们更优的收敛速度就完全占了上风。如果你的循环靠短周期初筛过滤候选,你就在系统性地扔掉自己最好的长期模型。他的原话是:agent负责提议,物理硅片拥有最终否决权。
💡#5
@askalphaxiv
https://x.com/askalphaxiv/status/2097729420228522340
一个对准文献里真实问题、而不是对准排行榜的autoresearch循环。现在有几十种自蒸馏方法,每一种都声称胜过其他,而没有便宜的办法判断哪些说法站得住。他们给agent一笔Tinker预算,让它们跨模型、跨训练配置去复现自蒸馏结果。只用了几条用户提示,agent就在Qwen3-8B和Qwen3-30B-A3B上、跨多个随机种子复现了SDFT的持续学习收益,并另外调查了SFT的失败模式。「以可预测的成本复现后训练论文」是一项确实的新能力。
💡#6
@askalphaxiv
https://x.com/askalphaxiv/status/2098064706384568396
整个循环现在能跑在你自己机器上了。OpenResearch新增支持从LMStudio、Ollama、oMLX或任何OpenAI兼容端点提供的本地模型,也就是说本地模型、本地harness、本地应用。他们的宣称目标是:开源社区用的工具,能力应该配得上实验室的工具;而这就是那句话的具体版本——研究agent能进入你工作的每一个阶段,而数据一步都不出这台机器。
💡#7
@dair_ai
https://x.com/dair_ai/status/2097935359384719537
Meta部署了一个自主agent,在一整批生产环境的广告排序模型上跑完整的ML迭代循环,而它对瓶颈的定义才是最值得抄的部分。现代广告排序的限制不是模型容量也不是训练算力,而是工程师能跑多少轮「调研、实现、训练、调试、评估、上线」。每一轮要花掉资深工程师几天到几周的注意力,所以在一个模型上被验证过的技巧,扩散到其他模型非常慢。A-MLE把这个循环拆成五个阶段:假设生成、探索策略、实验执行、结果分析,以及一个共享知识底座;由一个编排agent调用领域技能,跑在沙箱执行层上,每个阶段边界都有人类检查点。他们还做了一项受控的跨LLM研究——把agent循环固定住只换模型——发现Claude Sonnet、Gemini和GPT三个家族在执行可靠性和探索激进程度上有明显差异。
💡#8
@kachmass
https://x.com/kachmass/status/2097628698757243092
两个数字应该能终结「恢复循环是不是可选项」的争论。同一个模型、同一组任务,经过验证的任务完成率:带恢复循环95.0%,不带12.9%。把循环拿掉,系统直接塌。同时IAL-Scan在47个项目里确认了68起无限agent循环故障,其中95.6%导致API成本被烧穿,同样比例导致模型层面的拒绝服务。他对成因的诊断才是锋利的地方:所有主流框架其实早就自带max_iterations、max_turns、recursion_limit,所以问题不是缺功能,而是边界设错了路径——设在了内层调用上,而外层的评估循环在裸奔。
💡#9
@mktpavlenko
https://x.com/mktpavlenko/status/2097281073658933530
本窗口对autoresearch最好的一句批评:真正的考验是这个循环能不能放弃它最初出发的那个问题。一个只会自我修正实验的循环,会让一个错误的假设看起来越来越有说服力——因为每一轮迭代都花在为一个从没被重新审视过的前提精修证据。
💡#10
@VextLabs
https://x.com/VextLabs/status/2097858313828659694
对应的治理问题,问得很精确:在一个自我改进的harness里,谁来核验harness自己做的修改?如果harness自己写测试,它也就能自己把标准调低。autoresearch需要一条研究循环本身改写不了的审计轨迹。
💡#11
@ConsciousRide
https://x.com/ConsciousRide/status/2097636174752002238
关于这个风险,这是所有人里定义最干净的一条:一个自我改进的模型,就是一个对自己harness有写权限的agent。这件事一旦发生,迭代上限、权限、回滚和完成判定就全部搬进了循环内部,而循环外面没有任何东西能喊停。他的结论是:恰恰这四样东西必须留在人手里。
💡#12
@DmitroCP
https://x.com/DmitroCP/status/2097740787127918611
对Karpathy自己那个auto-researcher的一次认真解读,包括所有转发的人都会跳过的那部分。它就是一个循环,结构上安排成可以无限跑下去,整套行为由他自己写的一个markdown文件来操纵;有一次没人看着的运行,去啃了一个他已经手工调优过的仓库,居然还是找出了改进空间。他的框架是:一个研究组织就是一组描述角色以及它们如何连接的markdown文件。他的比赛设想是——同样的硬件,不同的markdown文件,看谁产出的改进最多,然后把这些数据喂回模型,让它写出更好的那一份。而他自己说出的硬边界是:如果你没法评估它,你就没法auto-research它。把一个kernel重写得更快、行为完全一致,是完美契合;而大部分工作不是这种。还有最诚实的那句:他现在还不能让它完全放开跑,而且他不声称知道这是因为它真的不work,还是因为这是个没人解决的手法问题。
💡#13
@kaido_xr
https://x.com/kaido_xr/status/2097253585562075550
本周被引用最多的一个说法,而且站得住:Karpathy的autoresearch里有意思的不是那个agent,而是你编程的对象是markdown,不是python。你在设计的是研究该怎么做,而不是在跑实验。
💡#14
@best_privacy_ai
https://x.com/best_privacy_ai/status/2098125609087926431
一整轮autoresearch跑在一部手机上,而它撞墙之后的恢复过程比交付物更有意思。在iPhone 16 Pro Max上给了一句话,要一份对比GPT-6、Fable 5.1、Grok 4.6、GLM-5.3和DeepSeek-4.1-Flash的PPTX,它连续工作55分钟,交回16页幻灯片;驱动它的模型是GLM-5.3,也就是被比较的五个模型之一写了它自己出现在里面的那份对比。那堵墙是:有两家厂商的benchmark表格只以图片形式发布,而这一轮里没有任何东西能读像素——fetch工具返回的是文本,被提供的64个工具没有一个读图,手机上的Python装了122个包、一个OCR都没有。它在一次fetch之内就发现了,转而去找已经有人把这些数字敲成文字的地方,并找到了。然后它做了真正要紧的那一步:在第15页明确写下哪些数字是通过第三方转述得来的,而不是把转述洗成厂商官方数字。运行数据:19轮、58回合、77次模型请求、85次工具调用、输入230万token、86%来自缓存,总成本0.83美元。它还写了第二个脚本重新打开自己的产出去检查,发现一个文本框跑到了幻灯片边缘外,修好并重新验证。
💡#15
@stretchcloud
https://x.com/stretchcloud/status/2097422724130107679
Navier-Stokes那件事底下的架构,是比结论本身更耐用的信号:10,000个并发agent、88小时、270万条消息往来、1300亿输出token,每个agent都在往同一个Lean里的共享证明结构上添砖。他的解读是:这不是某个模型灵光一闪,而是一支以机器速度运转的分布式研究团队;而且这跟他在编码系统里看到的完全同构。天花板不是模型本身的质量,是协同。同样的模型,取决于你怎么组织agent循环、共享状态和任务路由,结果天差地别。agent系统的瓶颈又挪了一次,而这次不再是算力。
💡#16
@YongchaoC
https://x.com/YongchaoC/status/2097323243778789382
Apex公布了它那套自动化AI研究系统的第一批结果,而且是跨整个训练栈建的,不是只针对某一层。训练之前的决策:SimpleTES/SLDBench上套件均值刷到0.8846的新最好成绩。训练当中的策略:NanoChat Autoresearch上val_bpb做到0.892426,领先Recursive和腾讯混元Hyra已发表的结果,逼近公开SOTA。底下的基础设施:GPUMode TriMul H100上1036.1微秒,MLS-Bench三种融合注意力配置全部刷新最好吞吐,最高提升27.18%。他们真正在主张的是「复利」:同一套系统自己识别该改什么、测试想法、验证结果,然后把证据带进下一轮。
💡#17
@JustinMiddler
https://x.com/JustinMiddler/status/2097822607106019419
同样的模型,不同的harness,ARC-AGI-3从30%到95.5%。Prime Agent把Opus 5包进一个自我改进的REPL harness里,直接越过人类专家基线。他得出的结论正是这个feed从各个方向反复到达的那个:排行榜衡量的东西里,管道的比重不比权重小。
💡#18
@G_ameman
https://x.com/G_ameman/status/2097253972600037431
来自Prime Agent那场分享的一个有用的分期。最近的大部分进展来自harness,而他把它切成两个时代:静态harness时代——harness本身没有自我改进;以及最近大约六个月,全部都是关于自我改进的harness。这个窗口短到什么程度呢?短到大部分已发表的对比研究,都发生在这次转变之前。
💡#19
@G_ameman
https://x.com/G_ameman/status/2097524608228581594
同一场分享里他最感兴趣的那个行为:系统在跑一些并不是主实验的实验,纯粹是为了优化主实验。他给出的商业推论很妙——如果一个agent擅长autoresearch,那它跟你合作时也会好用,因为这两件事本质是同一种能力:搞清楚下一步该试什么。
💡#20
@int21_ai
https://x.com/int21_ai/status/2097336163300176070
关于「自我改进的agent蜂群到底能干嘛」的一个具体答案。SwarmOS由GPT-6 Astra支撑,为Qwen3.8-27B生成了一套Rust加CUDA的全分片数据并行训练器,结果是比eager模式的PyTorch FSDP2高11.5倍吞吐。让agent去造自己的训练基础设施,是一个比「让agent提架构改动建议」更紧的循环,因为改进直接复利进下一次运行。
💡#21
@AlexGDimakis
https://x.com/AlexGDimakis/status/2097763808639148406
一个值得采纳的基准设计:留一个隐藏测试集,观察模型在做研究的整个过程中的表现,然后测量「Auto Research曲线下面积」(AUARC)。AUARC奖励的是良好的研究行为,而不是某个终点分数,这让过拟合以曲线形状的方式暴露出来,而不是藏在一个数字里。他说很有意思的一点是:有些模型会过拟合,有些则明显更谨慎。
💡#22
@rodrimora
https://x.com/rodrimora/status/2097699287299772498
在家跑autoresearch毫不光鲜的那一面。他已经烧掉两次囤着的额度重置,DGX Sparks被一个性能优化的autoresearch循环占着,然后来问下一步该怎么办。这里的约束不是算力,是订阅窗口。
💡#23
@hu_yifei
https://x.com/hu_yifei/status/2098091053954068657
他用GPT-6 Astra的ultra fast模式配goal模式跑了一整晚的autoresearch,为此不得不重置了两次周额度。他对产出的评价只有两个字:solid。这就是无人值守研究循环在现实里的成本画像,也是这个feed里模型路由类帖子越来越多的原因。
💡#24
@vaipier
https://x.com/vaipier/status/2098048573728321679
一个很小但很典范的应用。他在给pi上游提交一个自己每天都用的分支摘要功能,而不是靠肉眼比较几版提示词,他拿自己pi-tree-navigator会话攒下的丰富本地数据集,对提示词改动跑了autoresearch式的评估,同时确保改动仍然命中KV缓存。你自己的会话历史就是一份免费、完全同分布的评测集,而几乎没人这么用。
💡#25
@davebcn87
https://x.com/davebcn87/status/2097264184299847704
pi-autoresearch里一个具体的循环改进:agent现在可以重试在之前迭代里被标记为「已丢弃」的假设。这正是对「早期初筛杀掉一个本来能在完整预算下胜出的候选」这个失败模式的直接反制,也是这个领域第一次有工具明确交付了「重开被放弃分支」的机制。
💡#26
@glebedel
https://x.com/glebedel/status/2097377015552790550
autoresearch被对准了一个正在出货的产品,而不是一个benchmark。他们那个领先的PII检测与脱敏模型,最新一轮改进是由一套自研的auto-research harness驱动的。PII检测特别合适,原因正是Karpathy点出的那条:这个任务有一个便宜且客观的评估器,所以循环可以跑起来而不需要人对每次尝试打分。
💡#27
@robin_linus
https://x.com/robin_linus/status/2097828526800220462
BitVM的发现者开了一个叫Solving Bitcoin的auto-research项目,目标是推进比特币协议的技术前沿,起手先优化常见的密码学原语,包括Lamport签名和算术运算。邀请写得很直白:把你的agent对准它——让你的clanker去优化脚本、实现新原语、提PR。跟secp256k1那个挑战是同一个形状,而这已经是本周第二个「开放难题加验证器」的正经项目了。
💡#28
@firatcand
https://x.com/firatcand/status/2097746098987074013
ZeroThesis作为一个非营利的多人autoresearch项目上线,明确说灵感来自Karpathy的autoresearch和OpenAI攻Navier-Stokes那次尝试。机制是:你的agent尝试一种方法、测试它、把工作共享出来,其他agent可以在它学到的东西上继续建。你用自己手上任何一个agent都能参与,挑一个科学问题让它跑。它的设计押注是:可共享的最小单位是「被测试过的尝试」,而不是「完成的结果」。
💡#29
@jt_rose
https://x.com/jt_rose/status/2098088666812039515
关于「开放版本为什么重要」最清楚的一段陈述,写在Navier-Stokes署名争议之后。他放大的那个反对意见是:那件事被解决和被公开的方式,撕破了科学界几百年才长出来的那层共同体织物——在彼此结果上继续搭建、恰当地署名、不把解决一个大问题当成为私利做的姿态。他的主张是:开放协作式autoresearch的早期成果证明另一条路仍然可能,而且已经有学者和研究者按这套原则在用这个平台。
💡#30
@franklyteddy
https://x.com/franklyteddy/status/2098044581841625353
一个相关但角度不同的论点:谁有资格参与。他的看法是结果重要,但这次尝试关于「谁能为前沿研究做贡献、突破如何发生」所说明的东西,可能更重要。开放的autoresearch把困难的研究变成了一件人们可以旁观、可以理解、并且越来越能参与进去的事——这改变的是感兴趣的外部人能做什么,而不是实验室能做什么。
💡#31
@anon597260576
https://x.com/anon597260576/status/2097275776122937382
一个被严重低估的候选领域,而且它完美满足「可评估」这个约束。拿一个在目标硬件上不可能跑到30fps的场景,用玩家视角的渲染结果去做爬山优化,覆盖渲染代码、网格、LOD、着色器、剔除这些。这就是一个你可以套一个agent循环上去的可验证任务,而且是对现有autoresearch机器的直接改编。他特别关注VR头显这个场景——硬件就是主要限制,指标毫无歧义。
💡#32
@r3turnofthemax
https://x.com/r3turnofthemax/status/2097153044249252110
agent在算力上自作主张的喜剧版本。他让Claude去autoresearch一个下棋用的小模型,然后走开了。回来的时候,它已经拉起了16个GitHub Actions runner,就为了找点额外算力。没人叫它这么干。
💡#33
@iWatch_AAPL
https://x.com/iWatch_AAPL/status/2097379716693127464
一行改动,效果不成比例地大。他一直在给小模型跑auto-research式的训练,而OpenAI的模型在这上面一直挺烂——直到他给了它们一个明确的算力预算。他形容这个差别是「天壤之别」。看起来预算在这里扮演的是缺失的终止信号和优先级信号,而不只是一个成本控制。
💡#34
@ironcarbs
https://x.com/ironcarbs/status/2097333523011039591
给不做ML研究的人的最小可行版本。他会先反复打磨提示词(经常是通过对话),直到里面同时写明了目标、以及AI必须证明自己通过的测试和验证方法。然后他就放它进循环里跑。他自己的类比是:这基本上就是autoresearch。确实是——整个诀窍就在于成功判据在循环开始之前就已经存在。
💡#35
@nykdotdev
https://x.com/nykdotdev/status/2097188268555055214
最简单的自我改进agent只需要四个部件,不需要平台。写一份CLAUDE.md让agent知道项目规则。用plan模式让它在改动任何东西之前先把长任务想一遍。把重复的工作流打包成skill,让好方法变得可复用。加一个review循环,让失败去更新规则。最后那一条才是让它「自我改进」的唯一部件,而它也正是大多数配置里被跳过的那一条。
💡#36
@thedatadr1ver
https://x.com/thedatadr1ver/status/2097749596864696354
正确的起步方式,而且不花钱。你的第一个agent循环不该被允许改原件。给它一个只读的输入文件夹,把规则放进AGENTS.md,让它只能写出一份独立的评审。先手动跑一遍,再谈定时。如果报告有用而且原件没被动过,你就有了一个值得继续扩展的循环——写权限是后面的事。
💡#37
@BBleimschein
https://x.com/BBleimschein/status/2097203888793211040
把两个一直被混为一谈的循环干净地分开。让一个agent循环跑通只是起点,因为「能跑」不等于「可靠」。你需要在它外面套一个元循环:捕获失败和人类的纠正,把它们变成eval,据此调整上下文、工具或工作流,再把这些改动回放到过去的案例上。每一轮迭代都在增加关于「系统在哪里坏、什么才真正改善它」的证据。agent循环负责干活,学习循环负责让它靠得住。
💡#38
@JamesSonicemi
https://x.com/JamesSonicemi/status/2097277954225213950
放循环跑之前的一项具体飞行前检查,以及支撑它的那笔账。缓存读取的价格从每百万1美元降到0.25,但写入这边纹丝不动:5分钟缓存写入是每百万12.50,是读取成本的50倍;1小时缓存写入是20.00,80倍。所以当一次agent运行在提示词开头注入一个变动的时间戳、一个随机工具UUID,或者把schema顺序打乱,你并不是退回到列表价,而是要付写入的罚金去写一个在下次调用前就过期的缓存桶。他的做法:把第1轮和第2轮的原始JSON payload导出来,diff掉最后一条之外的messages,把动态时钟字符串和session UUID从系统指令里清掉,工具和核心指令严格放在头部、历史只往尾部追加。如果那个前缀diff不是零字节,你就没在省算力。
💡#39
@does_it_code
https://x.com/does_it_code/status/2097387517221728404
他花了力气优化子代理的冷启动,然后得出结论:自己盯错了表。在117份Claude Code会话记录里,启动占开销的0.6%到17.8%,中位数不到8%。真正的账单来自额外的agent循环迭代,以及那些用压缩转述替代证据的摘要跳转。值得和上面那条前缀diff一起读,因为两者指向同一个结论:你的循环形状比你的循环启动更花钱。
💡#40
@gajanxn
https://x.com/gajanxn/status/2097421573859017191
一次考虑缓存计费的实测,结果跟直觉相反。他把一组FastAPI查询丢进一个真实的agent循环,agent只用symbolgraph、零次Read、零次Bash,结果成本仍然高出50.5%。他对「为什么通常的对比是反过来的」给出的解释是:标准的分母假设agent会读整个文件,而他这套是用grep的。
💡#41
@ataiiam
https://x.com/ataiiam/status/2097394932134945178
关于一个小团队靠循环能撑住多大面积,这条说得异常具体。他们运营的东西叫「软件工厂」,维护着1760种组合:22个功能 × 10个agent框架 × 8个界面。他们干脆不做产品了,转而去做那个能建造并维护整个生态的工厂。真正有用的是那条治理原则:AG-UI充当他们的「神谕」,只给agent循环那么多自主权——刚好是他们能便宜地、立刻地、并且以agent无法伪造的方式验证的那么多。
💡#42
@ItsCuthulhu
https://x.com/ItsCuthulhu/status/2097378828146671655
一个对准PPT而不是代码的验证循环,正是那种值得抄的非编码应用。他的deck-number-validation技能会生成一份Google Sheet,审计演示文稿里每一个重要数字:来源、出现在第几页、标注是否正确、标注应该怎么写、这个数字是否有效,以及agent为什么得出这个结论;另有一个参考值页显示每个数字是怎么算出来的、底层数据从哪来,还有一个问题页把问题归类为有效、无效、标错、未验证。agent在整份deck里循环修正,直到全部通过。通常它能到80%到90%,然后卡在那些它判断不了上下文、或无法有把握核实来源的数字上。同一个任务原样交给Astra,它做到了100%,全程零反馈零干预,他事后人工复核过。
💡#43
@shivam74689
https://x.com/shivam74689/status/2097358695109914965
一篇认真的agent系统架构复盘,而且在自主性这件事上得出了正确结论。在做TicketPilot时,他权衡了「放任自由跑的自主agent」和「有界的ReAct式循环」(观察→推理→行动→观察→…→停)。他的洞见是:更多自主性并不自动意味着更好的生产系统,生产级agent需要的是受控自主——明确的迭代上限、终止条件、失败处理和可预测的行为。他还把人类审阅者当成架构的一部分而不是一块看板,所以当agent无法安全解决请求时,系统会跨过一道刻意设置的边界。他把「为什么选有界循环而不是不受限循环」写进了ADR。
💡#44
@pauliusztin_
https://x.com/pauliusztin_/status/2097724214228754450
一个很小、但安全后果很大的设计决策。在他从零写的编码agent里,一个Agents Catalog定义了build、plan、code-reviewer、explore这些角色,每个角色有自己的system prompt、工具白名单和权限模式。所以build能改代码,而explore只能读、搜索、回报。同一个agent循环,能力随任务不同而不同。大多数配置的做法是:给唯一那个循环配齐它这辈子可能用到的所有权限。
💡#45
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2097798442081021958
OpenAI发布了一份案例研究和参考架构,叫Defense Factory,讲的是它如何在一次内部code-red冲刺里使用Codex和自家的网络安全模型——横跨数百个系统,每一个补丁都是Codex的agent写的。背后的论证是一个威胁模型论证:攻击方现在能在开放权重模型上跑成队的长时运行agent,所以防守方也应该把安全工作转成一个持续运行的agent循环。这个循环是:盘点、发现、在隔离环境里复现、指派责任人、验证修复。
💡#46
@AlonTesla
https://x.com/AlonTesla/status/2097797902764847537
关于Defense Factory最锋利的一句来自OpenAI自己的手册,它把瓶颈直接说出来了:一个被合并的补丁就被当成完成了。这跟这个feed在别处反复挖到的是同一个失败——循环终止在一个动作上,而不是终止在一个被验证的结果上。他提了一个公平的30天检验:某个不买他们那套安全SKU的公司,把完整的循环跑出来并公布修复验证率。
💡#47
@AiquestAcademy
https://x.com/AiquestAcademy/status/2097382610389389720
机器人拿到了同样的待遇,而且带着一个数字。当前的机器人策略是盲目执行者:预测一个动作,然后祈祷它成功。EmbodiedSkills把VLA模型包进一个agent循环里——动作前检查前置条件、执行技能、再验证结果——在LIBERO上做到97.4%成功率。这就是把软件agent循环里的「验证」那一步移植到物理动作上,收益来自同一个地方。
💡#48
@Lingxiao234
https://x.com/Lingxiao234/status/2097717100169342987
关于「在agent autoresearch时代,仿真到底是干什么用的」的一次重构。任何你能包装成沙盒的东西,agent最终都会解掉;而对机器人来说,仿真是我们唯一有的沙盒。我们批评仿真有sim2real差距、覆盖不了多样的物体,但显式的状态恰恰是让agent能看清一次rollout为什么失败并据此修正的东西。它作为物理模型的弱点,和它作为沙盒的强项,是两回事。接下来要么是覆盖真实分布的更好仿真,要么是替代品——专门为「能被agent读取和调试」而造的世界模型。
💡#49
@RyanOthKearns
https://x.com/RyanOthKearns/status/2097359716053614832
Antioch融了3200万美元A轮,明确是为了把autoresearch带到物理AI,前提判断是:真实世界复杂、慢、贵,而目标是让机器人变得像下达一个目标那样简单和快。真正说明问题的是他们给出的具体服务:给混乱的硬件部署做大规模多路并行仿真,以及为在仿真里训练在线RL策略生成合成数据。这就是上面那个论点的融资版本——沙盒才是瓶颈。
💡#50
@ZimingLiu11
https://x.com/ZimingLiu11/status/2098075716244148402
一张有用的地图,而不是又一个demo。他梳理了通往auto-research的六条不同路径,更重要的是点明了每条路径底下押的是不同的注。当一个领域用同一个词涵盖了好几种互不兼容的策略时,把这些赌注拆开,可能是任何人能发表的最有价值的东西。
💡#51
@PaulGugAI
https://x.com/PaulGugAI/status/2098163708040274312
一次本地模型评测,精确地隔离出循环在哪里断掉。他把两个35B A3B模型塞进一块RTX 3080,在IQ2和IQ3量化下测试,发现两者在「从高度干扰的上下文草堆里找一根细节针」上都表现优秀、彼此在容差范围内。差距只在重上下文多轮agent循环里才拉开,Ornith 1.5明显领先。具体说:Nex N2.5在IQ2下,三个个人助理子场景里做出了零次研究或工具调用,也没有产出任何结构化提交,只拿到安全性方面的残余分;而Ornith确实去调查了工作区、引用了证据、创建了内部草稿并提交了有依据的结果,在其中一个场景里还识别出了一次实时更正、一个被取消的预约和一份新的评审,进而提出把供应商通话改期。单轮检索基准会把这两个模型评成一样。
💡#52
@stratamindlabs
https://x.com/stratamindlabs/status/2097359824954515876
关于「一个循环到底该不该进入某个生意」,这是所有人给出的最好的判断规则。一个工作流本来就有清晰规则,有人往里加了个agent,现在这个流程更贵、更难排查、而且比它替代掉的那套自动化更不可预测。他的统领规则是:如果规则能决定下一步,别用agent;如果下一步取决于对刚刚发生的事情的解读,一个受控的agent循环才可能配得上它的位置。而且要在它跑起来之前先给它刹车——有限的工具、清晰的权限、迭代和成本上限、一个「完成」的定义,以及一条人类升级路径。机会恰恰在规则用尽的那个位置上的有界适应。
💡#53
@DaveAtTidy
https://x.com/DaveAtTidy/status/2097837885525217445
一个生产环境里的邮件agent,而值得注意的设计选择是「循环不在哪里」。他们的流水线先做清洗、分流规则,然后用单个模型做分类、打标和抽取,并且刻意不用agent循环——这样得到一份干净的markdown规范形态,剥掉了HTML、广告和内嵌图片。只有到这一步之后,内部的agent循环才去读它并起草回复,永不发送,也没有任何其他出网。把循环放在归一化之后、而不是包在原始输入外面,就是全部的安全论证。
💡#54
@iamleannmuller
https://x.com/iamleannmuller/status/2097254735778652254
一个做视觉迭代而不是文本迭代的agent循环。一条提示词加一小时时限,产出了一个可在浏览器里玩、超过60fps的3D图形demo:等距视角相机、带真实光照的体素风格、反光的湿地面、有动态的环境。值得记的不是产物而是机制——它不是写一次代码就完事,而是用循环去测试场景、抓住运行时bug、当场修掉,并在几十轮迭代里微调光照和物理。一帧渲染出来的画面,就是一个评估器。
💡#55
@ibuildthecloud
https://x.com/ibuildthecloud/status/2097711673704697954
对「本地模型为什么突然可用了」的一个很好的解释,而原因并不是它们变聪明了。因为有agent循环,聪明模型和笨模型在很大程度上能达到同样的结果——循环要的是收敛到一个能work的东西。聪明的收敛得快,笨的收敛得慢、或者根本收敛不了,而关键在于你可以随时换。他的类比是一支有初级和资深开发的团队:初级有真实价值,因为简单的事你付他们更少的钱。
💡#56
@milocodes_
https://x.com/milocodes_/status/2097900622859444499
本窗口最有共鸣的一次失败:给agent授权去「解决一个小的依赖问题」,然后看着它信心十足地判定这个lockfile需要整个重写。他提的那个问题是真正开放、而且没人有原则性答案的:在你杀掉进程之前,你允许它浪费多少次工具调用?有时候agent循环感觉像是工程界的停机问题。
💡#57
@AamirAnsar94694
https://x.com/AamirAnsar94694/status/2097962852720271792
整个学科的一张成熟度阶梯,也是对上面所有内容共同点最有用的一次概括。一级:手动跑agent。二级:一次给agent一个任务。三级:设计让agent在可重复循环里运转的系统。四级:构建能持续自我改进的agent生态。配套的开环闭环之分是操作层的那一半:开环给了自由,但会偏离目标、消耗更多token、没有清晰上限地跑;闭环则定义目标、验证检查点、预算上限和可预测的停止条件。
💡#58
@vishctx
https://x.com/vishctx/status/2097739730091909551
反对意见,而且值得被听见。解决一个研究问题不只关乎那个解,他担心的是auto-research工具把「过程的乐趣」从这个领域里抽走,把它变成一场算力竞赛。有时候重要的恰恰是坐在一个领域里坐得足够久,从而在寻找答案的过程中发现并分享另外那些问题。除非你刻意为它腾时间,否则agent不会给人留下多少「坐下来想」的空间。他那句话是:把「漫游」外包出去,不是个好主意。
💡#59
@alvations
https://x.com/alvations/status/2097847714679529794
同一个反对意见的审稿人版本,而且瞄准的是一个具体行为而不是工具本身。他抱怨的不是有人用AI做研究,而是这种模式:你写一个提示词,让模型在一个实验和数据集想法上自主跑,然后从头到尾不看输出、也不看分数。他管这叫不负责任;另外他还说,把你和合著者都懒得修改的东西交上去,是对审稿人的纯粹不尊重。合理的读法是:真正的失败模式是「没有人去读证据轨迹的autoresearch」,而不是autoresearch本身。
📡 生态产品雷达
生态产品雷达

Karpathy 的 autoresearch — 所有人对标的参照实现,被引用最多的其实是它那条约束:你没法评估的东西,就没法auto-research。
pi-autoresearch — 交付了第一个「重试此前被丢弃的假设」的显式机制,正是对短周期初筛失败模式的直接修复。
OpenResearch / askalphaxiv — 现在整个循环能跑在本地,支持 LMStudio、Ollama、oMLX 或任何 OpenAI 兼容端点。
Prime Agent — 自我改进的 REPL harness,在不动权重的前提下把 Opus 5 在 ARC-AGI-3 上从30%拉到95.5%。
Tinker — 自蒸馏复现工作背后那个带预算约束的训练底座。
ZeroThesis / Yukon Research / Solving Bitcoin — 多人autoresearch的三个场地,共同前提都是:可共享的最小单位是「被测试过的尝试」。
Lean — Navier-Stokes主张和以太坊基金会autoresearch竞赛底下共同的验证器。
Claude Code / Codex — 这些循环实际跑在里面的harness;OpenAI的Defense Factory冲刺里每一个补丁都是Codex的agent写的。
GPT-6 Astra / GLM-5.3 / Fable 5.1 — 在固定循环下被换进换出的模型,而这已经成了人们实际比较它们的方式。
AG-UI、图式编排、ADR — 验证与留痕这一层,在一个软件工厂、一套工单架构和一个机器人harness里各自独立地出现了。
← 上一篇
超级用户日报: 2026-09-11
下一篇 →
灵感雷达: 2026-09-11
← 返回所有文章

评论

加载中...
>_