Loop 日报: 2026-09-28
autoresearch已经不只是用来调训练了。今天最好的一个循环花了70小时去优化一个给agent用的命令行接口长什么样;最有料的一篇,是一位开发者离开托管的agent循环,自己搭了一个、给每项工作只配一个限权凭证。剩下的内容都关于长循环的经济学和安全:类型化决策模型接走前沿模型的是否判断,被拦截后重试也要付钱,延迟成了账单上的一行;还有越来越多的声音认为,循环需要一个外部判卷人,以及一种训练出来的、知道何时停下的判断。
#1
@dzhng
https://x.com/dzhng/status/2103920745206468894
autoresearch这次瞄准的不是模型权重,而是接口设计:GPT-6 Astra跑了约70小时的autoresearch循环,为一个CLI调成本与性能,搜索API调用和命令的最优输入输出形状。结果是一个百分百为agent设计的CLI,用作者的话说,它的输出人类根本看不懂。实验原始数据都放在仓库里。这是目前最清楚的信号:面向agent的接口本身就是可优化的目标,循环能找到任何人类设计师都不会选的形状。
https://x.com/dzhng/status/2103920745206468894
autoresearch这次瞄准的不是模型权重,而是接口设计:GPT-6 Astra跑了约70小时的autoresearch循环,为一个CLI调成本与性能,搜索API调用和命令的最优输入输出形状。结果是一个百分百为agent设计的CLI,用作者的话说,它的输出人类根本看不懂。实验原始数据都放在仓库里。这是目前最清楚的信号:面向agent的接口本身就是可优化的目标,循环能找到任何人类设计师都不会选的形状。
#2
@prince_twets
https://x.com/prince_twets/status/2103845056130293971
一周泡在Devin云端agent循环里,换来今天最实用的一篇。循环本身是作者用过最好的,但前沿模型额度一用完,连已有会话都没法继续;还有个代码扫描功能单独计费、找不到关闭开关,明确让agent别用它也照样扣钱。于是作者做了Shiba,一个跑在自己Cloudflare账号里的云端软件工程师:按任务路由模型,每项工作一个限定权限的凭证,数据库令牌删不了表,认证令牌换不了任何密钥,还给agent配了专用收件箱。结论是:把harness带在自己身上,因为一个厂商、一个模型、一个登录,这种决定你只有一次机会做。
https://x.com/prince_twets/status/2103845056130293971
一周泡在Devin云端agent循环里,换来今天最实用的一篇。循环本身是作者用过最好的,但前沿模型额度一用完,连已有会话都没法继续;还有个代码扫描功能单独计费、找不到关闭开关,明确让agent别用它也照样扣钱。于是作者做了Shiba,一个跑在自己Cloudflare账号里的云端软件工程师:按任务路由模型,每项工作一个限定权限的凭证,数据库令牌删不了表,认证令牌换不了任何密钥,还给agent配了专用收件箱。结论是:把harness带在自己身上,因为一个厂商、一个模型、一个登录,这种决定你只有一次机会做。
#3
@graykevinb
https://x.com/graykevinb/status/2103991218996666457
Green Eggs的进度汇报:这是一个手搓的harness,agent自己写Python脚本,通过RPC控制一只小猪子agent。这次运行里,agent自己写了编排代码来做autoresearch。接下来要加:从Python里生成子agent,以及直接在Python里运行的比较器,由Jev这类决策模型或LLM驱动。作者在问怎么做编排能力的基准测试,而这正是agent开始自己写循环之后最缺的那一块。
https://x.com/graykevinb/status/2103991218996666457
Green Eggs的进度汇报:这是一个手搓的harness,agent自己写Python脚本,通过RPC控制一只小猪子agent。这次运行里,agent自己写了编排代码来做autoresearch。接下来要加:从Python里生成子agent,以及直接在Python里运行的比较器,由Jev这类决策模型或LLM驱动。作者在问怎么做编排能力的基准测试,而这正是agent开始自己写循环之后最缺的那一块。
#4
@stretchcloud
https://x.com/stretchcloud/status/2104021203287728349
一篇把编码agent成本瓶颈说清楚的帖子:瓶颈不再是智力,也不是上下文长度,而是走向答案途中每个小决定的价格。本周做出来的研究agent命令行工具jevgrep,用TypeSafe的Jev在主编码agent读文件之前先判断哪些文件相关,据报道在SWE-bench上把编码agent成本降了40%。这个框架很好用:该不该读这个文件、这条引用支不支持结论、这笔退款合不合规,都是披着LLM外衣的分类问题。
https://x.com/stretchcloud/status/2104021203287728349
一篇把编码agent成本瓶颈说清楚的帖子:瓶颈不再是智力,也不是上下文长度,而是走向答案途中每个小决定的价格。本周做出来的研究agent命令行工具jevgrep,用TypeSafe的Jev在主编码agent读文件之前先判断哪些文件相关,据报道在SWE-bench上把编码agent成本降了40%。这个框架很好用:该不该读这个文件、这条引用支不支持结论、这笔退款合不合规,都是披着LLM外衣的分类问题。
#5
@cryptowluha
https://x.com/cryptowluha/status/2103817724187017448
一位开发者把Jev接进自己所有在跑的agent循环,发现大部分前沿模型调用其实在回答是或否。重构后,每个操作先拆成生成、决策、硬规则三类;每个是否判断单独记成事件;决策交给返回概率的类型化模型;每次工具调用前先过风险检查;触发动作时把完整概率分布和阈值一起记下。LLM只管生成,决策模型管判断,代码管执行。
https://x.com/cryptowluha/status/2103817724187017448
一位开发者把Jev接进自己所有在跑的agent循环,发现大部分前沿模型调用其实在回答是或否。重构后,每个操作先拆成生成、决策、硬规则三类;每个是否判断单独记成事件;决策交给返回概率的类型化模型;每次工具调用前先过风险检查;触发动作时把完整概率分布和阈值一起记下。LLM只管生成,决策模型管判断,代码管执行。
#6
@Vladic_ETH
https://x.com/Vladic_ETH/status/2104198303919305127
对本周最响的循环产物、也就是Opus 5.5视频的一篇好解释。模型并不生成视频,它写一个画出每一帧的程序,浏览器截帧,ffmpeg拼成MP4。那个过夜跑12小时的爆款,实际简报约9500字符,带音频、参考、仓库,以及一条一直迭代到不再显得廉价为止的指令。一周内出现了280多条附源提示词的公开片段。最好的一句:一段两分半的片子画面不糊,那不是Sora,是一次编译。
https://x.com/Vladic_ETH/status/2104198303919305127
对本周最响的循环产物、也就是Opus 5.5视频的一篇好解释。模型并不生成视频,它写一个画出每一帧的程序,浏览器截帧,ffmpeg拼成MP4。那个过夜跑12小时的爆款,实际简报约9500字符,带音频、参考、仓库,以及一条一直迭代到不再显得廉价为止的指令。一周内出现了280多条附源提示词的公开片段。最好的一句:一段两分半的片子画面不糊,那不是Sora,是一次编译。
#7
@SynScience
https://x.com/SynScience/status/2104231436052271495
OpenScience结束测试,作为内置autoresearch的开源科研agent上线:给它一个指标,它就自己一轮轮实验往上爬。它打包了重新设计的研究IDE、覆盖30多个模型的按量付费钱包、一键接入ChatGPT或Codex订阅的OAuth、300多个研究skill、50多个科学工具和数据库,以及NVIDIA BioNeMo,并称已有30多所大学和实验室在用。
https://x.com/SynScience/status/2104231436052271495
OpenScience结束测试,作为内置autoresearch的开源科研agent上线:给它一个指标,它就自己一轮轮实验往上爬。它打包了重新设计的研究IDE、覆盖30多个模型的按量付费钱包、一键接入ChatGPT或Codex订阅的OAuth、300多个研究skill、50多个科学工具和数据库,以及NVIDIA BioNeMo,并称已有30多所大学和实验室在用。
#8
@aasimmalikin
https://x.com/aasimmalikin/status/2104120432295358935
一位开发者公开了自己的agent Hangul的完整架构,核心的循环刻意做得很朴素:不用框架的异步循环,模型一轮、工具调用、存检查点、重复。循环旁边是几道护栏:发送、写入、创建这类危险工具要等人点击批准;七层提示注入防御;每次请求现建一套只接用户自己数据的工具;每个对话同一时间只跑一个,两个标签页不会把对话搞乱;还有令牌保险库,由代理在出站时替换真实密钥,模型永远看不到。评测和CI闸门覆盖答案质量、工具选择和注入攻击。
https://x.com/aasimmalikin/status/2104120432295358935
一位开发者公开了自己的agent Hangul的完整架构,核心的循环刻意做得很朴素:不用框架的异步循环,模型一轮、工具调用、存检查点、重复。循环旁边是几道护栏:发送、写入、创建这类危险工具要等人点击批准;七层提示注入防御;每次请求现建一套只接用户自己数据的工具;每个对话同一时间只跑一个,两个标签页不会把对话搞乱;还有令牌保险库,由代理在出站时替换真实密钥,模型永远看不到。评测和CI闸门覆盖答案质量、工具选择和注入攻击。
#9
@ivantinkers
https://x.com/ivantinkers/status/2104156262342508894
一位创始人一年前给自己的产品做了第一个agent,分享了心智模型:agent就是一个简单循环,带着不断变长的上下文和一组工具反复调用模型,如果一直完不成就设一个调用次数上限。他们先自己花两天左右手写了循环,后来换成Vercel AI SDK,并且把真正的成本来源说得很直白:每做一次决定都要把越来越长的提示重发一遍,这就是agent比一次性调用贵得多的原因。
https://x.com/ivantinkers/status/2104156262342508894
一位创始人一年前给自己的产品做了第一个agent,分享了心智模型:agent就是一个简单循环,带着不断变长的上下文和一组工具反复调用模型,如果一直完不成就设一个调用次数上限。他们先自己花两天左右手写了循环,后来换成Vercel AI SDK,并且把真正的成本来源说得很直白:每做一次决定都要把越来越长的提示重发一遍,这就是agent比一次性调用贵得多的原因。
#10
@kcosr
https://x.com/kcosr/status/2103833546087395784
一个给长时间agent循环用的实用基础设施模式:把agent循环放在一台常开的小机器上,比如个人NUC,通过SSH连远程环境;但把工具执行和循环执行拆开,参照Codex的exec server。这样只有碰到重型构建或测试时,执行器才按需拉起一台高配机器。
https://x.com/kcosr/status/2103833546087395784
一个给长时间agent循环用的实用基础设施模式:把agent循环放在一台常开的小机器上,比如个人NUC,通过SSH连远程环境;但把工具执行和循环执行拆开,参照Codex的exec server。这样只有碰到重型构建或测试时,执行器才按需拉起一台高配机器。
#11
@theayubinator
https://x.com/theayubinator/status/2103909879044014114
一位怀疑派给出了今天最犀利的反autoresearch论点:agent像过分热心的实习生,每冒出一个新问题就去追,没完没了地钻牛角尖,还会从人为设定的实验里得出夸张结论。类比来自神经科学:动作需要抑制性神经元,和兴奋性神经元同样重要,而今天的agent只有兴奋性那一半,因为它们被优化来完成任务。它点出了研究循环缺的东西:一种训练出来的、知道何时该停的判断。
https://x.com/theayubinator/status/2103909879044014114
一位怀疑派给出了今天最犀利的反autoresearch论点:agent像过分热心的实习生,每冒出一个新问题就去追,没完没了地钻牛角尖,还会从人为设定的实验里得出夸张结论。类比来自神经科学:动作需要抑制性神经元,和兴奋性神经元同样重要,而今天的agent只有兴奋性那一半,因为它们被优化来完成任务。它点出了研究循环缺的东西:一种训练出来的、知道何时该停的判断。
#12
@jus_eng_njainam
https://x.com/jus_eng_njainam/status/2103754720884248752
一段关于循环验证的洞见:写代码的agent自己写的测试,断言的是代码做了什么,而不是代码应该做什么,这就是为什么覆盖率100%照样在生产环境出事。解法不是少写测试,而是用不是这个agent写的测试,因为那是agent循环唯一的判卷人。
https://x.com/jus_eng_njainam/status/2103754720884248752
一段关于循环验证的洞见:写代码的agent自己写的测试,断言的是代码做了什么,而不是代码应该做什么,这就是为什么覆盖率100%照样在生产环境出事。解法不是少写测试,而是用不是这个agent写的测试,因为那是agent循环唯一的判卷人。
#13
@elledynelabs
https://x.com/elledynelabs/status/2103851856627990553
关于让循环自己审自己PR的一条提醒:审查那一步最后会和自己的输出吵起来。看门狗必须能切断整个循环的电源,而不只是重试某一次尝试,否则不确定性会把CI循环和agent循环之间的区别抹平。
https://x.com/elledynelabs/status/2103851856627990553
关于让循环自己审自己PR的一条提醒:审查那一步最后会和自己的输出吵起来。看门狗必须能切断整个循环的电源,而不只是重试某一次尝试,否则不确定性会把CI循环和agent循环之间的区别抹平。
#14
@Pakgowithai
https://x.com/Pakgowithai/status/2104049090984296948
这周在Claude API上跑agent循环的人要注意一个成本坑:安全拦截在Claude回复前挡住请求,Anthropic又开始收费了,涉及三类:生物、蒸馏攻击、前沿LLM研发。循环如果反复重试同一个被拦的提示,每次都要付钱。建议是:记录stop_reason和类别,换模型兜底,别对着同一个模型狂试。
https://x.com/Pakgowithai/status/2104049090984296948
这周在Claude API上跑agent循环的人要注意一个成本坑:安全拦截在Claude回复前挡住请求,Anthropic又开始收费了,涉及三类:生物、蒸馏攻击、前沿LLM研发。循环如果反复重试同一个被拦的提示,每次都要付钱。建议是:记录stop_reason和类别,换模型兜底,别对着同一个模型狂试。
#15
@ares_mheinke
https://x.com/ares_mheinke/status/2104108263214358794
对一个新免费模型的延迟视角解读:同一张Vercel表上,Pixel Canary每个任务平均约1016秒,GPT-6 Astra开high档约252秒,成功率都是90%。放进agent循环里,四倍的耗时会在每次调用上叠加,所以这位用户宁愿为更快的那个90%付钱。另一位评论者从定价角度说了同一件事:一旦超快档单独定价,延迟就正式成了账单上的一行。
https://x.com/ares_mheinke/status/2104108263214358794
对一个新免费模型的延迟视角解读:同一张Vercel表上,Pixel Canary每个任务平均约1016秒,GPT-6 Astra开high档约252秒,成功率都是90%。放进agent循环里,四倍的耗时会在每次调用上叠加,所以这位用户宁愿为更快的那个90%付钱。另一位评论者从定价角度说了同一件事:一旦超快档单独定价,延迟就正式成了账单上的一行。
#16
@vishalmisra
https://x.com/vishalmisra/status/2103806214865834039
一句把所有循环搭建者都在绕开的限制说透的话:今天的LLM是被动的。没有提示、没有工具结果、没有调度器、没有agent循环,就没有计算。人会自己生成问题、回看记忆、主动追一个念头;给LLM套一个循环能让它看起来很主动,但它依然只是一个循环。
https://x.com/vishalmisra/status/2103806214865834039
一句把所有循环搭建者都在绕开的限制说透的话:今天的LLM是被动的。没有提示、没有工具结果、没有调度器、没有agent循环,就没有计算。人会自己生成问题、回看记忆、主动追一个念头;给LLM套一个循环能让它看起来很主动,但它依然只是一个循环。
#17
@Shadowfetch
https://x.com/Shadowfetch/status/2103949993476514052
一个很小但真实的常驻agent部署分工:VPS加Tailscale很适合跑agent循环本身,但Xcode、代码签名和模拟器这些活还是Mac mini更好,所以把通用agent主机和原生构建机分开。
https://x.com/Shadowfetch/status/2103949993476514052
一个很小但真实的常驻agent部署分工:VPS加Tailscale很适合跑agent循环本身,但Xcode、代码签名和模拟器这些活还是Mac mini更好,所以把通用agent主机和原生构建机分开。
#18
@iamnotkookie
https://x.com/iamnotkookie/status/2103968443590381916
OpenAI DevDay前的一份混搭栈快照:难的代码交给Opus 5.5,过夜摘要和agent循环交给Grok Bot,剩下90%的活用Build里的Grok 4.7。如果OpenAI传闻中的常驻agent是真的,纠结的就不再是模型,而是要不要为一个新bot拆掉花了一周接好的线,这是一年前还不存在的切换成本。
https://x.com/iamnotkookie/status/2103968443590381916
OpenAI DevDay前的一份混搭栈快照:难的代码交给Opus 5.5,过夜摘要和agent循环交给Grok Bot,剩下90%的活用Build里的Grok 4.7。如果OpenAI传闻中的常驻agent是真的,纠结的就不再是模型,而是要不要为一个新bot拆掉花了一周接好的线,这是一年前还不存在的切换成本。
📡 生态产品雷达
生态产品雷达
Claude Code(9次提及):承载循环最常见的宿主,也是大家比较的基准harness
Grok / Grok Bot(6次提及):在混搭栈里负责过夜摘要和循环
Codex(5次提及):它的exec server被当作把工具执行和循环拆开的范本
GPT-6 Astra(5次提及):跑了70小时autoresearch循环的模型,也是延迟对比的基准
Jev(4次提及):把有边界的是否判断从循环里接走的类型化决策模型
Opus 5.5(4次提及):过夜视频循环背后的引擎
Claude Code(9次提及):承载循环最常见的宿主,也是大家比较的基准harness
Grok / Grok Bot(6次提及):在混搭栈里负责过夜摘要和循环
Codex(5次提及):它的exec server被当作把工具执行和循环拆开的范本
GPT-6 Astra(5次提及):跑了70小时autoresearch循环的模型,也是延迟对比的基准
Jev(4次提及):把有边界的是否判断从循环里接走的类型化决策模型
Opus 5.5(4次提及):过夜视频循环背后的引擎
评论