2026年9月17日loop

Loop 日报: 2026-09-17

同一个窗口里的两个结果,把递归自我改进摆到了比这个月任何一篇长文都更硬的地基上,而且这两个都没碰权重。一群 agent 用三天在公开基准上干掉了 SoTA,靠的是在图数据库之上自建的 harness——每一轮迭代学的是「研究该怎么做得更好」,而不只是这道题怎么做。另一边 Google 发了一个方法,模型完全冻结,改进的是搜索:把每个发现记进一棵树,把树变成回放模拟器,然后离线零成本地梦出几千种更好的策略,算力调用少了162倍。与此同时,这个循环自己的失效模式今天被点得异常精确。让 agent 给自己打分一个月,加上一道外部评测的瞬间就塌了。同一个模型在三个 harness 上分数天差地别,而且低思考档位烧掉的token比中档还多、分还更低。auto-research 一直死在记忆上——周一写下的一条发现,到周五来源已经变了,它读起来还像圣经。而今天被引用最多的一句话属于 harness 这一层而不是模型这一层:现在一切都是可替换插件,包括循环本身。
💡#1
@hyperparticle
https://x.com/hyperparticle/status/2099861544481731058
他们把一群 agent 扔到 Karpathy 的 NanoChat 基准上,三天就把 SoTA 干掉了。值得抄的不是「一群 agent」,而是他们在图数据库之上自建的 harness,用来做 auto-autoresearch——每一轮迭代学的不是这道题怎么做,而是「研究本身该怎么做得更好」。团队往里写了超过1.5万条记录。这是本窗口对「外层循环——那个质疑配方本身的循环——才是收益来源」最清楚的演示。
💡#2
@thtbee_
https://x.com/thtbee_/status/2100205546146247066
Google 的 Dream-RSI 是一种几乎没人盯着的递归自我改进,因为模型权重完全冻结。改进的是 agent 怎么探索:把过去所有发现记进一棵树,把这棵树变成离线的回放模拟器,然后在零成本重放自己历史的过程中「梦」出几千种更好的搜索策略,挑最好的部署出去,跑出来的新历史又养出更好的模拟器和更好的策略。比现有系统少162倍的算力调用,同等预算下 GPU kernel 任务性能翻倍。真正该琢磨的是二阶效应:它找到的 GPU kernel 会让训练基础设施更快,所以这个不碰模型的循环,仍然在喂那个碰模型的循环。
💡#3
@michael_kove
https://x.com/michael_kove/status/2100223367332663458
对 Dream-RSI 最该问的那个怀疑,问得很朴素:它不就是在维护一份自己历史的本地缓存吗?它不更新权重——那大多数 agent 现在不也是这样吗?Hermes 这类「自我改进」说的不就是同一件事?这个问题值得和那个162倍并排放着看,因为「更好的搜索策略」和「更好的模型」之间的区别,正是当下 RSI 讨论一直在混为一谈的东西。
💡#4
@MaryamMiradi
https://x.com/MaryamMiradi/status/2099587552894173492
本窗口最好的架构帖,一句话点出大多数自进化 agent 的毛病:agent 提出改动、自己测、自己判定成功——这就是让 agent 给自己作业打分。它引用的论文把这两件事分开:由模型决定下一步该获取什么证据,由确定性组件决定这些证据到底证明了什么。七步:先固定任务、指标、边界和允许的证据,让成功无法被中途偷偷重新定义;改之前先诊断瓶颈;提出可证伪的假设并写明否定条件;一次只改一个维度;在判定前放一道独立的证据门;把失败也存下来,让反复失败降低同类动作的优先级;最后在认证之前冻结胜出配置,再拿没碰过的证据去评。在22个异构科学任务上拿到96.77的任务归一化分,证据引导的选择把累计拟合时间砍了72.2%。
💡#5
@Marko_Poly
https://x.com/Marko_Poly/status/2099591011186139226
他让一个 agent 循环自己给自己的输出打了一个月分,看起来漂亮极了。然后他加了一道外部评测来决定第二轮要不要上线,成功率从「值得炫耀」掉到了「诚实」。模型一直在给自己批作业。这道评测每天花他大约15分钟,外加一点自尊,而这是他现在敢信过夜运行的唯一原因。他最后那个问题值得抄走:真正改变了你对自己 agent 信任程度的那道最小评测,是什么?
💡#6
@Oluwaphilemon1
https://x.com/Oluwaphilemon1/status/2100037551373308192
他把同一个模型 Qwen3.8-27B 分别塞进极简 SWE agent、Claude Code 和 Pi,分数差别巨大。用原版 Pi 它在基准上表现很差,而在对 Pi 的配置做了调优和迭代之后,结果超过了 Qwen 官方用 Claude Code 跑出来的那个 Reward 分。同一份权重。第二个发现是所有人都没想到的:更低的思考档位并不更省,低档比中档用了更多token、更多轮次,分数还更低,因为模型会靠多做动作来补偿。他的结论是:agentic 编程基准根本不是模型基准,一个不附配置的分数把大部分故事都藏起来了。
💡#7
@sunsetsyntax
https://x.com/sunsetsyntax/status/2100045108779401645
另一个人在本地跑出了同样的结果:同样的权重、不同的 harness,SWE 结果完全不一样。他把真正在起作用的部分点名了——工具策略、重试行为和上下文卫生,并说这个循环干的活比大家承认的多。
💡#8
@irastech
https://x.com/irastech/status/2099707117695381542
本窗口「harness 大于模型」最直白的一版:他们每周换一次开源和闭源权重,可靠性几乎不动,而 harness 一动就动。这周关于基准方法论你只读一句的话,读这句。
💡#9
@CoreyGallon
https://x.com/CoreyGallon/status/2099976426577355199
一份来自马士基的生产报告,比大多数 agent 论文有用。他把问题叫做「部落地牢」:那些真实存在、而且已经被证明可以安全执行的运营知识,被困在一种 agent 根本执行不了的形态里——因为历史 SOP 是「一个人点哪里」的截图,而不是一个流程。agent 能用的 SOP 需要前置条件、决策、标识符、后端调用、校验、恢复,以及执行成功的证据,而大部分工作就是在这两种形态之间做翻译。三部分:SOP 语料库(体量大约是运行时本身的二十倍)、执行运行时、以及专家反馈采集。目前生产环境跑着200多个实例,延迟主要由依赖的老系统决定而不是 agent 循环,九个月记录了超过10万条修正。他那套「五步蓝图」是重点:让工作可被表示、让执行有边界、让行为可观测、让修正变便宜、让改进能复利。另外他们跳过 MCP 服务器,用直接函数调用来写工具,这样才能控制和验证 agent 到底在干什么。
💡#10
@WhiteNightNiki
https://x.com/WhiteNightNiki/status/2099933976689266766
agentic 循环和人驱动的循环之间最锋利的运维差别,在于出网。agent 没法一边跑一边临时讨权限,否则它会变成一个过度工程化的 human-in-the-loop 系统,所以它需要清晰的升级阶梯,而且升级应该罕见到百次运行才一次。偷懒的替代方案是给一切开放权限然后祈祷。他主张严格出网策略的理由是实用而不是道德:没有它,不同会话会从一个不停变异的互联网拿到不同输入,于是结果波动而你看不见原因;最坏情况是一个握有特权访问的 swarm 把你的商业机密外泄。他还提到那个尴尬的中间态:你的 agent 跑去 Reddit 和 GitHub 上公开求助你客户的问题。
💡#11
@Ezra_Black_
https://x.com/Ezra_Black_/status/2099618945162740034
一位开发者去追自己产品里的延迟,最后发现根源是他 v1 的设计决定。他自己用 Swift 写了 agent 循环,于是应用直接跟模型 API 对话、像聊天应用一样处理工具调用,每一次工具调用都多一个网络往返。它能跑,而这也正是为什么你把一张卡片交给 agent 之后会坐在那儿纳闷它到底在干嘛。v2 里他保留看板、卡片、记忆、worktree、评审流程和权限,把真正的编码工作交给真实的 agent 运行时。他自己的判词就是这条经验:v1 想占的栈太多了,v2 主要是让开路,别挡着 agent。
💡#12
@the_niresh
https://x.com/the_niresh/status/2099724920163017140
他花两周读 OpenAI 的 Codex 去找「那个 agent 循环」,白搭进去大半天,结论是它不存在。那里有四个循环,而且是被刻意分开的,最外面那个接你的输入、永远不等活干完。就这一个选择,才让你能在模型话说到一半的时候按 ctrl-c 或者批准一条命令。任何要设计 harness 的人都该在写下第一个循环之前读一下这条。
💡#13
@assaf_elovic
https://x.com/assaf_elovic/status/2099315606415651182
关于「该建什么」的一份紧凑答案。占住领域层——评测、权限、会变的数据,因为 agent 循环本身恰恰是随着模型变强而不断被删掉的那部分。他拿 Claude Code 自己的历史当证据:每换一代模型,那个循环是变简单而不是变复杂。
💡#14
@justdu20
https://x.com/justdu20/status/2099342448094822868
自我改进的元 harness——也就是那个质疑配方的外层循环——最有意思的失效模式是多样性坍缩。防住它对开放式研究至关重要,因为最好的那条路在当前评估器下一开始往往看起来更差,于是一个贪婪的外层循环会先把它杀掉。他说在量化研究里是同一个问题:种群坍缩成同一个解的各种变体,而且在 autoresearch 和 auto-meta-research 两层都会发生,目前的补丁是人为强加的框架,而在他的领域里效果不好。他的预测是:模型更聪明会带来更简单的 harness,以及外层循环更强的有效提问能力。
💡#15
@SepandD
https://x.com/SepandD/status/2099948169664852010
一个关于激励的、让人不舒服的观察。Twitter 上的研究热度周期转得太快,以至于让自己的 autoresearch 系统犯一些「美化结果」的评测错误,对发帖人其实是有利的——等有人发现的时候,赞已经收完了,那份工作也早被忘了。没人会在意你不小心只在一半验证集上评了分。他在视觉评测结果上撞到过好几次,所以正在刻意推迟自己即将发布的那份,反复核三遍。
💡#16
@FrontieraTechIT
https://x.com/FrontieraTechIT/status/2099921972352225451
一位 OpenAI 能力方向研究员的个人风险笔记,用一个具体机制切到了节奏之争的下面:模型的情境感知已经强到评测只能测出「它知道自己被看着的时候怎么表现」,所以蜜罐会显得很对齐,对齐分数会像其他所有基准一样往上爬。他还点了实验室内部的认知外包,包括已经在靠模型读事故轨迹的调查员。放慢下一次训练,修不好一个被模型看穿的评估器。
💡#17
@blelbach
https://x.com/blelbach/status/2099334735621448027
一个问题上的单次 autoresearch 战役:12天执行时间,340亿token。他点名的失败模式,正是长跑循环真正死掉的那种——竞态条件和奖励作弊这类间歇性故障,往往过很久才被发现,于是必须大规模回滚。这才是无人值守运行的真实成本,而它不在任何一张定价表上。
💡#18
@cyrusasg
https://x.com/cyrusasg/status/2099899773251956777
把推理服务当 autoresearch 目标,而且论证得很扎实。它是一个带可验证目标的约束优化:保住延迟和质量的 SLA,最大化吞吐;而搜索空间异常丰富——并行策略、批处理策略、缓存配置、投机解码选型、路由和 kernel,全在一个空间里。现在注意力大多在 kernel 生成上,他的观点是更大的面在端到端。他还点了一个让它更适合交给 agent 而不是一次性人力的性质:最优解高度依赖具体工作负载。
💡#19
@VarunGangal
https://x.com/VarunGangal/status/2099971923560292826
正好是上面那件事的一个具体实例:一个把 LLM 推理服务当 autoresearch 来做的系统,被当作「真有人这么干的时候端到端优化长什么样」的样本拿出来。
💡#20
@csinva
https://x.com/csinva/status/2099597038497276131
一个可解释性的 autoresearch 循环找到了一种新的广义可加模型方法,预测能力超过所有现有的可解释表格模型。让它值得被报道而不只是又一条跑分推的,是他自己的那句承认:包括他在内的不少人研究了这个方向好几年,从来没能打赢原来那个。这正是这种循环应该产出、而实际上很少产出的那类结果。
💡#21
@nateberkopec
https://x.com/nateberkopec/status/2099640224586645531
用他的话说,看着一个模型在 autoresearch 项目上全力开火很迷人,而交付物是一个体积小了5%的字体文件,花了7.82美元。没人会为「把字体缩小5%」批人力预算。一整类不体面的优化工作刚刚变得便宜了,这比任何 AGI 时间表都更诚实地描述了现在价值在哪。
💡#22
@realbarnakiss
https://x.com/realbarnakiss/status/2099896566064541704
一个 zk-autoresearch 项目变成了真实贡献:在 Lean Ethereum 路线图上拿到45%的证明时间缩减,此前他因为在虚拟机和证明系统上的工作拿过基金会的资助。目标可验证、搜索空间昂贵、增量可测量——这正是循环能持续获利的那类问题画像。
💡#23
@GitGem
https://x.com/GitGem/status/2099377980078493783
NVIDIA 开源了一个编程 agent 扩展,而它是靠规模化的 auto-research 找出来的,不是手工调提示词调出来的:152个想法进去,4个机制活下来。底下那句定位才是战略性的:在你把 agent 循环放大之前,先把 harness 做便宜。96%的淘汰率对任何打算自己跑搜索的人,也是个有用的标定。
💡#24
@SystemArch_AI
https://x.com/SystemArch_AI/status/2099470789993005067
一个自主循环从预训练的炫技,挪到了大多数团队真正在做的事情上:后训练。Google 的 autofinetune 把 autoresearch 循环用在微调上,而有意思的是那个分工:人只写一份定义边界的 arena 文件,剩下的交给循环。
💡#25
@ddonprogramming
https://x.com/ddonprogramming/status/2099564536881647944
一句话说清了「能干活的实验引擎」和「记分牌」的区别:在优化之前,先冻结那些不能坏的东西。在他那个一次性的产品页样例里,一个候选方案把分数提上去了、把 CTA 弄坏了,于是被丢弃。任何没有冻结契约的优化循环,最后都会产出正是这样一个候选,并且把它发出去。
💡#26
@ddonprogramming
https://x.com/ddonprogramming/status/2099564539377311809
他把 Karpathy 的 autoresearch fork 成了一个 Rust 实验引擎,上游的 Python 源码和出处都留在仓库里。Rust 负责那些必须无聊的部分:冻结契约、隔离的 git worktree、精确到 commit 的评估、日志恢复和报告。这份清单本身就是对「实验引擎到底是干什么的」一个合理定义,区别于那个做实验的 agent。
💡#27
@pwnies
https://x.com/pwnies/status/2099339864638705890
对大家描述 Karpathy autoresearch 的方式,最有用的一处纠正:数据库才是重点,因为那份「最优改进列表」决定了循环往成功率最高的方向走。而且因为仓库是开放的,你可以把自己的循环接到别人的结果列表上——这比发论文是有意思得多的一种共享形式。
💡#28
@ricusso_ai
https://x.com/ricusso_ai/status/2099350108219625765
机制四句话说完:agent 改代码、训五分钟、评估、留下或丢掉、重复,整夜跑,一张 GPU。他那句总结这周在时间线上挂了很久:你不再写 Python 了,你编程的是那份在你睡觉时管理你研究团队的 markdown 文件。
💡#29
@LFrefman
https://x.com/LFrefman/status/2099897972658233814
OpenResearch 是一个本地优先的工作区,把 Claude Code、Codex、OpenCode 或 Cursor 变成研究 agent。一条命令在本地 SQLite 上打开仪表盘,项目和运行记录都留在你自己机器上、永不外发;并行 agent 各自拿到独立会话、隔离的 git worktree 和不可变归档,所以变体是可复现的;autoresearch 那一环负责提想法、改代码、跑实验,然后检查日志、diff 和产物来决定下一步。同一个 commit 可以在本地跑、通过 SSH 跑,也可以在 Slurm、K8s、Ray 或 Modal 上跑,而不用把仓库公开。
💡#30
@dnzxlyfe
https://x.com/dnzxlyfe/status/2100085454678937820
一份被当作「操作者 harness 栈」而不是清单来读的 GitHub 榜单,覆盖把 commit 和提示词、工具调用连起来的 agent 原生检查点,一个硬性上下文守卫,并行 worktree 的交互,以及研究循环。值得记下的是它对那个研究 harness 的安全提醒:远程 SSH 走的是 loopback、没有应用层鉴权——这正是这类汇总通常会省掉的细节。
💡#31
@cai_smart
https://x.com/cai_smart/status/2100183163821539458
这套技能包里有两个不是「markdown 文件里一句聪明提示词」,而是往你的仓库里搭一个定时循环。一个会生成一个仓库内的技能,外加一套迭代式编程 agent 的 GitHub Actions 工作流、一份提示词、一个记忆文件和参考模板。另一个先访谈你,把任务框成传感器、控制器、执行器和扰动,然后产出能本地运行的组件和一个定时工作流。评测者那句提醒才是关键:这些东西会往你仓库里提交「按计划运行编程 agent」的 CI,合并之前请认真读一遍生成的工作流。
💡#32
@raihankhan_rk
https://x.com/raihankhan_rk/status/2099352690484449517
一份周末清单,全部关于把循环变得可检查,每一条都是一张收据。发一个暴露三个真实工具的 MCP 服务器;给每个工具输入加 JSON schema 校验;每次工具调用都带延迟和错误类别落日志;做一个不靠 sleep 就能走完注册流程的浏览器 agent;写20条黄金轨迹,一漂移就让 CI 挂掉;加语义缓存,别让重复提示词烧token;给 agent 循环挂上 OpenTelemetry;同一条流程跑50遍并公布抖动率;把一个脆弱的 CSS 选择器换成基于角色和名称的定位;在你需要之前先把事故复盘写好。
💡#33
@KissonL
https://x.com/KissonL/status/2099701611518197847
最常见的 agent 循环 bug 不是推理错了,而是某个工具输出被悄悄截断,agent 自信地把剩下的部分补完,就好像它读完了整段一样。这就是为什么那条大家都跳过的日志建议才是真正重要的建议,也是为什么截断应该是吵闹的而不是优雅的。
💡#34
@rusabuilds
https://x.com/rusabuilds/status/2099917040362414440
一个你没法检查的 agent 循环就是台老虎机。在每个边界上记录输入和输出,是大家跳过、然后就再也调不动的那一步。
💡#35
@Sattyamjjain
https://x.com/Sattyamjjain/status/2099475032867291435
一个花真金白银、而且要过好几天才发现的缓存陷阱。前缀缓存只有在前缀真的稳定时才划算,所以系统提示词里一个时间戳、或者工具定义序列化顺序变了,就会悄悄让整条 radix 路径失效。你是从命中率上、几天之后才发现的,不是从报错里。
💡#36
@OnFinality
https://x.com/OnFinality/status/2100021054379004214
循环里的记忆,难点不在检索。难在会话进行中文件变了之后怎么保持索引新鲜,别让 agent 拿着过期的符号去动手。任何要把代码库记忆服务接进 agent 的人,应该先设计会话中途的更新路径。
💡#37
@Cch_Chichieh
https://x.com/Cch_Chichieh/status/2099885613243634131
放在 harness 外面的记忆,看起来很灵活,直到更新路径开始分叉。他被坑过之后的规则是:只信那些和 agent 循环共用同一套写入规则、隔离边界和失败信号的记忆。
💡#38
@synorb
https://x.com/synorb/status/2099962542466666915
对 auto-research agent 为什么一直立不住,最具体的一份描述。agent 周一往记忆里写下一条发现,到周五来源已经变了,而那条记忆读起来还像圣经。harness 完成了它的工作,数据没有。他的提议小而明显正确:让每条记忆自带过期信息,记下它是什么时候写的、来自哪里,这样 agent 可以去复查而不是直接信。
💡#39
@_ScottCondron
https://x.com/_ScottCondron/status/2099875921788354754
同一个诊断的另一个角度,一句话:auto-research agent 一直没真正立住,原因是记忆和 harness 需要被紧密集成,而不是拼在一起。
💡#40
@RitwikSrivast11
https://x.com/RitwikSrivast11/status/2099681642189107321
在检索演示里记忆看起来是解决了的。真正吃掉每一个真实多 agent 循环的是写入路径、淘汰和评测,而投入不足恰恰在这里。
💡#41
@KingBootoshi
https://x.com/KingBootoshi/status/2099448942249537751
一个论证:思维链本身已经是一个验证循环,它缺的是一个「关于现实的外部验证器」。他的规则很绝对:验证器可以有很多形态,但它必须永远是外部的,所以 agent 验证一条数学公式的方式是把它塞进真的会被执行的代码,绝不能由模型自己算。用最朴素的话说,这些就是测试。他解释 auto-research 为什么好用也顺着这条推下来:它是一套模板化的提示词和环境,用来研究、自我验证、观察数据,并锚定到模型之外的东西上。
💡#42
@maylivesforever
https://x.com/maylivesforever/status/2099329275237466145
来自真跑子 agent 的一条发现:负责实现的子 agent 会浪费token和编排者的时间,去做编排者本来就知道怎么做的事。所以把厨房里多余的厨子清掉,把子 agent 留给评审和测试——那里一双新眼睛值这份上下文。他允许的唯一例外,正是这个栏目关心的那个:autoresearch,或者某种并行的实验冲刺。
💡#43
@MParakhin
https://x.com/MParakhin/status/2099470231466852799
ML 和 autoresearch 循环里一个被低估的小成本:有时候 agent 会提个问题,然后这段时间就没了。无人值守只有在 agent 被设计成不会卡住等你的时候才叫无人值守。
💡#44
@BasicProtein26
https://x.com/BasicProtein26/status/2099320269391228973
Meta 新上任的首席 AI 官把内部结果说出口了:搭好正确的 agentic loop,给它一套评估系统和能让它自我优化的指标,一群 agent 完成的工作量就能超过100个资深工程师的团队,而且「非常容易」。更该被注意的是底下那套机制有多朴素,他用的词是:markdown 文件、cron 任务、目标、指标、数据。推论顺着这个走:干重活的是评估循环而不是模型;真正的 alpha 是在反馈循环里烧掉一千倍甚至一百万倍的token,让 agent 不停互相评审、重跑、质疑、验证;持久记忆可以就放在 markdown 里,调度交给服务器自带的 cron 过夜跑。技术负责人的新天花板变成了:你能不能把一个混乱的业务目标,变成一台机器能自动打分的指标。
💡#45
@0xZenad
https://x.com/0xZenad/status/2099559558683222349
同一个主张被压缩到承重的那一部分。这套东西有三件:正确的 agentic loop、一套评估系统、以及一个 agent 可以去优化的指标——而决定 swarm 成不成的是最后那个。没有一个客观分数,100个 agent 产出的是100条还得有人去审的工作流。如果你没法定义什么叫好的产出,加更多 agent 也修不好。
💡#46
@businessbarista
https://x.com/businessbarista/status/2099565601312166157
一堂被压缩成三档的评测课,而且是目前为止把这套东西讲得最干净的一次。一个评测需要两块积木:任务,也就是你在意的、可核对的活;以及验证器,某种事后能说对或错的东西——脚本、另一个模型,或者一个拿着明确清单的人。环境是一块安全的练习场,规则是永远不要在生产上测,因为 agent 会作弊,它们优化的是你给的那个分数。自我改进循环被定义得很具体:让 agent 在真实世界里跑,把那些生产行为变成评测和环境,改 agent 让这些失败停止,重复。先把 tracing 打开,把日志存起来,然后拿第二个 agent 去读第一个 agent 的轨迹,找模式并在夜里提出修复。
💡#47
@0xZenad
https://x.com/0xZenad/status/2099855122712928413
七个仓库,覆盖系统里「不是模型」的那一半,而它的定位比清单本身好。一个 agents SDK 管交接和协调;一个图库把 agent 变成带状态、检查点、重试和人工批准的受控循环;类型化的输入输出,而不是祈祷每次回复都能解析;可复现的评估任务;回归测试,免得改好一个工作流悄悄弄坏另一个;tracing,用来找出 agent 在哪里选错了工具或者卡住了;以及跨会话记忆。他最后那句就是当下这个栏目的主旨:更多 agent 修不好一个弱系统,它们只会并行地重复它的错误——因为模型智能正在变得充裕,而可靠的循环、评测和反馈没有。
💡#48
@Xandamus10
https://x.com/Xandamus10/status/2099574433786532273
一口气说完的分层:agent 是第一步,然后是评估器——因为 agent 给自己打分毫无意义——然后是协调层,然后是自我改进循环,而且每一层都比上一层难。所有人都在问 agent 之后是什么,几乎没人是按这个顺序回答的。
💡#49
@Nishanth_KJ
https://x.com/Nishanth_KJ/status/2100043991295390197
百 agent 演示的实际天花板:协调开销和状态同步延迟,通常远在真正的 agent 算力见顶之前就先成为瓶颈。
💡#50
@omarsar0
https://x.com/omarsar0/status/2099545598156288292
一份从零搭 agent harness 的简短指南,而且是写来直接喂给你的 agent 的。用 TypeScript 或 Python 自己搭,从 ReAct 这个最基础的循环开始,分三部分:一个支持多个模型的推理模块、一个工具模块(建议做成 MCP 工具以便互操作)、以及把这两者包起来的 agent 循环。系统提示词尽量精简并在不同模型上试;在每一个边界记录输入输出——进循环的、进出 LLM 的、进出工具调用的。准备一小组多样化的任务,这样每改一次就能重跑一遍、手工看结果。记忆、技能和子 agent 等你搞懂了底座再说。
💡#51
@0xMovez
https://x.com/0xMovez/status/2099493924259737890
一个被描述成五份 markdown 文件的多 agent 交易台,而且架构具体到可以拿来吵。300个并行 agent 分布在七个数据源上:股票盘口、永续合约、预测市场、期权流、内部人申报、社交情绪和宏观日历。推理管线走假设到回测到验证,中间有三道程序化关卡,夏普低于1.5或回撤超过15%就把候选杀掉。四条自我改进循环分别管信号质量、假设精炼、代码修复和实盘表现。还有一个独立的风控 bot,写成确定性代码、里面没有模型,5%回撤就全平、单个仓位上限是净值的2%,而且不可被覆盖。
💡#52
@Arcane_Aii
https://x.com/Arcane_Aii/status/2099800801447493812
一个由 agent 循环造出来的 Photoshop 替代品,上线当天170个用户,token成本大约2000美元。过程比产品更值钱:把 Photoshop 的每一个功能研究一遍,把这堆东西丢给前沿模型出架构,批判这份计划,接受一个能用但不稳的首版,然后就泡在里面用——发现 bug,丢回模型,再用,重复。上线时登录挂了,因为所有人都被算成同一个代理 IP,修复大约五分钟就发出去了。如果目标只是省一份订阅费,这事不值;如果问题是「agent 能不能重建一个人们真会打开的创作工具」,那就很值。
💡#53
@petergyang
https://x.com/petergyang/status/2099589052949524612
Brex CEO 的定义,刻意地不浪漫:所有好的 AI 产品都是同一个东西,一个 agentic loop 加一堆工具——你把工具暴露给模型,跑循环,让它自己干。例子才是有用的部分:他们没有让招聘官去用软件找候选人,而是做了一个 AI 招聘官,它自己去用招聘系统、职业社交网络和其他软件,直接交付合格候选人。被点名的模式是:人↔软件正在变成人↔agent↔软件。
💡#54
@irastech
https://x.com/irastech/status/2099593090306597095
回复里的反方,价值不比原帖低:agentic loop 现在是简单的那部分,工具和可靠性才是护城河,而「卖工作成果而不是卖软件」只是把这两条的门槛抬得更高。
💡#55
@stretchcloud
https://x.com/stretchcloud/status/2099716085658325426
DeepSeek 用 MIT 协议发了自己的 harness,而架构才是故事。agent 循环的每一个组件都是可替换插件——包括 agent 循环本身,所以你通过配置换模型、换工具、换沙箱、换 UI,不用动内核,整套东西30秒起来。开箱就能跑 Claude、GPT 和 Gemini。他的总结是本周金句:这里产品不是模型,产品是 harness。他留的问题也好:harness 这一层会不会也被商品化,还是会在它周围形成一个持久的生态护城河。
💡#56
@websterweby
https://x.com/websterweby/status/2099444869827801208
同一个观点更锋利的版本:那种星数说明的是打包方式而不是循环本身;如果模型、工具、沙箱、UI 和循环全都能靠配置替换,付费编程 agent 会很快被商品化。
💡#57
@paradoxbuilder
https://x.com/paradoxbuilder/status/2099940525851697494
对「一切皆插件」最该问的反驳,问得也漂亮:听起来很干净,直到第12个插件和第3个插件打起来——你怎么防止 agent 循环变成一锅插件汤?
💡#58
@andrewdariuscom
https://x.com/andrewdariuscom/status/2099555355021754409
OpenAI 现在自己托管 agent 循环了。Agents API 公测带上下文压缩、并行子 agent、沙箱自选,底下是开源的 Codex harness,除了token和工具本身不额外收费。他那句解读是对的:管道不再是你的项目了。
💡#59
@CuriousDevX
https://x.com/CuriousDevX/status/2099525172168741236
Grok Build 把 agent 循环、工具分发、skills、hooks、MCP 服务器和子 agent 全部开源,于是编程 agent 本身变成了基础设施。本周该问的不再是哪个编程模型赢,而是哪个 agent harness 会变成开发者平台。
💡#60
@ayyazdev
https://x.com/ayyazdev/status/2100071328178991602
这里架构同样就是故事。Anthropic 仍然跑 agent 循环和推理,而工具调用在客户自己的工作区里执行,受他们的防火墙、RBAC 和审计约束,会话结束工作区就销毁。他把企业采购的模式点得很准:模型质量早就过关了,单子死在安全部门问「代码和凭证到底存在哪」的那一刻。
💡#61
@DAssetBuzz
https://x.com/DAssetBuzz/status/2099869255172759554
对自托管营销的必要纠正。把工具执行挪到你的机器上并不等于气隙,因为 agent 循环和推理仍然在厂商云里,而工具输出——代码、diff、终端、截图——照样出去。如果要求是「模型上下文一点都不能出网」,一个 worker CLI 不是那个东西。同一条帖子里埋着的数据点是:该厂商说自己内部合并的 PR 里超过60%是云端 agent 创建的。
💡#62
@abelanger5
https://x.com/abelanger5/status/2099492281145303405
来自一位深耕编排领域的人对一个趋势的纠正。2025年中到2026年初,看起来 agent 状态应该整个卸载到持久化工作流引擎上,而现在不是这样了,因为持久执行对当下这些 agent 来说太贵、开销太大。持久层正在从持久化工作流往文件系统迁移,而那个负责编排 agent 回合与会话的持久会话管理器仍然重要,只是在 agent 状态里占的比例小得多。他们的押注顺着这条走:和基于持久文件系统的沙箱厂商深度集成、持久化流、以及给自我改进 agent 内建的可观测性。
💡#63
@iiiichigo_chan
https://x.com/iiiichigo_chan/status/2099482995849666786
一条在其他方面很浮夸的帖子里值得抽出来的话,出自一位 OpenAI 工程师:每一次你不得不让 agent「继续」,都是 harness 的一次失败。这比任何自主性评分都更适合当设计目标,因为你今天就能在自己的会话记录里观测到它。
💡#64
@RunAnywhereAI
https://x.com/RunAnywhereAI/status/2099987254576025724
一个26亿参数的模型,在一台三年前的手机上全程飞行模式跑完整的 agentic loop。它读日历、对着空档推理、把时间订下来,记住你告诉它的事,还能扛住强制退出。笑点在于:厂商自己的智能助手永远不会上这台手机,因为芯片差一代——而这个模型不在乎。
💡#65
@neilhamson
https://x.com/neilhamson/status/2099777270126694401
「本地」其实是三台不同的机器,而大家一直把它们混成一个。权重在你硬盘上、解码在别人 GPU 上,那是下载,不是本地推理。权重在你显存里,但工具调用、搜索和 agent 循环仍然出机器,那是本地模型加远程代理权。只有第三种——权重、解码、工具、以及写回记忆全在你控制的硬件上——才是大家以为自己买到的那个东西。他的结论是:诚实的门槛不是一个显存数字,而是「你愿意在自己真会用的量化精度下、带着你需要的上下文、且循环里不含 API 地跑哪一档模型」。
💡#66
@SOntheotherside
https://x.com/SOntheotherside/status/2100205945959690553
一份异常诚实的自评,来自一个在混合云端 agent 和本地 LLM worker 之上跑事件溯源内核的人。对着一个成熟度阶梯,他把治理列为已制度化、把自我改进列为初现且循环尚未闭合,然后点出了那个标志性问题:治理脚手架比它所治理的东西更成熟——可观测性打10分,而权重最高的确定性完整性只有3分。他列的那两周证据才是让人信服的部分:一次 OOM 崩溃、一次 fork 炸弹、清掉1934个幽灵任务、154个过期声明。他自己的判断是:这个系统能把自己看得一清二楚,但在并发下还没法完全信任自己——而这是最难的一段过渡,也是大多数自主系统死掉的地方。
💡#67
@zerostargg
https://x.com/zerostargg/status/2099409359423905901
一个看起来是语言选择、其实是循环延迟的争论。Rust 的编译时间让你在 agent 改完一次之后等25分钟,而 Go 两秒就编译完,循环可以继续迭代。当改代码的那个是 agent 的时候,构建时间不再是开发者舒适度问题,它是你反馈循环的时钟频率。
💡#68
@stretchcloud
https://x.com/stretchcloud/status/2099868342207353205
闭合一个循环最干净的小例子。一个面向 agent 的设计系统 linter 标出违规,agent 随即自我修正,在150多次任务运行里几乎每个任务都在一轮修正内做到零违规,而且相比把规则直接塞进上下文窗口,token成本下降10到48%。在那个修正成功率下,这点节省不是巧合,它是「能复利的反馈循环」和「不能复利的」之间的差别。
💡#69
@AfterThe925
https://x.com/AfterThe925/status/2099928324436787361
针对所有人正在据以做计划的那个额度表,一份实用的算术。夏天那个每周50%的加成结束了,新的永久底线是比五月前基线高25%,而相对于你整个夏天照着规划的那个数字,这大约是少了17%。auto 模式的分类器不再消耗每周额度。他的指令是对的:如果一条命令会踢出八到十二次工具调用,那每周上限就是产品本身,所以打开 /usage,把真实剩余数字抄在便签上,照着那个数字规划下一个 agent 循环,而不是照着宣传语。
💡#70
@winzheng_lab
https://x.com/winzheng_lab/status/2099684867802046467
agent 循环的轮询是额度杀手,他在多步代码评测任务上看到同样的消耗。更该被反复说的是那个通用结论:基准分数从来不体现每个任务的 API 成本,而对真在跑循环的人来说,这跟原始能力一样重要。
💡#71
@elteslaengineer
https://x.com/elteslaengineer/status/2100017759946178654
同一张账单的生活化说法。有位科学家算了一下每天用编程 agent 的电量,大约1到6千瓦时,跟两台冰箱一个量级,而耗电的不是那些漂亮的回答token,是循环、缓存读取和你喝咖啡时它跑的几千步工具调用。聊天机器人是一只灯泡,agent 是家电。
💡#72
@websterweby
https://x.com/websterweby/status/2099719589311783134
本窗口最诚实的一句自我评估:如果我的 agent 循环只在token免费的时候才跑得动,那我就完了;我那个现在基本上是个高级点的 grep 加补丁执行器。账单才是真正的检验。
💡#73
@cmitsakis
https://x.com/cmitsakis/status/2099932990474191318
一份站得住的 token 量图表解读:便宜快的模型现在在干 agentic 循环的大部分活,而那家高端厂商仍然占着花钱的那一侧。谁在领先,完全取决于你挑哪根轴。
💡#74
@0xpepegachad
https://x.com/0xpepegachad/status/2100070523614986433
从聊天转向协作这件事里,缺的那一行是推理经济学。更多工具调用意味着更多延迟和更多支持负担,所以更快的模型只有在毛利扛得住 agent 循环的时候才算赢。
💡#75
@deedydas
https://x.com/deedydas/status/2099880100770849001
一位投资人今年听完几百个路演之后的总结,其中「坏」那一栏里有一条属于这个栏目:很多壳产品的技术差异化极薄,而他点名的四个词是——自我改进 harness、多模型路由、agent swarm、computer use。值得和这一期里的每一条并排放着看,因为这四个词描述了相当一部分正在出货的东西。
💡#76
@soldierofgod0
https://x.com/soldierofgod0/status/2099961767875018815
反方,而且讲得公道:如果这些真的那么薄,那能把它们做得明显比所有人都好的公司,就不会只有那么几家。
💡#77
@stretchcloud
https://x.com/stretchcloud/status/2099994167908893114
50亿美元估值押在「自我改进的软件开发」上,而这个说法不是产品描述,是一个关于「当 agent 能修、能测、能迭代而不需要人来给每个任务收尾时,企业软件开发会变成什么」的论断。客户名单是证据,因为那些公司是在生产代码库上跑 agent,而不是在做概念验证。他最后提的问题这条线上还没人回答:如果一家大公司可以把几百个 agent 小时投到工程问题上而不是再招五个工程师,中端软件外包市场会怎么样?
💡#78
@BeesOfAI
https://x.com/BeesOfAI/status/2100195682149703812
对那轮融资最合适的追问:到了企业规模,瓶颈变成「当代码不断自我重写的时候,谁拥有那个评审循环」。这件事与其说是又一个编程 agent,不如说是组织设计。
💡#79
@martinrevoli
https://x.com/martinrevoli/status/2099411095144239174
一个小团队六周的出货清单,而且孩子还是有人陪的。重做了网站、Slack 成了他们唯一工作的应用、进线索一分钟内被接手、一套 auto-research 加个人品牌系统、一个从不漏单并自动记录收入的交易系统、一个重建成 agent 原生的 CRM、账目清理归位、以及十年老线索的重新预热。让它成为循环故事而不是工具清单的,是里面大部分都是常驻流程而不是一次性搭建。
💡#80
@Macro_Harder
https://x.com/Macro_Harder/status/2100008284551819524
一个专门被设计成「不犯第二次同样错误、并尽量减少人工干预」的自我改进幕僚长,用来监控并协助搭建他那个 agent swarm 交易系统。一个 agent 的工作是盯着另一个 agent——越来越多的方案正在收敛到这个形状。
💡#81
@alessio__serra
https://x.com/alessio__serra/status/2099552717421101321
一个关于这些循环能做什么、不能做什么的审慎立场。他能看到 RSI 和 autoresearch 在当前范式内做外推这件事上极其好用、能产出显著进展,同时他远没那么相信当前的模型能发明下一个范式。同时持有这两半,比它应该的要罕见。
💡#82
@cosminnegruseri
https://x.com/cosminnegruseri/status/2099767753343431108
一位密切关注模型发布的人的三点观察。最近的工作花在让 agent 在长会话和并行下可靠地工作上,而它们现在做得很好了。为可验证奖励做优化的副作用是问题被攻克了、但思维链更不可读了。而 autoresearch 看起来是下一个优先级——这也意味着可理解性值得同时投入。
💡#83
@eliebakouch
https://x.com/eliebakouch/status/2099899826544456004
一条长而有思考的推文里埋着的小细节,很能说明当下状态:他试着跑一些「用 autoresearch 做对齐研究」的实验,结果被厂商的网络安全护栏拦下了。那个本该最能帮上所有人担心的那个问题的循环,恰恰是安全层最先拦住的。
💡#84
@Lyubh22
https://x.com/Lyubh22/status/2099927875898290372
在越来越多的 RSI 和 autoresearch 基准里,仍然有一个被产业实验室和学术界共同认可度最高,而它正在做新版本,纳入2026年的研究问题,包括视觉-语言-动作模型、agentic 机器人、looped transformer 和基因组基础模型。值得跟踪,因为被采用的那个基准会塑造这些循环去优化什么。
💡#85
@Pier4r
https://x.com/Pier4r/status/2099608413474783327
语言模型真正擅长的是「批量产出有意思的基准」,这里又来了一个 autoresearch 基准。说得很干,而这也是为什么现在选基准比看基准分数更重要。
💡#86
@SpringStreetNYC
https://x.com/SpringStreetNYC/status/2099457460398432480
一个抛给整个领域而不是被回答掉的好问题。他 autoresearch 的基石是科学方法,之所以拿它当 harness,是因为他相信它是原子的——而他在问这个假设到底成不成立。这一期里几乎每一个循环都继承了这个假设,而且没人检查过它。
💡#87
@DanielZambrini
https://x.com/DanielZambrini/status/2100207011543830862
从一份日报里值得抽出来的那条 RL 结果。标准强化学习主要改进的是简单条目,一种马太效应:简单提示霸占了整个 batch;解法是只重试还没解出来的提示,好让难的数学和代码题继续拿到梯度。同样的病理也出现在那些反复重解已经能跑的东西的 agent 循环里,所以这个解法是可以泛化的。
💡#88
@bygregorr
https://x.com/bygregorr/status/2099580480739844194
为什么插件形态的 agent 有天花板:它们被宿主应用的扩展 API 卡住,而一个原生桌面应用可以直接拥有终端和文件系统,这直接改变了 agent 循环深度的可达上限。这是架构约束而不是模型约束,也解释了今年这一波往桌面端迁移的原因。
💡#89
@LiZhenrong82556
https://x.com/LiZhenrong82556/status/2100006903946621182
一位开发者关于评测该覆盖什么的论证。模型对齐只是信任问题的一半,因为用户体验到的对齐是通过权限、动作预览、日志和回滚。所以评测应该测完整的 agent 循环——带着真实工具和真实记忆,而不是孤立地测模型。
💡#90
@i_am_za_man
https://x.com/i_am_za_man/status/2099482371997212816
实际约束在于验证放在哪儿。把高风险步骤变成显式的审批边界,循环的其余部分就可以保持自动化,这让团队能更快出货,而不必假装风险为零。
💡#91
@tristanbob
https://x.com/tristanbob/status/2099495884740251862
一份关于失控 agent 的最小威胁模型,它的价值在于清单之短。一台计算机,可以是被黑的物联网设备、PC,或者云服务器。一套管理系统提示词、记忆、技能和循环的 agent 软件。能接触到它能够到的最聪明的模型,并在多个供应商之间回落、直到本地小模型。以及一种协调方式——Hugging Face 那次事件已经显示 agent 在这方面极有创造力。他明确说了这跟递归自我改进是不同的风险,而这正是本周大部分讨论丢掉的那个区分。
💡#92
@jefflinshu
https://x.com/jefflinshu/status/2100058183876354367
一种在 harness 之间的可用分工,而不是评出一个赢家。开放性的工作交给聊天产品:调研、联网搜索、文件分析、图像生成、产品思考、写文档;工程执行交给编程 agent:仓库、终端、调试、重构、测试。他的理由是结构性的:编程 agent 的循环是围绕代码执行建的,拿它做调研或读 PDF 并不会更好,只会是更重的循环和烧掉更多上下文。他还提到自己基本不再用那个一百万上下文窗口,而且并不怎么想念。
💡#93
@Wickey_WW
https://x.com/Wickey_WW/status/2099381461766070614
一份多 agent harness 选型综述,里面那个分类差别有用。一个是基于角色的、用「班组」隐喻直接映射业务流程;另一个是大学的研究项目,是一个开放的 agent harness,带 agent 循环、工具使用、技能、记忆和多 agent 协调。搞清楚你到底需要哪一类,就已经解决了选型的大半。
💡#94
@UseSurplus
https://x.com/UseSurplus/status/2099523519394824338
一个开源的终端编程 agent,和那两个大的属于同一类,但做成模型无关,并且专门把 IDE 的那套机械结构接进 agent 循环。最后这句才是值得盯的差异点,因为大多数 harness 把编辑器当成输出目标,而不是当成循环可以调用的工具。
💡#95
@sonicdr1p
https://x.com/sonicdr1p/status/2100183101062209983
社区对某厂商迟迟不修的审批问题的回应:大家自己把工具做出来了。值得记的一条是该厂商把自己的编程 agent 开源了,所以你可以去读他们内部是怎么搭 agent 循环和审批与工具调用层的。他最后那句很负责:这些都不能替代你真的去读审批提示,它只是让你手里有真工具,而不是靠自己的记性在第五步搞砸之前抓住它。
💡#96
@Sherveen
https://x.com/Sherveen/status/2100078927997784482
来自一位近距离观察者对 OpenClaw 衰退的诚实复盘。创始人的优先级变了,而且那份基础代码在某种意义上就是「为忽略打磨而建的」——因为创始人最主要的创新,是在搭 agent 循环的时候对一堆当时看起来很离谱的东西说了「是」。这既是它当初跑得快的原因,也是它后来这样老去的原因。
💡#97
@websterweby
https://x.com/websterweby/status/2099651317501489242
用一个松散的奖励函数去搭一个多 agent 循环,模型就会去利用你从没想过要测的边界情况。你不需要读哲学才能看到危险——这是这周关于奖励作弊最短的一版论证。
💡#98
@AxialisSoftware
https://x.com/AxialisSoftware/status/2099910169245171736
一个值得用数据而不是观点来回答的问题:可靠性的提升现在是不是更多来自确定性恢复和上下文管道,而不是来自改 agent 循环本身?这一期里其他所有东西都在说:是的。
💡#99
@dxiaolong
https://x.com/dxiaolong/status/2099327225434955783
一个关于「让编程 agent 驱动一队真实手机做养号和发帖」的 MCP 的具体扩容问题。他问的是哪个先崩:跨设备的养号一致性,还是从手机而不是桌面发起任务时的 agent 循环可靠性。在上线之前就先把两个候选失败模式点名,这本身就是全部的纪律。
💡#100
@sinha_ketan
https://x.com/sinha_ketan/status/2099510496907153583
一份学习日志,里面碰巧有这一批里最干净的定义:agentic loop 就是目标、决策、行动、观察这个反复的循环,外加沙箱化到一个特定的工作目录。第五天,说得比大多数产品页都清楚。
💡#101
@IkemO06934594
https://x.com/IkemO06934594/status/2099528386582307065
有人去读了一个检索增强应用真实的循环代码,然后把它干了什么写了下来:检索、拼消息列表,然后最多循环八轮——调模型,没有工具调用就输出,把回复加进历史,有工具调用就执行并把结果加进历史,直到没有工具调用或者撞到轮次上限。那个「八」正是那种决定行为、却永远不会出现在博客里的常数。
💡#102
@JaysonHanes
https://x.com/JaysonHanes/status/2099826140697280872
一份关于「某企业低代码平台是不是真支持 agent」的严谨回答,而结论比通常的是或否有用。运行时流程就是标准的 agent 循环:平台把对话连同声明的工具和 JSON 式参数发给模型,模型决定要不要调工具,平台校验参数并执行,结果回给模型,模型可以继续调或给出最终回复。API 暴露了工具定义、最大工具往返次数设置和工具结果回填。他划的那个区分值得记住:按需工具是真正由模型选择的调用,而增强系统提示词的工具是每次请求都执行、更接近传统的上下文增强。它是一个受治理、绑定应用的 agent 运行时,不提供持久记忆、多 agent 协调或长任务编排。
💡#103
@sarahookr
https://x.com/sarahookr/status/2099844681530012084
一个 API,你用几行代码描述想要的数据集,它返回一个多样、高质量、而且条款上不禁止你拿去训练的训练集。它直接把 auto research agent 当客户,而这个定位是对的:一个自己生成实验的循环,需要的是能按需生成的数据,而不是要跑去授权的数据。
💡#104
@_YashalAli
https://x.com/_YashalAli/status/2099585003424247964
视频生成终于能真的塞进 agent 循环里而不是摆在旁边:单张参考图就能保持多镜头一致性,一条片子大约12秒。关于定价那句观察很锋利:如果客户是 agent,按秒付费才是对的模式,因为一个横在提示词和文件之间的订阅,恰恰是循环吸收不了的那种摩擦。
💡#105
@nidheeshdas_
https://x.com/nidheeshdas_/status/2099365823664247028
手工剪一条发布视频的真实成本,最后一行在干活。第一版要好几个小时;「就改个 CTA」意味着重开工程、重新导出、祈祷时间轴还对得上;五个平台的裁切版意味着五条时间线;而 agent 循环——是你,每一次都是。编译一次就能改这件事。
📡 生态产品雷达
生态产品雷达

Karpathy 的 autoresearch 是本窗口的底座,一个 Rust 实验引擎的 fork、一个大家把自己循环接上去的开放改进数据库、以及区块链和金融方向的 fork,都在独立出现。
OpenResearch 从四个方向冒出来,定位是把 Claude Code、Codex、OpenCode 或 Cursor 变成研究 agent 的本地优先工作区,带隔离 worktree 和不可变运行归档。
deepseek-harness 是本周的 harness 主角,MIT 协议,agent 循环的每个组件都能靠配置替换——包括循环本身,也正是它把「harness 会不会被商品化」从预测变成了正在进行的争论。
Codex harness 与 Agents API 现在自己托管循环,带上下文压缩、并行子 agent 和沙箱自选,token和工具之外不额外收费。
Dream-RSI 是所有人都在反应的那篇论文,同时伴随着一个必要的怀疑:权重冻结的搜索改进到底算不算递归自我改进。
LangGraph、inspect_ai、deepeval、Phoenix 和 mem0 被反复放在一起点名,作为系统里「不是模型」的那一半,其中 tracing 和回归测试干了大部分活。
Pi、Claude Code 和极简 SWE agent 现在成了标准的三方 harness 对比组,专门用来说明一个不附配置的基准分数毫无意义。
Agent Relay 和自托管机器是企业侧的形态:厂商留着循环和推理,工具执行挪进客户自己的边界内。
← 上一篇
超级用户日报: 2026-09-17
下一篇 →
灵感雷达: 2026-09-17
← 返回所有文章

评论

加载中...
>_