Loop 日报: 2026年8月15日
今天有两件事撞在了一起。DeepSeek 放出了一套 harness,agent loop 本身就是个可替换插件——而且 agent 可以检查自己的运行时、现场写一个插件挂上去、然后在下一个任务里直接用上这个新能力。与此同时,唱反调的一方打出了实拳:Thoughtworks 的一次评测把 TDD 放进 agent loop 里,结果是代码更差、token 更贵。串起其余所有内容的是一场关于「计量单位」的争论。按次计费已经死了,成本要按成功任务算;而在 OpenRouter 上,agent 流量每次请求消耗的 token 已经是人类流量的 13 到 15 倍。loop 不再是个新奇玩意儿——它已经是推理算力的主要消费者,而大家开始按这个事实来定价了。
#1
@bennyjo
https://x.com/bennyjo/status/2087781529241969117
目前公开可见的自我改进 loop 里最干净的一个样本。Phil 是一个通过在 Polymarket 预测市场做模拟交易来学习的 AI agent,然后通过 Pearl Connect 把学到的东西用在真实市场上。它每小时做一轮研究,然后决定交易还是跳过,再根据已经结算的结果修改自己的 playbook。每笔交易之前,它都会写下自己的估值、推理过程和它主张的 edge,这条记录被冻结在一个它自己无法编辑的账本里。每天晚上它会对所有已结算的东西跑一遍深度复盘,像个陌生人一样审计自己的决策。今天的更新是:它从自己的亏损里推导出了迄今为止最有影响力的一条规则,写进了自己的 playbook,此后一直遵守——对市场六战六胜。
https://x.com/bennyjo/status/2087781529241969117
目前公开可见的自我改进 loop 里最干净的一个样本。Phil 是一个通过在 Polymarket 预测市场做模拟交易来学习的 AI agent,然后通过 Pearl Connect 把学到的东西用在真实市场上。它每小时做一轮研究,然后决定交易还是跳过,再根据已经结算的结果修改自己的 playbook。每笔交易之前,它都会写下自己的估值、推理过程和它主张的 edge,这条记录被冻结在一个它自己无法编辑的账本里。每天晚上它会对所有已结算的东西跑一遍深度复盘,像个陌生人一样审计自己的决策。今天的更新是:它从自己的亏损里推导出了迄今为止最有影响力的一条规则,写进了自己的 playbook,此后一直遵守——对市场六战六胜。
#2
@CoreyGallon
https://x.com/CoreyGallon/status/2087711598378975360
Richard Socher 在《First Steps Toward Automated AI Research》开场讲了个玩笑,但那其实就是论点本身:每次我开掉一个语言学家,准确率就上升,所以也许该把 AI 工程师也开掉,让他们改去管理一个做 AI 研究的 AI。真正值得看的是那个具体结果。在 NanoChat 这个社区已经磨了一段时间的基准上,这套 auto-research 系统一两天内把 0.93 推到了 0.91 bits per byte——而且不是靠调超参。它找到的是把 hashed bigram 和 trigram 嵌入表通过学习到的门控混进注意力的 value 路径。这是架构层面的发现,不是在配置空间里搜索,而这个区别恰恰决定了 auto-research 是不是真的。
https://x.com/CoreyGallon/status/2087711598378975360
Richard Socher 在《First Steps Toward Automated AI Research》开场讲了个玩笑,但那其实就是论点本身:每次我开掉一个语言学家,准确率就上升,所以也许该把 AI 工程师也开掉,让他们改去管理一个做 AI 研究的 AI。真正值得看的是那个具体结果。在 NanoChat 这个社区已经磨了一段时间的基准上,这套 auto-research 系统一两天内把 0.93 推到了 0.91 bits per byte——而且不是靠调超参。它找到的是把 hashed bigram 和 trigram 嵌入表通过学习到的门控混进注意力的 value 路径。这是架构层面的发现,不是在配置空间里搜索,而这个区别恰恰决定了 auto-research 是不是真的。
#3
@allenholub
https://x.com/allenholub/status/2087698126119330166
今天最有用的负面结果。他先说自己那套流程是有效的——他来指定测试,然后让 AI 去让测试通过。接着他读到 Thoughtworks 的 Birgitta Böckeler 写的一篇东西,讲的是把 TDD 放进 agent loop 内部:让 AI 自己写测试、自己让它通过,中间没有人。结论不只是没帮上忙,而是让代码变得更差、token 花得更多。他的解释才是有意思的部分:TDD 本质上是一套关于人类如何工作的纪律。先写测试能让人保持对「这段代码到底要干什么」的聚焦;只写刚好够让测试通过的代码,能让系统保持最小。这些压力对模型来说一条都不成立。
https://x.com/allenholub/status/2087698126119330166
今天最有用的负面结果。他先说自己那套流程是有效的——他来指定测试,然后让 AI 去让测试通过。接着他读到 Thoughtworks 的 Birgitta Böckeler 写的一篇东西,讲的是把 TDD 放进 agent loop 内部:让 AI 自己写测试、自己让它通过,中间没有人。结论不只是没帮上忙,而是让代码变得更差、token 花得更多。他的解释才是有意思的部分:TDD 本质上是一套关于人类如何工作的纪律。先写测试能让人保持对「这段代码到底要干什么」的聚焦;只写刚好够让测试通过的代码,能让系统保持最小。这些压力对模型来说一条都不成立。
#4
@tokenbytoken_ai
https://x.com/tokenbytoken_ai/status/2087853847070839008
同一份 Thoughtworks 评测,数字摆得更直白:把 TDD 放进 loop 里没有明显收益,非 TDD 的运行在设计维度上得分往往更高,而且只用了大约三分之一的 token。同一天出现两份互相独立的相同发现,已经是这个领域能达到的最接近「复现」的程度了,而它指向一个更大的陷阱:人类的流程纪律,交给 agent 之后不会自动继续生效。
https://x.com/tokenbytoken_ai/status/2087853847070839008
同一份 Thoughtworks 评测,数字摆得更直白:把 TDD 放进 loop 里没有明显收益,非 TDD 的运行在设计维度上得分往往更高,而且只用了大约三分之一的 token。同一天出现两份互相独立的相同发现,已经是这个领域能达到的最接近「复现」的程度了,而它指向一个更大的陷阱:人类的流程纪律,交给 agent 之后不会自动继续生效。
#5
@jiayuan_jy
https://x.com/jiayuan_jy/status/2087911060154314963
他一个月前就被拉进了 DeepSeek Harness 的仓库,那时它还是个只实现了核心框架的毛坯房,他说之后每次 pull 代码都是上千个 commit 在涨。他的理解是:DSH 既是一个可以直接跑的 Coding Agent,同时也是一套 Agent 开发框架。核心主张是「一切皆插件」——模型、工具、文件系统、Shell、沙箱、会话存储、Subagent、UI,甚至 Agent Loop 本身。对这份日报来说真正关键的是它解锁了什么:DSH 现在已经可以让 Agent 检查自己的运行时,现场写一个插件并挂载上去,然后在后续任务里直接用这个刚获得的能力。他也很坦白这部分还很实验性——动态生成的插件只存在于内存里,重启就没了,还不能自动沉淀成一个永久插件。
https://x.com/jiayuan_jy/status/2087911060154314963
他一个月前就被拉进了 DeepSeek Harness 的仓库,那时它还是个只实现了核心框架的毛坯房,他说之后每次 pull 代码都是上千个 commit 在涨。他的理解是:DSH 既是一个可以直接跑的 Coding Agent,同时也是一套 Agent 开发框架。核心主张是「一切皆插件」——模型、工具、文件系统、Shell、沙箱、会话存储、Subagent、UI,甚至 Agent Loop 本身。对这份日报来说真正关键的是它解锁了什么:DSH 现在已经可以让 Agent 检查自己的运行时,现场写一个插件并挂载上去,然后在后续任务里直接用这个刚获得的能力。他也很坦白这部分还很实验性——动态生成的插件只存在于内存里,重启就没了,还不能自动沉淀成一个永久插件。
#6
@mylifcc
https://x.com/mylifcc/status/2087896239455310322
一份真正有深度的 DSH 与 Pi 对比。Pi 的目标是最小核心加上用户自己拼,DSH 则是把几乎所有能力都插件化,并且官方先给你几套完整组合。它的骨架叫 Cordis,这不是普通的插件加载器——它强调可逆副作用,也就是插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销;以及依赖声明,插件通过 inject 声明自己需要什么服务。会话设计是硬核的部分:Session 是 append-only 的事件流,而模型最终看到的上下文必须能从这条 log 完整重建出来。官方把这条写得很死:model-visible means logged。fork、resume、回放、UI 渲染、telemetry 全部从同一条流投影出来,他认为这一点比大多数 coding agent 做得都更彻底。
https://x.com/mylifcc/status/2087896239455310322
一份真正有深度的 DSH 与 Pi 对比。Pi 的目标是最小核心加上用户自己拼,DSH 则是把几乎所有能力都插件化,并且官方先给你几套完整组合。它的骨架叫 Cordis,这不是普通的插件加载器——它强调可逆副作用,也就是插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销;以及依赖声明,插件通过 inject 声明自己需要什么服务。会话设计是硬核的部分:Session 是 append-only 的事件流,而模型最终看到的上下文必须能从这条 log 完整重建出来。官方把这条写得很死:model-visible means logged。fork、resume、回放、UI 渲染、telemetry 全部从同一条流投影出来,他认为这一点比大多数 coding agent 做得都更彻底。
#7
@MinLiBuilds
https://x.com/MinLiBuilds/status/2087891094465925196
他的说法是:DeepSeek 开源的不是一个 Claude Code 的复刻,而是把自己关于「Agent 应该怎么造」的整套观点开源了——模型、Tools、文件系统、Shell、Session、Skill、Sub Agent、Workflow、上下文管理、安全策略,全部拆成可组合、可替换的模块。你可以把它理解成一块 Agent 洞洞板,连 loop 都能换。他觉得最好笑的细节是:别人开源这种纯工程项目,写个 README 差不多就完了,而 DeepSeek 顺手配了一篇论文《A Programming Paradigm for Spatiotemporal Composability》,专门讲这套插件系统背后的理论。
https://x.com/MinLiBuilds/status/2087891094465925196
他的说法是:DeepSeek 开源的不是一个 Claude Code 的复刻,而是把自己关于「Agent 应该怎么造」的整套观点开源了——模型、Tools、文件系统、Shell、Session、Skill、Sub Agent、Workflow、上下文管理、安全策略,全部拆成可组合、可替换的模块。你可以把它理解成一块 Agent 洞洞板,连 loop 都能换。他觉得最好笑的细节是:别人开源这种纯工程项目,写个 README 差不多就完了,而 DeepSeek 顺手配了一篇论文《A Programming Paradigm for Spatiotemporal Composability》,专门讲这套插件系统背后的理论。
#8
@SahilPanhotra
https://x.com/SahilPanhotra/status/2087899089438724398
给只想知道形状的人的压缩版:DeepSeek 发布了自己的 agent harness,有意思的地方在于几乎每一块都能被换掉——模型、工具、skills、沙箱、文件系统、agent loop、编排——而且是 MIT 协议。agent loop 从一个框架属性变成一个配置选项,这是结构性的转变,不是一个功能点。
https://x.com/SahilPanhotra/status/2087899089438724398
给只想知道形状的人的压缩版:DeepSeek 发布了自己的 agent harness,有意思的地方在于几乎每一块都能被换掉——模型、工具、skills、沙箱、文件系统、agent loop、编排——而且是 MIT 协议。agent loop 从一个框架属性变成一个配置选项,这是结构性的转变,不是一个功能点。
#9
@DecurityHQ
https://x.com/DecurityHQ/status/2087831083563855934
一个范围收得很紧的 agent loop,做的是通用助手做不了的事。verifyoor 拿到一个只以 EVM 运行时字节码形式存在于链上的、未经验证的 Solidity 合约,然后循环推进,直到重建出源码加编译器设置,且重新编译后能得到逐字节一致的字节码。终止条件是客观且二元的——字节要么对上要么对不上——而这恰恰是让一个自主 loop 值得信任的性质。中间不需要人来做判断,demo 和源码都公开了。
https://x.com/DecurityHQ/status/2087831083563855934
一个范围收得很紧的 agent loop,做的是通用助手做不了的事。verifyoor 拿到一个只以 EVM 运行时字节码形式存在于链上的、未经验证的 Solidity 合约,然后循环推进,直到重建出源码加编译器设置,且重新编译后能得到逐字节一致的字节码。终止条件是客观且二元的——字节要么对上要么对不上——而这恰恰是让一个自主 loop 值得信任的性质。中间不需要人来做判断,demo 和源码都公开了。
#10
@tom_doerr
https://x.com/tom_doerr/status/2087771020409143448
Ralph 是一个极简的、基于文件的自主编码 agent loop,把文件和 git 当作记忆。整个设计论点就在这一句话里:不用向量数据库,不用专门的记忆服务,就用一个代码仓库本来就会产生的那些持久化产物。提交历史成了 trace,工作区成了 state,loop 从磁盘而不是从上下文重新启动。
https://x.com/tom_doerr/status/2087771020409143448
Ralph 是一个极简的、基于文件的自主编码 agent loop,把文件和 git 当作记忆。整个设计论点就在这一句话里:不用向量数据库,不用专门的记忆服务,就用一个代码仓库本来就会产生的那些持久化产物。提交历史成了 trace,工作区成了 state,loop 从磁盘而不是从上下文重新启动。
#11
@anna_y_zhang
https://x.com/anna_y_zhang/status/2087731800118530306
对「为什么大多数自我改进努力都卡住了」给出的最锐利的诊断。agent trace 是自我改进型公司最重要的新输入,但一堆 trace 本身什么都改进不了。完整的 loop 需要三个部件:一个公司大脑,装着关于决策、上下文以及「为什么这么做」的共享记忆;trace 本身,也就是每个人和每个 agent 实际尝试过什么、什么被扔掉了的原始记录;以及一个学习循环,把这些 trace 转回成更好的上下文、更好的技能、更好的下一次运行。大多数团队有一点第一项,正开始积累第二项。几乎没人有第三项,而只有闭上环的那些才会复利。
https://x.com/anna_y_zhang/status/2087731800118530306
对「为什么大多数自我改进努力都卡住了」给出的最锐利的诊断。agent trace 是自我改进型公司最重要的新输入,但一堆 trace 本身什么都改进不了。完整的 loop 需要三个部件:一个公司大脑,装着关于决策、上下文以及「为什么这么做」的共享记忆;trace 本身,也就是每个人和每个 agent 实际尝试过什么、什么被扔掉了的原始记录;以及一个学习循环,把这些 trace 转回成更好的上下文、更好的技能、更好的下一次运行。大多数团队有一点第一项,正开始积累第二项。几乎没人有第三项,而只有闭上环的那些才会复利。
#12
@stretchcloud
https://x.com/stretchcloud/status/2087829512080052382
一张没人认真看的图。在 OpenRouter 上,agent 的 token 消耗在 2026 年 2 月 6 日超过了人类。此后平台总 token 量从大约 5000 亿涨到了 8 月 10 日七日均值的 7.3 万亿。人类用量增长 2.8 倍到 1.4 万亿,剩下的 5.9 万亿是 agent 的,增速快出好几个数量级。真正重要的比值是:agent 请求每次消耗的 token 是人类请求的 13 到 15 倍。他的结论是,当前的 API 定价、容量规划和限流设计,全都是按照一种已经不再占主导的「人类会话」模式标定的,而按 token 计价根本就是错的单位。
https://x.com/stretchcloud/status/2087829512080052382
一张没人认真看的图。在 OpenRouter 上,agent 的 token 消耗在 2026 年 2 月 6 日超过了人类。此后平台总 token 量从大约 5000 亿涨到了 8 月 10 日七日均值的 7.3 万亿。人类用量增长 2.8 倍到 1.4 万亿,剩下的 5.9 万亿是 agent 的,增速快出好几个数量级。真正重要的比值是:agent 请求每次消耗的 token 是人类请求的 13 到 15 倍。他的结论是,当前的 API 定价、容量规划和限流设计,全都是按照一种已经不再占主导的「人类会话」模式标定的,而按 token 计价根本就是错的单位。
#13
@JinseokKim60030
https://x.com/JinseokKim60030/status/2087789051378085915
一句话解释了大多数失败的自我改进 loop:难点不在路由,在指标。自我改进的 loop 只有在「评分器比任务本身更难被钻空子」的前提下才会收敛,否则 agent 优化的是你的 eval 而不是你的目标。便宜的模型让这个 loop 负担得起,可信的评分器才让它有用。任何在搭建过夜优化 harness 的人,都该把这条当成设计约束而不是事后补丁。
https://x.com/JinseokKim60030/status/2087789051378085915
一句话解释了大多数失败的自我改进 loop:难点不在路由,在指标。自我改进的 loop 只有在「评分器比任务本身更难被钻空子」的前提下才会收敛,否则 agent 优化的是你的 eval 而不是你的目标。便宜的模型让这个 loop 负担得起,可信的评分器才让它有用。任何在搭建过夜优化 harness 的人,都该把这条当成设计约束而不是事后补丁。
#14
@JinseokKim60030
https://x.com/JinseokKim60030/status/2087790911610659133
配套的经济学论证。按任务算成本比按次算成本更重要,因为一个便宜模型只要在长 agent loop 上多需要一轮纠正,两倍的价格差立刻就被抹平了。他建议任何价格主张都要同时给出 token 消耗量和重试次数,再谈胜负。这正是绝大多数模型对比帖完全跳过的那道纪律。
https://x.com/JinseokKim60030/status/2087790911610659133
配套的经济学论证。按任务算成本比按次算成本更重要,因为一个便宜模型只要在长 agent loop 上多需要一轮纠正,两倍的价格差立刻就被抹平了。他建议任何价格主张都要同时给出 token 消耗量和重试次数,再谈胜负。这正是绝大多数模型对比帖完全跳过的那道纪律。
#15
@tickswiz
https://x.com/tickswiz/status/2087887918631141697
带数字的反方观点。DeepSeek 正式发布 V4-Pro,Terminal-Bench 87.9 分,对比 Fable 5 的 88 分;标价每百万输入 0.44 美元、输出 0.88 美元,而 Fable 是 10 美元和 50 美元。他的说法是:5% 的能力差距是一页 PPT,50 倍的价格差距才是产品。如果你的 agent loop 一次要连烧四十分钟的 token,你买的其实不是智能,你买的是一张费率表。跟上面那条「按任务算成本」放在一起读,这两条构成了真正的争论。
https://x.com/tickswiz/status/2087887918631141697
带数字的反方观点。DeepSeek 正式发布 V4-Pro,Terminal-Bench 87.9 分,对比 Fable 5 的 88 分;标价每百万输入 0.44 美元、输出 0.88 美元,而 Fable 是 10 美元和 50 美元。他的说法是:5% 的能力差距是一页 PPT,50 倍的价格差距才是产品。如果你的 agent loop 一次要连烧四十分钟的 token,你买的其实不是智能,你买的是一张费率表。跟上面那条「按任务算成本」放在一起读,这两条构成了真正的争论。
#16
@devcansado404
https://x.com/devcansado404/status/2087871452099826018
关于弹性推理参数的一句尖锐警告。它看着很干净,直到一个 agentic loop 在一个畸形 payload 上把 effort 升到 max,几分钟内烧光你的 token 预算。他的结论是运行时治理需要硬性护栏,否则 max reasoning 只是穿着功能外衣的无上限成本和延迟。每一个带动态 effort 旋钮的自主 loop,都需要一个 loop 自己抬不高的天花板。
https://x.com/devcansado404/status/2087871452099826018
关于弹性推理参数的一句尖锐警告。它看着很干净,直到一个 agentic loop 在一个畸形 payload 上把 effort 升到 max,几分钟内烧光你的 token 预算。他的结论是运行时治理需要硬性护栏,否则 max reasoning 只是穿着功能外衣的无上限成本和延迟。每一个带动态 effort 旋钮的自主 loop,都需要一个 loop 自己抬不高的天花板。
#17
@Montyclt
https://x.com/Montyclt/status/2087820650165551227
一个跑在客服领域的生产级 agent loop,由亲手实施的人来描述。工单一开,模型几乎把所有事都做了:分析工单、路由到正确的部门、做诊断、给人类坐席提出一个解决方案,并给这个坐席一个按钮,让模型通过带 tool calling 的 agent loop 去实际执行该方案,最后起草给客户的回复草稿。如果是电话,Whisper 那一类模型实时转写,同时 LLM 在对话进行中不断提出方案。这就是自主 loop 落到真实运营组织里的形状——人守在审批门上,agent 负责跑完整条路径。
https://x.com/Montyclt/status/2087820650165551227
一个跑在客服领域的生产级 agent loop,由亲手实施的人来描述。工单一开,模型几乎把所有事都做了:分析工单、路由到正确的部门、做诊断、给人类坐席提出一个解决方案,并给这个坐席一个按钮,让模型通过带 tool calling 的 agent loop 去实际执行该方案,最后起草给客户的回复草稿。如果是电话,Whisper 那一类模型实时转写,同时 LLM 在对话进行中不断提出方案。这就是自主 loop 落到真实运营组织里的形状——人守在审批门上,agent 负责跑完整条路径。
#18
@BestAIToolFind
https://x.com/BestAIToolFind/status/2087737367209882066
Prime Agent 来自 Prime Intellect,是一个围绕 Recursive Language Model 抽象构建的开源自我改进编码 harness。它在 2026 年 8 月 10 日登陆 Product Hunt,当日第六,174 个 upvote。它跟他们的开源强化学习训练栈——prime-rl、verifiers、Environments Hub——以及一个 GPU 算力市场并列,这让它成为极少数由「同时掌握底层训练循环」的团队做出来的自我改进 harness。
https://x.com/BestAIToolFind/status/2087737367209882066
Prime Agent 来自 Prime Intellect,是一个围绕 Recursive Language Model 抽象构建的开源自我改进编码 harness。它在 2026 年 8 月 10 日登陆 Product Hunt,当日第六,174 个 upvote。它跟他们的开源强化学习训练栈——prime-rl、verifiers、Environments Hub——以及一个 GPU 算力市场并列,这让它成为极少数由「同时掌握底层训练循环」的团队做出来的自我改进 harness。
#19
@SciFi
https://x.com/SciFi/status/2087908614975443405
一篇光看标题就值得记下的论文:《Agentic Auto-Research is Fuzz Testing》,作者是 Yifeng He、Jicheng Wang、Yinzhe Zhao、Jiachen Liu 和 Hao Chen。这个重新框定很有用——如果你把 auto-research 当成模糊测试而不是当成推理,那么覆盖率、变异策略和崩溃检测就成了设计词汇,价值来自对着一个可靠预言机做大量廉价试验,而不是来自某一步的巧妙。
https://x.com/SciFi/status/2087908614975443405
一篇光看标题就值得记下的论文:《Agentic Auto-Research is Fuzz Testing》,作者是 Yifeng He、Jicheng Wang、Yinzhe Zhao、Jiachen Liu 和 Hao Chen。这个重新框定很有用——如果你把 auto-research 当成模糊测试而不是当成推理,那么覆盖率、变异策略和崩溃检测就成了设计词汇,价值来自对着一个可靠预言机做大量廉价试验,而不是来自某一步的巧妙。
#20
@Secondmindsys
https://x.com/Secondmindsys/status/2087760855601402231
为什么 loop 一长,微小的准确率提升就不再是「微小」。在一次性任务上,好 5% 感觉是边际的。但在一个长 agent loop 上,错误更少意味着更少的恢复、更少的返工、更多的任务能活着走到终点。他很谨慎地表示这还称不上 AGI,但结构性观点是成立的:可靠性会沿着工作长度复利,所以更好的模型解锁的是不成比例地更有用的 agent,而不是按比例更好一点的 agent。
https://x.com/Secondmindsys/status/2087760855601402231
为什么 loop 一长,微小的准确率提升就不再是「微小」。在一次性任务上,好 5% 感觉是边际的。但在一个长 agent loop 上,错误更少意味着更少的恢复、更少的返工、更多的任务能活着走到终点。他很谨慎地表示这还称不上 AGI,但结构性观点是成立的:可靠性会沿着工作长度复利,所以更好的模型解锁的是不成比例地更有用的 agent,而不是按比例更好一点的 agent。
#21
@discernmentlab
https://x.com/discernmentlab/status/2087742728834830585
一周之内的三个信号,说明第二大脑正在从「给人翻」变成「给 agent 查」:Notion 收购了做 AI 检索的 ZeroEntropy,Genspark 上线了 SecondBrain 并把问题命名为 AI 健忘症,Oracle 发布了一份自我改进第二大脑的指南。他点出的转变是从存储走向自维护的知识——记忆层不再是一个你往里放东西的地方,而变成了一个自己跑维护循环的东西。
https://x.com/discernmentlab/status/2087742728834830585
一周之内的三个信号,说明第二大脑正在从「给人翻」变成「给 agent 查」:Notion 收购了做 AI 检索的 ZeroEntropy,Genspark 上线了 SecondBrain 并把问题命名为 AI 健忘症,Oracle 发布了一份自我改进第二大脑的指南。他点出的转变是从存储走向自维护的知识——记忆层不再是一个你往里放东西的地方,而变成了一个自己跑维护循环的东西。
#22
@mr_bailando
https://x.com/mr_bailando/status/2087880077883081151
Jack Dorsey 发布了一个免费开源的 AI agent OS,GitHub 26.2k star 还在涨,定位是「通过 AI agent 运行整家公司」的基础设施,操作系统级别的抽象,完整支持 agentic loop。他的解读是商业层面的:大多数收费一千美元以上每月的 agent 基础设施创业公司,卖的就是编排、持久记忆和任务路由,而这个东西一次性把三样都商品化了,免费,还带着真实的分发能力。护城河从来就不是编排本身。
https://x.com/mr_bailando/status/2087880077883081151
Jack Dorsey 发布了一个免费开源的 AI agent OS,GitHub 26.2k star 还在涨,定位是「通过 AI agent 运行整家公司」的基础设施,操作系统级别的抽象,完整支持 agentic loop。他的解读是商业层面的:大多数收费一千美元以上每月的 agent 基础设施创业公司,卖的就是编排、持久记忆和任务路由,而这个东西一次性把三样都商品化了,免费,还带着真实的分发能力。护城河从来就不是编排本身。
#23
@cortensor
https://x.com/cortensor/status/2087705634313797814
一篇诚实的半成品开发日志,不是发布通稿。PyClaw 即将进入月末评估,回顾 agent loop、编码工作流、记忆、工具链和整体可用性到底推进到了哪一步,明确目标是找出距离一个实用 MVP 还差什么。他们已经预期到跟 Cortensor Portal 之间存在 API 兼容性缺口,并计划用 PyClaw 自己去暴露剩下的缺口——把 agent 指向它自己的集成面,本身就是个小而真实的自我改进循环。
https://x.com/cortensor/status/2087705634313797814
一篇诚实的半成品开发日志,不是发布通稿。PyClaw 即将进入月末评估,回顾 agent loop、编码工作流、记忆、工具链和整体可用性到底推进到了哪一步,明确目标是找出距离一个实用 MVP 还差什么。他们已经预期到跟 Cortensor Portal 之间存在 API 兼容性缺口,并计划用 PyClaw 自己去暴露剩下的缺口——把 agent 指向它自己的集成面,本身就是个小而真实的自我改进循环。
#24
@VibeCoderOfek
https://x.com/VibeCoderOfek/status/2087912037242253465
总结今天的那句话:按成功任务算的成本,是唯一一个能在过夜 agent loop 的实战检验中存活下来的数字,其余的都只是排行榜版本。
https://x.com/VibeCoderOfek/status/2087912037242253465
总结今天的那句话:按成功任务算的成本,是唯一一个能在过夜 agent loop 的实战检验中存活下来的数字,其余的都只是排行榜版本。
📡 生态产品雷达
生态产品雷达
DeepSeek Harness(DSH)— 今天的重心所在,MIT 协议,模型、工具、沙箱、文件系统、编排以及 agent loop 本身全部是可替换插件。
Cordis — DSH 底下的插件内核,卸载时可逆副作用与依赖注入式的空间可组合性是它的特点,还自带一篇论文。
Pi — DSH「全家桶式插件化」哲学的极简内核对照组,反复作为比较基线出现。
Claude Code — 仍然是每个新 loop 框架用来对标的默认参照 harness。
Codex — harness 跑分讨论里另一个恒定的对照点。
Polymarket — 公开自我改进 agent loop 的首选场地,结算过程提供了一个免费且无法伪造的评分器。
Prime Agent — 基于 Recursive Language Model 抽象的开源自我改进编码 harness,出自同时运营 prime-rl 和 Environments Hub 的团队。
Ralph — 极简的基于文件的 agent loop,把文件和 git 当记忆层,而不是上向量库。
DeepSeek Harness(DSH)— 今天的重心所在,MIT 协议,模型、工具、沙箱、文件系统、编排以及 agent loop 本身全部是可替换插件。
Cordis — DSH 底下的插件内核,卸载时可逆副作用与依赖注入式的空间可组合性是它的特点,还自带一篇论文。
Pi — DSH「全家桶式插件化」哲学的极简内核对照组,反复作为比较基线出现。
Claude Code — 仍然是每个新 loop 框架用来对标的默认参照 harness。
Codex — harness 跑分讨论里另一个恒定的对照点。
Polymarket — 公开自我改进 agent loop 的首选场地,结算过程提供了一个免费且无法伪造的评分器。
Prime Agent — 基于 Recursive Language Model 抽象的开源自我改进编码 harness,出自同时运营 prime-rl 和 Environments Hub 的团队。
Ralph — 极简的基于文件的 agent loop,把文件和 git 当记忆层,而不是上向量库。
评论