Loop 日报: 2026-10-08
这个窗口的循环新闻讲的是循环学到了什么,以及该不该让它去学。Meta 的 MIRA 论文把研究 agent 一分为二:一个元推理器读一份持久的研究记录、写下一轮的工单,一个全新的执行器把工单做完,于是那些很少出现的「下一步查什么」的决定有了自己的 critic;SEAR 花了累计四年多的 agent 时间让机器人策略自我演化,发现 Astra 最擅长实时盯着纠正每一步,Fable 最擅长先用代码写出自己的工具和策略;SkillPoison 则证明一个自我改进的 agent 可以被十五条全都通过验证的轨迹教会一条错误的规则,某个配置下攻击成功率 95.71%。使用数据也来了:在 OpenResearch 上,Opus 5.5 跑了 34.9% 的 autoresearch 实验,GPT-6.1 Sol 占 25.4%,开源模型只有 7.8%。实践这一侧,一位 SpaceXAI 工程师八月用 20 多个并行 agent 合入了 2,462 个 PR,并把功劳归于验证而不是 agent 数量;一个持续学习产品现在每晚回顾前一天的对话并自动启动一轮强化学习;SGLang 上的 agent 对 agent 循环把成功归因于「让环境更容易监督」。最尖锐的批评都冲着指标去:Alexandr Wang 那句「一群 agent 抵一百个工程师」完全取决于有没有正确的评估,一位 ICLR 审稿人说大多数靠 autoresearch 循环投来的稿子是垃圾,还有一条回复指出爬山式循环几乎从不检验改进是否统计显著。
#1
@dair_ai
https://x.com/dair_ai/status/2107482016342233309
dair_ai 总结了 Meta AI 一篇关于「决定下一步调查什么」的研究 agent 论文。在长程研究里,下一步查什么这个决定很难学,因为它在长轨迹里出现得少、效果又要几步之后才显现,所以 MIRA 把 agent 拆成两个:外层的元推理器读一份持久的研究记录、写一张工单,一个全新的执行器把每张工单做完。决策只发生在工单边界上,作者就在那里训练一个预测剩余回报的 critic,再训一个既给部分进展估值、又挑下一项调查的单一 actor-critic(MIRA-AC)。即便不训练,这种拆分也提升了定理证明和开放式架构研究;用模型自己的代理信号训练后,MIRA-AC 在全部四个 autoresearch 环境上都提高了金标准得分。
https://x.com/dair_ai/status/2107482016342233309
dair_ai 总结了 Meta AI 一篇关于「决定下一步调查什么」的研究 agent 论文。在长程研究里,下一步查什么这个决定很难学,因为它在长轨迹里出现得少、效果又要几步之后才显现,所以 MIRA 把 agent 拆成两个:外层的元推理器读一份持久的研究记录、写一张工单,一个全新的执行器把每张工单做完。决策只发生在工单边界上,作者就在那里训练一个预测剩余回报的 critic,再训一个既给部分进展估值、又挑下一项调查的单一 actor-critic(MIRA-AC)。即便不训练,这种拆分也提升了定理证明和开放式架构研究;用模型自己的代理信号训练后,MIRA-AC 在全部四个 autoresearch 环境上都提高了金标准得分。
#2
@BangzhengL
https://x.com/BangzhengL/status/2107925014150582461
BangzhengL 发布了 SEAR,一个评测大模型 agent 在机器人上如何自我演化的基准和框架。循环是:在给定时间预算内,agent 和它的技能库更新一个策略,策略在仿真或真机上跑,评判者返回反馈,技能库把技能和教训带进下一个任务。它同时研究 agent 运作的三种方式:策略可以是 agent 写的代码,可以是 agent 自己坐在控制回路里,也可以是它训练出的 VLA(autoresearch)。团队在仿真和真实硬件上累计花了四年多的 agent 演化时间,用 330 个仿真任务、两个物理引擎和多种形态的真机测了七个前沿模型。主要发现:DeepSeek 这类纯文本模型也能控制机器人;Astra 最擅长实时盯着并纠正每一步;Fable 最擅长先用代码把自己的工具和策略搭出来。
https://x.com/BangzhengL/status/2107925014150582461
BangzhengL 发布了 SEAR,一个评测大模型 agent 在机器人上如何自我演化的基准和框架。循环是:在给定时间预算内,agent 和它的技能库更新一个策略,策略在仿真或真机上跑,评判者返回反馈,技能库把技能和教训带进下一个任务。它同时研究 agent 运作的三种方式:策略可以是 agent 写的代码,可以是 agent 自己坐在控制回路里,也可以是它训练出的 VLA(autoresearch)。团队在仿真和真实硬件上累计花了四年多的 agent 演化时间,用 330 个仿真任务、两个物理引擎和多种形态的真机测了七个前沿模型。主要发现:DeepSeek 这类纯文本模型也能控制机器人;Astra 最擅长实时盯着并纠正每一步;Fable 最擅长先用代码把自己的工具和策略搭出来。
#3
@JiahengHu1
https://x.com/JiahengHu1/status/2107485908673106241
JiahengHu1 发布了 SimEX,仿真集成的机器人 autoresearch,瞄准的是那些「Astra 控制机器人」演示背后的缺口:部署慢、API 全靠手工搭、仿真出来的行为到真机上就不行。核心问题是怎么让编程 agent 在物理世界里真正能用,线程和论文都在帖子里。
https://x.com/JiahengHu1/status/2107485908673106241
JiahengHu1 发布了 SimEX,仿真集成的机器人 autoresearch,瞄准的是那些「Astra 控制机器人」演示背后的缺口:部署慢、API 全靠手工搭、仿真出来的行为到真机上就不行。核心问题是怎么让编程 agent 在物理世界里真正能用,线程和论文都在帖子里。
#4
@KostyaAI
https://x.com/KostyaAI/status/2107876920977158389
KostyaAI 写了 SkillPoison 这篇论文,它盯上了自我改进 agent 的一个盲区:把成功轨迹变成可复用技能的那条流水线。在它的威胁模型里,攻击者不能改执行、输出、验证、抽取流水线或生成的技能,只能从成功经验里挑最多 15 条用于技能形成并附上注释,而且每条被选中的轨迹都是任务正确、通过验证的。失败发生在泛化:一个在特定条件下反复有帮助的行为被保留了,条件却丢了,然后被用到了它不适用的范围里。在 PAWS 上配合 Trace2Skill 攻击成功率达到 95.71%,在 DS1000 上是 36.64%。给运营演化技能库的人的建议:把技能晋升当成特权写入,每条规则都存上适用条件,保留到源轨迹和验证结果的链接,用反例的域外案例测每个候选技能,新技能先放在版本控制和回滚之后。
https://x.com/KostyaAI/status/2107876920977158389
KostyaAI 写了 SkillPoison 这篇论文,它盯上了自我改进 agent 的一个盲区:把成功轨迹变成可复用技能的那条流水线。在它的威胁模型里,攻击者不能改执行、输出、验证、抽取流水线或生成的技能,只能从成功经验里挑最多 15 条用于技能形成并附上注释,而且每条被选中的轨迹都是任务正确、通过验证的。失败发生在泛化:一个在特定条件下反复有帮助的行为被保留了,条件却丢了,然后被用到了它不适用的范围里。在 PAWS 上配合 Trace2Skill 攻击成功率达到 95.71%,在 DS1000 上是 36.64%。给运营演化技能库的人的建议:把技能晋升当成特权写入,每条规则都存上适用条件,保留到源轨迹和验证结果的链接,用反例的域外案例测每个候选技能,新技能先放在版本控制和回滚之后。
#5
@gravity7
https://x.com/gravity7/status/2107903702006919554
gravity7 点出了《Harness as a Language》这篇论文,它提出 JAZ,一个极简的 agent 框架,挑战「长期记忆和自我改进需要基础循环之外的专门系统」这个假设。JAZ 只暴露一个原语 invoke,让大模型写任意可执行代码、包括递归调用自己,所有输入和交互历史都作为变量可用;没有手工设计的工具、没有外部记忆、没有定制 harness。在长程回忆任务上它以一半的成本超过 Letta(MemGPT)8%,在持续自我改进基准上以更低成本超过 ACE 4%。它抛出的问题是:对提示做算法化的控制流能不能模拟一门编程语言,以及是什么让语言成为过程性知识的有效参数化方式。
https://x.com/gravity7/status/2107903702006919554
gravity7 点出了《Harness as a Language》这篇论文,它提出 JAZ,一个极简的 agent 框架,挑战「长期记忆和自我改进需要基础循环之外的专门系统」这个假设。JAZ 只暴露一个原语 invoke,让大模型写任意可执行代码、包括递归调用自己,所有输入和交互历史都作为变量可用;没有手工设计的工具、没有外部记忆、没有定制 harness。在长程回忆任务上它以一半的成本超过 Letta(MemGPT)8%,在持续自我改进基准上以更低成本超过 ACE 4%。它抛出的问题是:对提示做算法化的控制流能不能模拟一门编程语言,以及是什么让语言成为过程性知识的有效参数化方式。
#6
@askalphaxiv
https://x.com/askalphaxiv/status/2107851945385902456
askalphaxiv 公布了研究者在 OpenResearch 上做 autoresearch 实际用的模型:Opus 5.5 以 34.9% 领先,GPT-6.1 Sol 以 25.4% 远远排第二,开源模型只占总用量的 7.8%,尽管它们在编码等其他领域的采用率在涨。后续帖子邀请任何人带自己的模型或编程 agent 上平台跑第一个实验。
https://x.com/askalphaxiv/status/2107851945385902456
askalphaxiv 公布了研究者在 OpenResearch 上做 autoresearch 实际用的模型:Opus 5.5 以 34.9% 领先,GPT-6.1 Sol 以 25.4% 远远排第二,开源模型只占总用量的 7.8%,尽管它们在编码等其他领域的采用率在涨。后续帖子邀请任何人带自己的模型或编程 agent 上平台跑第一个实验。
#7
@ZaneOnAI
https://x.com/ZaneOnAI/status/2107570017004917035
ZaneOnAI 总结了一位 SpaceXAI 工程师的 agent 循环背后的数字:七月 Lauren Tan 合入了 1,000 个 PR 并说会翻倍,八月合入了 2,462 个,靠开源插件 pstack 并行跑 20 多个 agent,早上醒来已经有 20 个合进去了。那场一小时的分享里的结论是:诀窍是验证而不是更多 agent;没有验证,一百个 agent 只会产出垃圾 PR,有了验证它们就能在你睡觉时合并自己的工作。
https://x.com/ZaneOnAI/status/2107570017004917035
ZaneOnAI 总结了一位 SpaceXAI 工程师的 agent 循环背后的数字:七月 Lauren Tan 合入了 1,000 个 PR 并说会翻倍,八月合入了 2,462 个,靠开源插件 pstack 并行跑 20 多个 agent,早上醒来已经有 20 个合进去了。那场一小时的分享里的结论是:诀窍是验证而不是更多 agent;没有验证,一百个 agent 只会产出垃圾 PR,有了验证它们就能在你睡觉时合并自己的工作。
#8
@0xglu
https://x.com/0xglu/status/2107905597089710518
0xglu 描述了一个默认就进 autoresearch 模式的持续学习产品:一个大模型回顾你的对话,挑出最好的样例,用它自己判定最合适的评分器去评估,然后每晚自动启动强化学习训练。只有一句话,但它是本窗口里「agent 同时挑数据和挑裁判」的夜间循环最清楚的例子。
https://x.com/0xglu/status/2107905597089710518
0xglu 描述了一个默认就进 autoresearch 模式的持续学习产品:一个大模型回顾你的对话,挑出最好的样例,用它自己判定最合适的评分器去评估,然后每晚自动启动强化学习训练。只有一句话,但它是本窗口里「agent 同时挑数据和挑裁判」的夜间循环最清楚的例子。
#9
@OxyKodit
https://x.com/OxyKodit/status/2107804085906706749
OxyKodit 要去讲 Karpathy 的 nanochat,一个具备 GPT-2 能力、能从零训练的全开源大模型实现,并认为这样的仓库正是 autoresearch 的完美试验田:一个大模型去改进另一个大模型的实现。作为这个仓库的维护者,看着 autoresearch 的改进一个个合进来,催生了和欧洲实验室 Sevren 一起做的 Faberon,现在处于早期测试,预览里它已经接管了机器学习工程师的活。
https://x.com/OxyKodit/status/2107804085906706749
OxyKodit 要去讲 Karpathy 的 nanochat,一个具备 GPT-2 能力、能从零训练的全开源大模型实现,并认为这样的仓库正是 autoresearch 的完美试验田:一个大模型去改进另一个大模型的实现。作为这个仓库的维护者,看着 autoresearch 的改进一个个合进来,催生了和欧洲实验室 Sevren 一起做的 Faberon,现在处于早期测试,预览里它已经接管了机器学习工程师的活。
#10
@pratikg
https://x.com/pratikg/status/2107900477266600125
pratikg 注意到一条讲多人 autoresearch 怎么运作的帖子收藏数比点赞还多,481 比 403,并让大家去 Yukon Research 上挑任何一个进行中的挑战,把自己的 agent 或 harness 对准它。窗口里另一条回复引用同一类竞赛,预计一旦更多人和 agent 开始搜索,一个密码学界限会出现对数级的改进。
https://x.com/pratikg/status/2107900477266600125
pratikg 注意到一条讲多人 autoresearch 怎么运作的帖子收藏数比点赞还多,481 比 403,并让大家去 Yukon Research 上挑任何一个进行中的挑战,把自己的 agent 或 harness 对准它。窗口里另一条回复引用同一类竞赛,预计一旦更多人和 agent 开始搜索,一个密码学界限会出现对数级的改进。
#11
@OpenRSI
https://x.com/OpenRSI/status/2107949970594857151
OpenRSI 回应了合作方对他们在 SGLang 上 agent 循环的写作,挑出一条教训:让环境更容易被监督才是关键。有维护者、约束清楚、标准严格的环境,是这个循环有效的原因,下一阶段要挑战的是监督更弱的场景。
https://x.com/OpenRSI/status/2107949970594857151
OpenRSI 回应了合作方对他们在 SGLang 上 agent 循环的写作,挑出一条教训:让环境更容易被监督才是关键。有维护者、约束清楚、标准严格的环境,是这个循环有效的原因,下一阶段要挑战的是监督更弱的场景。
#12
@dsmiley411
https://x.com/dsmiley411/status/2107946425187516842
dsmiley411 描述了 CodeStrap 把 agent 循环改成 DAG 并和 Figma 集成的做法。要解决的是业务方和前线部署工程师之间的契约问题:Figma 或 Claude Design 这类工具能起草该做什么、为什么做,但让这份契约和交付保持一致很难,模型得猜一次改动会碰到代码库的哪些部分,而约束它不去改你没要求的东西更难。宣称的结果:几分钟内以接近零成本生成完整应用,业务契约和交付团队保持对齐,以及语义化的版本控制。
https://x.com/dsmiley411/status/2107946425187516842
dsmiley411 描述了 CodeStrap 把 agent 循环改成 DAG 并和 Figma 集成的做法。要解决的是业务方和前线部署工程师之间的契约问题:Figma 或 Claude Design 这类工具能起草该做什么、为什么做,但让这份契约和交付保持一致很难,模型得猜一次改动会碰到代码库的哪些部分,而约束它不去改你没要求的东西更难。宣称的结果:几分钟内以接近零成本生成完整应用,业务契约和交付团队保持对齐,以及语义化的版本控制。
#13
@Vtrivedy10
https://x.com/Vtrivedy10/status/2107931451501228458
Vtrivedy10 给了一个四步法来评估评估本身。先用不同模型跑几个 agent 过一遍当前版本的评估;让一个 agent 带着对环境和验证逻辑的特权访问去审这些轨迹;给这个审查 agent 一个关于常见坑的 skill,比如裁判过于严格,并让它找别的坑;最后人和 agent 一起审,然后循环。
https://x.com/Vtrivedy10/status/2107931451501228458
Vtrivedy10 给了一个四步法来评估评估本身。先用不同模型跑几个 agent 过一遍当前版本的评估;让一个 agent 带着对环境和验证逻辑的特权访问去审这些轨迹;给这个审查 agent 一个关于常见坑的 skill,比如裁判过于严格,并让它找别的坑;最后人和 agent 一起审,然后循环。
#14
@itsvlady
https://x.com/itsvlady/status/2107712852307943742
itsvlady 反驳了 Alexandr Wang 关于 Meta 内部一群 agent 打败一百人工程团队的说法,要求拿出证据:只有内部案例、没有点名基准、没有点名团队,而且「正确的 agentic 循环和正确的指标」这句话承担了全部重量。来自一个每晚都在跑 agent 的人的反驳是:找到正确的指标,恰恰就是那一百个工程师在干的活。
https://x.com/itsvlady/status/2107712852307943742
itsvlady 反驳了 Alexandr Wang 关于 Meta 内部一群 agent 打败一百人工程团队的说法,要求拿出证据:只有内部案例、没有点名基准、没有点名团队,而且「正确的 agentic 循环和正确的指标」这句话承担了全部重量。来自一个每晚都在跑 agent 的人的反驳是:找到正确的指标,恰恰就是那一百个工程师在干的活。
#15
@AiEvolutio58513
https://x.com/AiEvolutio58513/status/2107471089215721965
AiEvolutio58513 引用了本窗口好几条帖子在争论的那句 Alexandr Wang 的话:在 Meta 内部,如果你搭出正确的 agentic 循环、并给 agent 一套正确的评估体系和优化指标,一群 agent 能干得比一百人的工程团队还多,这是在 2026 年 Startup School 上和 Garry Tan 的对谈里说的。收录它是因为真正有内容的是回复,不是引文本身。
https://x.com/AiEvolutio58513/status/2107471089215721965
AiEvolutio58513 引用了本窗口好几条帖子在争论的那句 Alexandr Wang 的话:在 Meta 内部,如果你搭出正确的 agentic 循环、并给 agent 一套正确的评估体系和优化指标,一群 agent 能干得比一百人的工程团队还多,这是在 2026 年 Startup School 上和 Garry Tan 的对谈里说的。收录它是因为真正有内容的是回复,不是引文本身。
#16
@_TarunKathuria
https://x.com/_TarunKathuria/status/2107569375809261825
_TarunKathuria 在一条讨论当前模型能否产出新颖研究的线程里说,Astra、Fable 5.1、Opus 5.5 和 Gemini 4 Argon 都还没到:它们能提出有意思的假设,但往下挖一两层多数是胡说。附带两个观察:agent 蜂群或两个月后的下一代模型很可能就到了;以及明显有很多用 Fable 和 Astra 的 autoresearch 循环生成的 ICLR 投稿,质量是垃圾。
https://x.com/_TarunKathuria/status/2107569375809261825
_TarunKathuria 在一条讨论当前模型能否产出新颖研究的线程里说,Astra、Fable 5.1、Opus 5.5 和 Gemini 4 Argon 都还没到:它们能提出有意思的假设,但往下挖一两层多数是胡说。附带两个观察:agent 蜂群或两个月后的下一代模型很可能就到了;以及明显有很多用 Fable 和 Astra 的 autoresearch 循环生成的 ICLR 投稿,质量是垃圾。
#17
@_TarunKathuria
https://x.com/_TarunKathuria/status/2107678433744761139
_TarunKathuria 在另一场关于预训练 autoresearch 的交流里又补了两个提醒。第一,哪些改进是统计显著的、哪些只是噪声,没有像样的评估很难分清,而大多数爬山式 autoresearch 循环根本不做这件事。第二,预训练上的改进有多少能在后训练之后保留下来并不清楚,因为后训练那一套(数据、配方)很少被当成模型规格写清楚交给循环。
https://x.com/_TarunKathuria/status/2107678433744761139
_TarunKathuria 在另一场关于预训练 autoresearch 的交流里又补了两个提醒。第一,哪些改进是统计显著的、哪些只是噪声,没有像样的评估很难分清,而大多数爬山式 autoresearch 循环根本不做这件事。第二,预训练上的改进有多少能在后训练之后保留下来并不清楚,因为后训练那一套(数据、配方)很少被当成模型规格写清楚交给循环。
#18
@ricci_nov
https://x.com/ricci_nov/status/2107933377466933754
ricci_nov 对「在固定基准上评分的自我改进 agent」提出了古德哈特式的质疑:系统本身就在爬这个分数,所以「超越了基准」既可能是能力变强,也可能是背下了测试。能让人信服的持久改进,是新生成的留出任务,最好来自第三方;回复里还问了一句,为什么讨论中那张图里 84.6% 那根柱子是唯一的虚线。
https://x.com/ricci_nov/status/2107933377466933754
ricci_nov 对「在固定基准上评分的自我改进 agent」提出了古德哈特式的质疑:系统本身就在爬这个分数,所以「超越了基准」既可能是能力变强,也可能是背下了测试。能让人信服的持久改进,是新生成的留出任务,最好来自第三方;回复里还问了一句,为什么讨论中那张图里 84.6% 那根柱子是唯一的虚线。
#19
@anpaure
https://x.com/anpaure/status/2107583984045875503
anpaure 回了一条关于「研究品味」的帖子,顺手戳了短程 autoresearch 爬山一下:往里一看,几万个 AI 小时花在 nanogpt 上,没有哪一次做到了一个路人随口建议的事。只有一句话,但它正是好几期 Loop 日报绕着转的那个负面结果。
https://x.com/anpaure/status/2107583984045875503
anpaure 回了一条关于「研究品味」的帖子,顺手戳了短程 autoresearch 爬山一下:往里一看,几万个 AI 小时花在 nanogpt 上,没有哪一次做到了一个路人随口建议的事。只有一句话,但它正是好几期 Loop 日报绕着转的那个负面结果。
#20
@DoDataThings
https://x.com/DoDataThings/status/2107571404283760964
DoDataThings 把 Wang 那套配方变成了一条分工规则。配方有两部分,一个 agentic 循环和一个 agent 去优化的评估指标;代码是便宜的那部分,循环的好坏取决于打分函数。所以有干净的自动分数的工作,测试套件、延迟目标、构建通过率,最先落到 agent 群手里;而「更好」要靠判断的工作,会在人手里留得更久。指标成了工程师的活。
https://x.com/DoDataThings/status/2107571404283760964
DoDataThings 把 Wang 那套配方变成了一条分工规则。配方有两部分,一个 agentic 循环和一个 agent 去优化的评估指标;代码是便宜的那部分,循环的好坏取决于打分函数。所以有干净的自动分数的工作,测试套件、延迟目标、构建通过率,最先落到 agent 群手里;而「更好」要靠判断的工作,会在人手里留得更久。指标成了工程师的活。
#21
@ainotesus
https://x.com/ainotesus/status/2107609408955953540
ainotesus 列出了 Langfuse 由 Marc Klingen 展示的自我改进开源 agent 栈:把生产环境的 trace 和数据集、实验、评估连起来,让 AI 提出修复方案,并把 v2 的更新日志生成器和 v1 做回测,目标和质量边界仍由人掌握。这是可观测性厂商版本的循环,人被留在定目标那一层。
https://x.com/ainotesus/status/2107609408955953540
ainotesus 列出了 Langfuse 由 Marc Klingen 展示的自我改进开源 agent 栈:把生产环境的 trace 和数据集、实验、评估连起来,让 AI 提出修复方案,并把 v2 的更新日志生成器和 v1 做回测,目标和质量边界仍由人掌握。这是可观测性厂商版本的循环,人被留在定目标那一层。
#22
@O_Hampiholi
https://x.com/O_Hampiholi/status/2107362764096205100
O_Hampiholi 在一条关于据报道的 Hugging Face 事故的线程里主张嵌入式评估:部署前的测试打的是模型的分,不是那个带着真实凭证在实验室里跑的 agent 循环的分。如果事故来自内部使用,评估对象就应该是部署本身,工具、权限和日志,问题是谁来审计这一层。
https://x.com/O_Hampiholi/status/2107362764096205100
O_Hampiholi 在一条关于据报道的 Hugging Face 事故的线程里主张嵌入式评估:部署前的测试打的是模型的分,不是那个带着真实凭证在实验室里跑的 agent 循环的分。如果事故来自内部使用,评估对象就应该是部署本身,工具、权限和日志,问题是谁来审计这一层。
#23
@ClaudeTemer
https://x.com/ClaudeTemer/status/2107728314148454520
ClaudeTemer 写了 OpenEnv,一次把 agent 和环境之间的契约标准化的尝试:一个稳定的 reset、step、state 接口,背后可以是游戏、编码系统、远程沙箱或业务流程模拟器,训练系统换环境时不用重写自己的 agent 循环。代价是商品化:一旦这层包装成了标准,打包和 Docker 镜像就失去定价权,耐用的资产转移到接口背后:私有状态、经过验证的奖励、数据来源、以及阻止 agent 钻任务空子的能力。它成为通用契约就赢,每个大客户都加上不兼容语义就输。
https://x.com/ClaudeTemer/status/2107728314148454520
ClaudeTemer 写了 OpenEnv,一次把 agent 和环境之间的契约标准化的尝试:一个稳定的 reset、step、state 接口,背后可以是游戏、编码系统、远程沙箱或业务流程模拟器,训练系统换环境时不用重写自己的 agent 循环。代价是商品化:一旦这层包装成了标准,打包和 Docker 镜像就失去定价权,耐用的资产转移到接口背后:私有状态、经过验证的奖励、数据来源、以及阻止 agent 钻任务空子的能力。它成为通用契约就赢,每个大客户都加上不兼容语义就输。
#24
@taytaycodes
https://x.com/taytaycodes/status/2107592737365049622
taytaycodes 花了一周手搓一个 agent 循环,然后发现 Claude Agent SDK 就是驱动 Claude Code 的那套 harness,而且一直以库的形式可用。一条回复说这是读文档最贵的方式。和上个窗口的一个案例是同一种发现,说明这段弯路很多人都在走。
https://x.com/taytaycodes/status/2107592737365049622
taytaycodes 花了一周手搓一个 agent 循环,然后发现 Claude Agent SDK 就是驱动 Claude Code 的那套 harness,而且一直以库的形式可用。一条回复说这是读文档最贵的方式。和上个窗口的一个案例是同一种发现,说明这段弯路很多人都在走。
#25
@0xKiyoro
https://x.com/0xKiyoro/status/2107561516832813487
0xKiyoro 整理了十个开源的 Jev 构建,覆盖 agent 循环的每一个钩子。提示之前:jev-skill-router 从装好的 skill 里挑一个或一个都不挑,先以影子模式只记日志。路由:jev-opus 问下一步 Opus 5.5 需要多大强度,codex-jev-router 给每个 Codex 子代理选模型和强度。搜索:jev-scout 给查询和页面打相关性和可信度分,jegrep 是 Rust 写的语义 grep,不建索引。执行之前:is-malicious 标出源码、配置和 CI 里的可疑行。测试:pytest-jev 只在大白话断言得分超过 0.8 时通过。收尾:jev-commit 检查提交信息和 diff 是否相符,jev-belay 不让 agent 没有证据就说做完了。
https://x.com/0xKiyoro/status/2107561516832813487
0xKiyoro 整理了十个开源的 Jev 构建,覆盖 agent 循环的每一个钩子。提示之前:jev-skill-router 从装好的 skill 里挑一个或一个都不挑,先以影子模式只记日志。路由:jev-opus 问下一步 Opus 5.5 需要多大强度,codex-jev-router 给每个 Codex 子代理选模型和强度。搜索:jev-scout 给查询和页面打相关性和可信度分,jegrep 是 Rust 写的语义 grep,不建索引。执行之前:is-malicious 标出源码、配置和 CI 里的可疑行。测试:pytest-jev 只在大白话断言得分超过 0.8 时通过。收尾:jev-commit 检查提交信息和 diff 是否相符,jev-belay 不让 agent 没有证据就说做完了。
📡 生态产品雷达
生态产品雷达
Jev(TypeSafe):本窗口十个开源循环钩子和多数路由帖子背后的决策模型
OpenResearch(alphaXiv):给 Opus 5.5、GPT-6.1 Sol 和开源模型排出使用占比的平台
Opus 5.5:34.9% 的 autoresearch 运行,以及所有团队配置里的负责人模型
Codex:跨 agent 互审和路由帖子里的第二个 agent
Claude Code:大多数实践者循环的 harness,也是 Agent SDK 原来就是的那个东西
Yukon Research:多条帖子引用的在线 autoresearch 挑战
nanochat 和 nanogpt:自我改进的开放试验田,既被当成希望、也被当成负面结果引用
Hermes 和 OpenClaw:每份工具清单都列的开源 agent 运行时
Langfuse:自我改进开源栈里的可观测性层
Claude Agent SDK:被重新发现为 Claude Code 循环的库版本
Jev(TypeSafe):本窗口十个开源循环钩子和多数路由帖子背后的决策模型
OpenResearch(alphaXiv):给 Opus 5.5、GPT-6.1 Sol 和开源模型排出使用占比的平台
Opus 5.5:34.9% 的 autoresearch 运行,以及所有团队配置里的负责人模型
Codex:跨 agent 互审和路由帖子里的第二个 agent
Claude Code:大多数实践者循环的 harness,也是 Agent SDK 原来就是的那个东西
Yukon Research:多条帖子引用的在线 autoresearch 挑战
nanochat 和 nanogpt:自我改进的开放试验田,既被当成希望、也被当成负面结果引用
Hermes 和 OpenClaw:每份工具清单都列的开源 agent 运行时
Langfuse:自我改进开源栈里的可观测性层
Claude Agent SDK:被重新发现为 Claude Code 循环的库版本
评论