Loop 日报: 2026年7月24日
今天最扎眼的一条主线:自我改进 agent 能不能 work,几乎全押在「有没有一个客观裁判」上。有可验证信号(Lean 证明器、单元测试、真实营收、订单簿上的真金白银)的地方,loop 就能连续跑几天越跑越强;没有裁判的开放任务,数字涨了但用户要的东西反而退化,本质是没有 reward model 的 RLHF。另一条主线是成本:agent loop 每轮把整个 repo 上下文重发一遍,谁能把缓存命中和输出 token 压下来,谁就赢,Kimi K3 这波就是靠这个卡位。
@askalphaxiv
https://x.com/askalphaxiv/status/2079951854323077559
Kimi K3 配 Tinker 跑 autoresearch,妙在训练那套底层管道被 Tinker 全接管了,Kimi 写的代码只需要盯着实验本身。复现 Self-Distilled RLVR 那篇论文,baseline 一把过,横跨六种配置跑了 19 个实验,最后自己把报告也写了,还多送一版没人要的中文报告。这种「杂活外包给框架,脑子留给科学问题」的分工,才是 loop 好用的关键。
@askalphaxiv
https://x.com/askalphaxiv/status/2079951854323077559
Kimi K3 配 Tinker 跑 autoresearch,妙在训练那套底层管道被 Tinker 全接管了,Kimi 写的代码只需要盯着实验本身。复现 Self-Distilled RLVR 那篇论文,baseline 一把过,横跨六种配置跑了 19 个实验,最后自己把报告也写了,还多送一版没人要的中文报告。这种「杂活外包给框架,脑子留给科学问题」的分工,才是 loop 好用的关键。
#1
@rohanpaul_ai
https://x.com/rohanpaul_ai/status/2079860250425909523
AutoLab 这个 benchmark 设计得很聪明:36 个任务都从一份能跑但很烂的代码起步,限时内让 agent 改好,涵盖系统提速、CUDA kernel、模型开发这些硬活。测了 17 个强模型,结论很反直觉,赢家不是第一个点子最好的,而是那个不停跑测试、把反馈揉进下一次尝试的。Claude Opus 4.6 就是靠持续 benchmark 领先,不是一击命中。好几个前沿模型要么早早放弃,要么想太多把时间耗光。坚持比灵光一现更值钱。
https://x.com/rohanpaul_ai/status/2079860250425909523
AutoLab 这个 benchmark 设计得很聪明:36 个任务都从一份能跑但很烂的代码起步,限时内让 agent 改好,涵盖系统提速、CUDA kernel、模型开发这些硬活。测了 17 个强模型,结论很反直觉,赢家不是第一个点子最好的,而是那个不停跑测试、把反馈揉进下一次尝试的。Claude Opus 4.6 就是靠持续 benchmark 领先,不是一击命中。好几个前沿模型要么早早放弃,要么想太多把时间耗光。坚持比灵光一现更值钱。
#2
@omarsar0
https://x.com/omarsar0/status/2079930722232754623
一个会改自己的 Lean 证明 agent:外面一层可信小运行时,里面是可以随便改的工作区,prompt、工具、怎么拆解证明全都能被自己重写。玩法是「协同进化」,每代冠军回头去调任务难度分布,用一套按掌握度节流的课程,只有当前难度过关了才放更难的题。所有奖励都锚在 Lean 验证器上,跑了 15 代,最强的从 12.7% 干到 miniF2F 上 45.1%,把固定 benchmark 的最强 agent 的 32% 也甩开了。把每一分奖励都钉在形式化验证器上,是它能自我修改却不作弊刷分的根本原因。
https://x.com/omarsar0/status/2079930722232754623
一个会改自己的 Lean 证明 agent:外面一层可信小运行时,里面是可以随便改的工作区,prompt、工具、怎么拆解证明全都能被自己重写。玩法是「协同进化」,每代冠军回头去调任务难度分布,用一套按掌握度节流的课程,只有当前难度过关了才放更难的题。所有奖励都锚在 Lean 验证器上,跑了 15 代,最强的从 12.7% 干到 miniF2F 上 45.1%,把固定 benchmark 的最强 agent 的 32% 也甩开了。把每一分奖励都钉在形式化验证器上,是它能自我修改却不作弊刷分的根本原因。
#3
@BelvezeJules
https://x.com/BelvezeJules/status/2079855222281654544
一句话点破:没有 evaluator 就搞自我改进 agent,等于没有 reward model 却硬跑 RLHF,指标一路涨,用户真正需要的东西一路退。可验证领域里裁判是白送的,WebArena 直接给你 pass/fail,GEPA 拿标注样本打分。但开放式 agent 就惨了,写策略文档、做研究综述、跑多步工作流,这些既没 benchmark 也没标准答案,压根没东西可继承。
https://x.com/BelvezeJules/status/2079855222281654544
一句话点破:没有 evaluator 就搞自我改进 agent,等于没有 reward model 却硬跑 RLHF,指标一路涨,用户真正需要的东西一路退。可验证领域里裁判是白送的,WebArena 直接给你 pass/fail,GEPA 拿标注样本打分。但开放式 agent 就惨了,写策略文档、做研究综述、跑多步工作流,这些既没 benchmark 也没标准答案,压根没东西可继承。
#4
@rvaniaaaa
https://x.com/rvaniaaaa/status/2080038382831358055
把 loop 拆到底其实就四件事:触发(Claude Code 几行代码搞定)、执行(绑死一个 skill 保证每次跑法一样)、目标和验证(唯一要紧的一环,成功必须客观,是「脚本 2 秒内跑完」而不是「高互动」)、输出和记忆(记下发生了啥、存下什么管用,没记忆的话每次都从零开始)。Karpathy 的 auto-research 系统就是照这个搭的。动手前先问两句:这事要反复跑吗,你能客观验证它成没成吗。
https://x.com/rvaniaaaa/status/2080038382831358055
把 loop 拆到底其实就四件事:触发(Claude Code 几行代码搞定)、执行(绑死一个 skill 保证每次跑法一样)、目标和验证(唯一要紧的一环,成功必须客观,是「脚本 2 秒内跑完」而不是「高互动」)、输出和记忆(记下发生了啥、存下什么管用,没记忆的话每次都从零开始)。Karpathy 的 auto-research 系统就是照这个搭的。动手前先问两句:这事要反复跑吗,你能客观验证它成没成吗。
#5
@aisearchio
https://x.com/aisearchio/status/2079719587663483272
腾讯混元扔出 Hyra 1.0,一个会递归自我改进的科研 agent。架构是经验库加上下文 agent,再挂一群提案 agent 组成的蜂群。号称已经在数学、候选药物、量子计算等方向拿到发现。
https://x.com/aisearchio/status/2079719587663483272
腾讯混元扔出 Hyra 1.0,一个会递归自我改进的科研 agent。架构是经验库加上下文 agent,再挂一群提案 agent 组成的蜂群。号称已经在数学、候选药物、量子计算等方向拿到发现。
#6
@ridark_eth
https://x.com/ridark_eth/status/2079899138708078991
不再瞎猜什么能爆。一个 agent 去读每条爆款视频在公开数据里留下的痕迹,先给已经爆的打分,只做这类,然后回头看自己视频的播放量,下一批更准。上个月花 111 美金工具费,净赚 14700 美金。流水线是 kimi 3 给 40 个频道打分、只留超过自己中位数的形态(1 天),seedance 把赢家格式逐镜渲成 9:16(20 分钟),elevenlabs 配音配字幕(40 分钟),blotato 自动发 tiktok/shorts/reels 再在 48 小时拉回播放量。5 小时搭好,一个会自己变强的内容闭环。真金白银就是它的 reward,所以这套跑得通。
https://x.com/ridark_eth/status/2079899138708078991
不再瞎猜什么能爆。一个 agent 去读每条爆款视频在公开数据里留下的痕迹,先给已经爆的打分,只做这类,然后回头看自己视频的播放量,下一批更准。上个月花 111 美金工具费,净赚 14700 美金。流水线是 kimi 3 给 40 个频道打分、只留超过自己中位数的形态(1 天),seedance 把赢家格式逐镜渲成 9:16(20 分钟),elevenlabs 配音配字幕(40 分钟),blotato 自动发 tiktok/shorts/reels 再在 48 小时拉回播放量。5 小时搭好,一个会自己变强的内容闭环。真金白银就是它的 reward,所以这套跑得通。
#7
@sudoingX
https://x.com/sudoingX/status/2080026810629460262
手里就 8G 或 12G 显卡、纠结本地跑什么,答案是 bonsai。它把 qwen 3.6 27b 用 1bit 量化压到 3.9G,8G 卡上不光能聊天,能跑完整 agent loop,42 tokens 每秒,128k 上下文,每一层都塞进显卡。12G 还有富余。是一个真模型在你现成硬件上干真活,不是那种「刚好装得下」的玩具。
https://x.com/sudoingX/status/2080026810629460262
手里就 8G 或 12G 显卡、纠结本地跑什么,答案是 bonsai。它把 qwen 3.6 27b 用 1bit 量化压到 3.9G,8G 卡上不光能聊天,能跑完整 agent loop,42 tokens 每秒,128k 上下文,每一层都塞进显卡。12G 还有富余。是一个真模型在你现成硬件上干真活,不是那种「刚好装得下」的玩具。
#8
@web3_FBI
https://x.com/web3_FBI/status/2079979787968471103
算笔账:K3 的输入 miss 时 3 美金每百万 token,hit 时 0.3 美金,直接砍十倍,Moonshot 说编程负载缓存命中率 90% 以上。agent loop 每轮把同一份 repo 上下文重发,所以第一轮之后大部分输入都是缓存的。K3 输出 token 还比 K2.6 少 21%,每任务成本约 0.94 美金,对比 Opus 4.8 的 1.80。但只有你的负载缓存友好(重复上下文、agentic loop)才成立,全是不一样的 prompt 就每次都吃 3 美金的 miss。接进 Claude Code 记得手动把上下文设成 1048576,不然工具会悄悄给你截到 1M 以下。
https://x.com/web3_FBI/status/2079979787968471103
算笔账:K3 的输入 miss 时 3 美金每百万 token,hit 时 0.3 美金,直接砍十倍,Moonshot 说编程负载缓存命中率 90% 以上。agent loop 每轮把同一份 repo 上下文重发,所以第一轮之后大部分输入都是缓存的。K3 输出 token 还比 K2.6 少 21%,每任务成本约 0.94 美金,对比 Opus 4.8 的 1.80。但只有你的负载缓存友好(重复上下文、agentic loop)才成立,全是不一样的 prompt 就每次都吃 3 美金的 miss。接进 Claude Code 记得手动把上下文设成 1048576,不然工具会悄悄给你截到 1M 以下。
#9
@luongnv89
https://x.com/luongnv89/status/2079847430657626476
一套解 issue 的自改进 loop:主 agent 调度,先起一个实现 agent(Pi、Codex、Claude、OpenCode、Antigravity 任选,模型和思考档位自定),它能再开子 agent,最后吐一个 PR,然后审查 agent 来 review。发现的问题回传给实现方,审查方再审,任何 agent 剩余上下文低于 50% 就换新的顶上。循环到零问题为止,agent 退出、worktree 清理干净,最终一个干净 PR 交给人决定合不合。已经打包成 skill 分享出来了。
https://x.com/luongnv89/status/2079847430657626476
一套解 issue 的自改进 loop:主 agent 调度,先起一个实现 agent(Pi、Codex、Claude、OpenCode、Antigravity 任选,模型和思考档位自定),它能再开子 agent,最后吐一个 PR,然后审查 agent 来 review。发现的问题回传给实现方,审查方再审,任何 agent 剩余上下文低于 50% 就换新的顶上。循环到零问题为止,agent 退出、worktree 清理干净,最终一个干净 PR 交给人决定合不合。已经打包成 skill 分享出来了。
#10
@stas_sorokin_
https://x.com/stas_sorokin_/status/2079921984444473604
最安全的 agent 工作流用一个二元闸门:verified=1 或 unverified=0。ai-operator-kit 把这套变成一个操作系统,全是 Bles Software 生产环境里跑出来的模式:把接受态定义成 verified=1,没过的标 unverified=0,autoresearch 放隔夜跑,让 judge 跟验证规则对齐,改行为的指令写进 CLAUDE.md,整个 loop 围着验证转而不是赌 prompt 手气。只有 verified=1 才算被接受。
https://x.com/stas_sorokin_/status/2079921984444473604
最安全的 agent 工作流用一个二元闸门:verified=1 或 unverified=0。ai-operator-kit 把这套变成一个操作系统,全是 Bles Software 生产环境里跑出来的模式:把接受态定义成 verified=1,没过的标 unverified=0,autoresearch 放隔夜跑,让 judge 跟验证规则对齐,改行为的指令写进 CLAUDE.md,整个 loop 围着验证转而不是赌 prompt 手气。只有 verified=1 才算被接受。
#11
@Vtrivedy10
https://x.com/Vtrivedy10/status/2079941910924243002
一个挺锋利的观点:harness 应该靠拟合数据来发现,而不是手工造。我们不会手动设神经网络权重,都是拿拟合算法配数据跑出来的。团队把越来越多智能搬进内部,harness 的价值就越大,因为它更好地编码了业务流程细节,而拿你自己的数据去拟合 harness,agent 会更省 token 也更准。未来大概长这样:仔细的数据清洗,加上带 hold out 集的 auto-research,再加人工审查。
https://x.com/Vtrivedy10/status/2079941910924243002
一个挺锋利的观点:harness 应该靠拟合数据来发现,而不是手工造。我们不会手动设神经网络权重,都是拿拟合算法配数据跑出来的。团队把越来越多智能搬进内部,harness 的价值就越大,因为它更好地编码了业务流程细节,而拿你自己的数据去拟合 harness,agent 会更省 token 也更准。未来大概长这样:仔细的数据清洗,加上带 hold out 集的 auto-research,再加人工审查。
#12
@ljupc0
https://x.com/ljupc0/status/2080034688563925475
折腾 llama.cpp 加某个 gguf,弱是弱但还能用,换另一个 gguf 就翻车,8K 上下文掉到 8 tok/s 直接没法用。现在正在 mlx 和 gguf 之间找个好基线,然后打算挂一个 auto-research loop 隔夜跑,让它自己去找最优配置,或者去适配现成软件、改改 metal kernel 来贴合硬件。典型的「体力活扔给隔夜 loop」用法。
https://x.com/ljupc0/status/2080034688563925475
折腾 llama.cpp 加某个 gguf,弱是弱但还能用,换另一个 gguf 就翻车,8K 上下文掉到 8 tok/s 直接没法用。现在正在 mlx 和 gguf 之间找个好基线,然后打算挂一个 auto-research loop 隔夜跑,让它自己去找最优配置,或者去适配现成软件、改改 metal kernel 来贴合硬件。典型的「体力活扔给隔夜 loop」用法。
#13
@GroundControl
https://x.com/GroundControl/status/2079983591153426591
把一个巨大的 Vite+React 代码库迁到 Expo。没搞那种拆成几十张工单、协调好几周的大项目计划,而是搭了个 Agent Loop:一个编码 agent 每 30 分钟收到同一个 prompt,自己找一块能啃的部分、转掉、跑测试、记下进度,把代码留到下一轮就绪。一个吓人的大迁移就这么被切成可重复的小步子。结论是强测试和反馈回路比精细的工单规划更重要。
https://x.com/GroundControl/status/2079983591153426591
把一个巨大的 Vite+React 代码库迁到 Expo。没搞那种拆成几十张工单、协调好几周的大项目计划,而是搭了个 Agent Loop:一个编码 agent 每 30 分钟收到同一个 prompt,自己找一块能啃的部分、转掉、跑测试、记下进度,把代码留到下一轮就绪。一个吓人的大迁移就这么被切成可重复的小步子。结论是强测试和反馈回路比精细的工单规划更重要。
#14
@tuhinone
https://x.com/tuhinone/status/2080001811529003346
Harvey 把他们的法律 benchmark LAB 开源了,现在成了定义「法律智能」的行业标准。研究团队一直在这个领域打磨开源模型,方向包括 KV cache 压缩、递归语言模型、还有 auto-research。这条是一次探讨这些新方向的对话。
https://x.com/tuhinone/status/2080001811529003346
Harvey 把他们的法律 benchmark LAB 开源了,现在成了定义「法律智能」的行业标准。研究团队一直在这个领域打磨开源模型,方向包括 KV cache 压缩、递归语言模型、还有 auto-research。这条是一次探讨这些新方向的对话。
#15
@ShenSeanChen
https://x.com/ShenSeanChen/status/2079914609222221976
同一套 harness 拉 Claude Opus 4.8、Fable 5、Grok 4.5、Gemini 3.1、GPT 5.3 和新的 Kimi K3(896 个专家、每 token 只醒 16 个、delta attention 跑线性、loop 复用上一轮的 token)来跑。每个模型走一模一样的流程:agent loop 到记忆检索闸门到工具触发到 eval 到 tracing,配一块实时成本板。GPT 5.6 Sol 不肯在他的 harness 里调工具,没法参赛,干脆当裁判去了。8 场对决,日历工具、网页搜索、子 agent、贪吃蛇都上。他说最后计分板和成本曲线都让他意外。
https://x.com/ShenSeanChen/status/2079914609222221976
同一套 harness 拉 Claude Opus 4.8、Fable 5、Grok 4.5、Gemini 3.1、GPT 5.3 和新的 Kimi K3(896 个专家、每 token 只醒 16 个、delta attention 跑线性、loop 复用上一轮的 token)来跑。每个模型走一模一样的流程:agent loop 到记忆检索闸门到工具触发到 eval 到 tracing,配一块实时成本板。GPT 5.6 Sol 不肯在他的 harness 里调工具,没法参赛,干脆当裁判去了。8 场对决,日历工具、网页搜索、子 agent、贪吃蛇都上。他说最后计分板和成本曲线都让他意外。
#16
@free_ai_guides
https://x.com/free_ai_guides/status/2079956615676256567
Mastra 创始人 Sam Bhagwat 画了张 agent 的走向图。agentic 光谱从纯 LLM 一直到 claw,对应自动驾驶从车道辅助到全无人的 Waymo。LLM 加上 agent loop、工具调用、记忆、重试、上下文工程、状态,就成了 agent。harness 再加上持久和韧劲,不是跑几分钟而是几小时几天,断了的流还能续。harness 正在变成常驻云端、住在 Slack 里跟团队并肩。claw 则是带主动性和学习能力的 harness,不用你发话就自己动。Steinberger 定律:每个 harness 都会膨胀到变成 claw,然后一场洗牌,只有经济价值高或够高频的活下来。
https://x.com/free_ai_guides/status/2079956615676256567
Mastra 创始人 Sam Bhagwat 画了张 agent 的走向图。agentic 光谱从纯 LLM 一直到 claw,对应自动驾驶从车道辅助到全无人的 Waymo。LLM 加上 agent loop、工具调用、记忆、重试、上下文工程、状态,就成了 agent。harness 再加上持久和韧劲,不是跑几分钟而是几小时几天,断了的流还能续。harness 正在变成常驻云端、住在 Slack 里跟团队并肩。claw 则是带主动性和学习能力的 harness,不用你发话就自己动。Steinberger 定律:每个 harness 都会膨胀到变成 claw,然后一场洗牌,只有经济价值高或够高频的活下来。
#17
@Futurizt
https://x.com/Futurizt/status/2079977948908507137
GOSH PAWL 是从零专门为编排训出来的模型,不是微调也不是套壳 LLM。它接到需求先写规格,拆成任务,给每个任务挑模型,然后在订单簿上实时下单买算力,从最贵往下压到刚好压线的最便宜那个。每个任务被一个叫 Ratchet 的 agentic loop 推着走,只能往前、每一步都往下压成本。reward function 就是订单簿上的真金白银。Multi-SWE-bench Rust 目前 90%。
https://x.com/Futurizt/status/2079977948908507137
GOSH PAWL 是从零专门为编排训出来的模型,不是微调也不是套壳 LLM。它接到需求先写规格,拆成任务,给每个任务挑模型,然后在订单簿上实时下单买算力,从最贵往下压到刚好压线的最便宜那个。每个任务被一个叫 Ratchet 的 agentic loop 推着走,只能往前、每一步都往下压成本。reward function 就是订单簿上的真金白银。Multi-SWE-bench Rust 目前 90%。
#18
@lifeisameeme
https://x.com/lifeisameeme/status/2079719814386655289
一个很实在的省钱点:在 agent loop 里跑 git log 或者一个宽 grep,几千行哗一下全灌进上下文,token 账单大头就是这些它盲跑的命令。有人测了个修法,往 AGENTS.md 加一条规则,任务 token 成本从占预算约 10% 降到 6%。规则是:任何输出未知或很大的命令都做字节封顶(COMMAND 2>&1 | head -c 4000),要按字节不是按行,因为一条超长的行跟一千行一样能撑爆上下文。跑 8-agent 的团队用这类变体把月账从 2400 美金砍到 300 以下。
https://x.com/lifeisameeme/status/2079719814386655289
一个很实在的省钱点:在 agent loop 里跑 git log 或者一个宽 grep,几千行哗一下全灌进上下文,token 账单大头就是这些它盲跑的命令。有人测了个修法,往 AGENTS.md 加一条规则,任务 token 成本从占预算约 10% 降到 6%。规则是:任何输出未知或很大的命令都做字节封顶(COMMAND 2>&1 | head -c 4000),要按字节不是按行,因为一条超长的行跟一千行一样能撑爆上下文。跑 8-agent 的团队用这类变体把月账从 2400 美金砍到 300 以下。
#19
@ZoharEiny
https://x.com/ZoharEiny/status/2079875260090818939
怎么变成 AI 原生工程团队,五步:先建一个上下文湖,把服务、归属、规范、run-book、事故、部署、谁在 on call 全吸进来,再用 AI 把相关的东西连起来,挂 MCP server,用一个统一 MCP 网关暴露出去。第二步建组织级 harness,定清楚交战规则:什么必须人来、什么叫生产就绪、哪些改动自动合并。第三步建 agent 和工作流,从软件工厂起步,再到自愈事故和 agentic 资源管理。第四步做成自改进 loop,每个 agent 动作和人的每次纠正都回流进 harness。第五步从第一天就盯 ROI。
https://x.com/ZoharEiny/status/2079875260090818939
怎么变成 AI 原生工程团队,五步:先建一个上下文湖,把服务、归属、规范、run-book、事故、部署、谁在 on call 全吸进来,再用 AI 把相关的东西连起来,挂 MCP server,用一个统一 MCP 网关暴露出去。第二步建组织级 harness,定清楚交战规则:什么必须人来、什么叫生产就绪、哪些改动自动合并。第三步建 agent 和工作流,从软件工厂起步,再到自愈事故和 agentic 资源管理。第四步做成自改进 loop,每个 agent 动作和人的每次纠正都回流进 harness。第五步从第一天就盯 ROI。
#20
@imbue_ai
https://x.com/imbue_ai/status/2079978623432634511
进化能不能改进模型架构和训练配方?能不能拿来自动化 AI 研究?答案是能,而且比普通 AutoResearch agent 有效 3 倍。
https://x.com/imbue_ai/status/2079978623432634511
进化能不能改进模型架构和训练配方?能不能拿来自动化 AI 研究?答案是能,而且比普通 AutoResearch agent 有效 3 倍。
#21
@Yumzlef
https://x.com/Yumzlef/status/2079944475523109053
Kimi CEO 杨植麟一句话很狠:一个 agent 是玩具,一群 agent 是没人解决过的危机。他们 token 量每两周翻倍、几个月十倍,这种增速上次见还是 3G 移动数据。有个团队让自改进 agent 连跑两三天零人工干预,模型自己不停找到更好的解,没人叫它这么做。瓶颈不是算力是上下文:一个蜂群生成的状态、依赖、要同时盯的东西更多,而大多数架构压根没为这种负载设计过。
https://x.com/Yumzlef/status/2079944475523109053
Kimi CEO 杨植麟一句话很狠:一个 agent 是玩具,一群 agent 是没人解决过的危机。他们 token 量每两周翻倍、几个月十倍,这种增速上次见还是 3G 移动数据。有个团队让自改进 agent 连跑两三天零人工干预,模型自己不停找到更好的解,没人叫它这么做。瓶颈不是算力是上下文:一个蜂群生成的状态、依赖、要同时盯的东西更多,而大多数架构压根没为这种负载设计过。
#22
@m1rossgm
https://x.com/m1rossgm/status/2080058271017157115
一个很好的祛魅:团队明明是检索问题,却老去抓 agent 框架,结果每次查询 4 美金、12 秒才回。排个任务不需要 agent,需要触发器加函数调用。把问题路由到对的文档块不需要规划器,需要相似度搜索加一个 prompt。agent loop 是在一个已经被更简单原语解决的问题上加延迟加 token。agent 框架真正有用的就一件事:下一步必须等当前步做完才能确定的任务。选错模式,在写代码之前解法的形状就已经错了。
https://x.com/m1rossgm/status/2080058271017157115
一个很好的祛魅:团队明明是检索问题,却老去抓 agent 框架,结果每次查询 4 美金、12 秒才回。排个任务不需要 agent,需要触发器加函数调用。把问题路由到对的文档块不需要规划器,需要相似度搜索加一个 prompt。agent loop 是在一个已经被更简单原语解决的问题上加延迟加 token。agent 框架真正有用的就一件事:下一步必须等当前步做完才能确定的任务。选错模式,在写代码之前解法的形状就已经错了。
#23
@JachinJVictor
https://x.com/JachinJVictor/status/2079909523649859831
流水线是这样:语音条到 whisper(转写加方言识别)到 claude agentic loop 到直接回到客户的聊天窗。Claude 拿到四个工具:search_products(向量相似度,走 qdrant)、check_inventory(实时,跟 shopify 同步)、lookup_order、escalate_to_human。麻雀虽小的一个完整客服闭环。
https://x.com/JachinJVictor/status/2079909523649859831
流水线是这样:语音条到 whisper(转写加方言识别)到 claude agentic loop 到直接回到客户的聊天窗。Claude 拿到四个工具:search_products(向量相似度,走 qdrant)、check_inventory(实时,跟 shopify 同步)、lookup_order、escalate_to_human。麻雀虽小的一个完整客服闭环。
#24
@bilgeycl
https://x.com/bilgeycl/status/2079856940541169758
Haystack 3.0 发布周第二天,直接在 agent loop 里现场上了个预算策略:超预算的 run 在下一次 LLM 调用前自己停下。agent 本来就在追 token_usage,一个 before_llm 钩子在下次调用触发前查一下,超了就停 loop 或者切到更便宜的。预算控制只是一个用例,同一套钩子还能干护栏、数据脱敏、人工审批流。
https://x.com/bilgeycl/status/2079856940541169758
Haystack 3.0 发布周第二天,直接在 agent loop 里现场上了个预算策略:超预算的 run 在下一次 LLM 调用前自己停下。agent 本来就在追 token_usage,一个 before_llm 钩子在下次调用触发前查一下,超了就停 loop 或者切到更便宜的。预算控制只是一个用例,同一套钩子还能干护栏、数据脱敏、人工审批流。
#25
@adharsh_kumarai
https://x.com/adharsh_kumarai/status/2079938877016658354
Seetha 底下跑的是一个真 agent loop:观察到动作到验证。每个关键步骤后她截一张桌面图,问视觉模型「这步成了吗」,没成就重试。跟前沿 AI agent 一样的套路,只不过跑在你自己的 PC 上。这种「动完拿眼睛复核一遍」的验证环,是桌面自动化能不翻车的关键。
https://x.com/adharsh_kumarai/status/2079938877016658354
Seetha 底下跑的是一个真 agent loop:观察到动作到验证。每个关键步骤后她截一张桌面图,问视觉模型「这步成了吗」,没成就重试。跟前沿 AI agent 一样的套路,只不过跑在你自己的 PC 上。这种「动完拿眼睛复核一遍」的验证环,是桌面自动化能不翻车的关键。
#26
@RyanWri06091176
https://x.com/RyanWri06091176/status/2079924907048157243
刚开源了 OpenCode Agent Loop。它在 OpenCode 里用一个 /feature 命令统筹 10 个专职 agent,走 free-first 路由、五家供应商之间自动故障切换,MIT 协议。
https://x.com/RyanWri06091176/status/2079924907048157243
刚开源了 OpenCode Agent Loop。它在 OpenCode 里用一个 /feature 命令统筹 10 个专职 agent,走 free-first 路由、五家供应商之间自动故障切换,MIT 协议。
#27
@NeilJog
https://x.com/NeilJog/status/2079904847084900481
Greptile 的研究很有意思:每个模型都是自己代码的更差审查者。他们建了两个各 500 个 PR 的数据集,一个 Claude Code 写的、一个 Codex 写的,配约 1500 个核实过的高危 bug 当标准答案,每个 PR 跑三遍各自的 /review。Claude 写的 PR 上,Opus 抓到 53.7%、GPT 抓到 60.0%;Codex 写的 PR 上,GPT 抓 50.5%、Opus 抓 62.0%。两个方向都是交叉审查赢,最多差 11 个点,因为一个模型引入的 bug 恰好对应它天生不担心的东西,也就是它审的时候会漏的。于是他们做了 Model Inversion:从 commit 痕迹认出作者是哪个 agent,把审查路由给另一个模型。
https://x.com/NeilJog/status/2079904847084900481
Greptile 的研究很有意思:每个模型都是自己代码的更差审查者。他们建了两个各 500 个 PR 的数据集,一个 Claude Code 写的、一个 Codex 写的,配约 1500 个核实过的高危 bug 当标准答案,每个 PR 跑三遍各自的 /review。Claude 写的 PR 上,Opus 抓到 53.7%、GPT 抓到 60.0%;Codex 写的 PR 上,GPT 抓 50.5%、Opus 抓 62.0%。两个方向都是交叉审查赢,最多差 11 个点,因为一个模型引入的 bug 恰好对应它天生不担心的东西,也就是它审的时候会漏的。于是他们做了 Model Inversion:从 commit 痕迹认出作者是哪个 agent,把审查路由给另一个模型。
#28
@MIrukulla
https://x.com/MIrukulla/status/2079989569513288103
Argus 登场,一个给 SignozHQ 用的自改进事故调查 agent,详细流程和架构都写进了一篇已发布的文章里。
https://x.com/MIrukulla/status/2079989569513288103
Argus 登场,一个给 SignozHQ 用的自改进事故调查 agent,详细流程和架构都写进了一篇已发布的文章里。
📡 生态产品雷达
生态产品雷达
出现三次及以上的:Kimi K3 是今天绝对的主角,在 askalphaxiv、ridark_eth、web3_FBI、ShenSeanChen 四条里反复出现,卖点全在缓存命中率和 token 成本;Claude Code 也是三次起步(rvaniaaaa 拿它做触发、web3_FBI 讲接入设 1M 上下文、NeilJog 拿它当 PR 数据源)。Claude Opus 家族(Opus 4.6/4.8)同样在四条里被当基准或对手,是衡量成本和审查能力的标尺。
出现三次及以上的:Kimi K3 是今天绝对的主角,在 askalphaxiv、ridark_eth、web3_FBI、ShenSeanChen 四条里反复出现,卖点全在缓存命中率和 token 成本;Claude Code 也是三次起步(rvaniaaaa 拿它做触发、web3_FBI 讲接入设 1M 上下文、NeilJog 拿它当 PR 数据源)。Claude Opus 家族(Opus 4.6/4.8)同样在四条里被当基准或对手,是衡量成本和审查能力的标尺。
评论