最新 · Latest
2026年9月27日
Loop 日报: 2026-09-27
这周关于循环的讨论,从拼速度转向了讲诚实。最有分量的几条都在讲验证:一个团队把90%的算力花在造裁判上,因为他们测的每个模型都会钻奖励漏洞;一篇Google论文证明,自我进化的harness如果不加正则化,一离开训练分布就崩;还有人开始反弹用autoresearch灌水的论文。另一条主线是循环内部的成本结构:好几组独立结果都显示,agent循环里的大多数决定…
2026年9月26日
Loop 日报: 2026-09-26
今天循环这条线的主题不是新的跑分,而是账单和爆炸半径。一边,当天最有说服力的 autoresearch 成果来自以太坊共识设计:Lean 模型坐在循环里面,决定什么能留下的是证明检查器,而不是某个分数。另一边,三条互不相关的帖子记录了循环没有闸门时会发生什么:一个超时不停重试,最后变成 340 美元、200 条坏数据和 47 封发出去的邮件;Mandiant…
2026年9月25日
Loop 日报: 2026-09-25
今天这个循环不再是演示,它变成了带价签的基础设施。一个衡量递归自我改进的开放基准发布了,跑在一千张 GPU 上、单条 agent 轨迹长达 60 小时,而且点名了两个 agent 到底发现了什么——Codex 找到的优化器在不同方向之间平衡矩阵更新,Claude Code 找到的按每个隐藏单元自身的权重缩放它的更新,分别比基线高 0.60% 和 0.35%。…
2026年9月24日
Loop 日报: 2026-09-24
同一个窗口里发生了两件方向相反的事,这让本周成为 autoresearch 迄今最诚实的一周。供给侧变得机构化了:OpenRSI 发布了一个开放基准,把真实的开源项目变成 autoresearch 环境,agent 轨迹在千卡集群上连跑 60 小时,光是做出预览版就烧掉超过 10 万 H100 小时,而且它公开的是轨迹而不只是分数。NVIDIA、南洋理工和 …
2026年9月23日
Loop 日报: 2026-09-23
本轮最清晰的自动研究结果,把循环对准的是 harness 而不是模型,而且它压根没在追更高的分数:性能持平,token 流量少了大约 45% 到 49%,API 成本降了约三分之一。当能力天花板临近时,这类循环干的就是这件事——不再优化准确率,开始优化账单。今天几乎所有其他内容都贯穿着同一条主线。报告出来的最大单点增益,既不来自更好的模型,也不来自更好的检索…
2026年9月22日
Loop 日报: 2026-09-22
这个窗口里,循环掉过头来对准了它自己,而且真的奏效了。所有人都在读的那篇论文,把递归自动研究跑在了 agent 的 harness 上而不是模型上——152 个候选方向、535 个可执行环境、三千多次运行——最后留下四种机制,把 token 流量砍掉最多 49%、API 成本降低约三分之一,同时保住约 94% 的分数,而且原封不动地迁移到了另一家厂商的模型上…
2026年9月21日
Loop 日报: 2026-09-21
一篇论文连续三天占领了整个 feed,原因值得直说:有人把自动研究循环指向了 agent 的外壳而不是模型,回来带了四个机制,token 流量砍掉近一半而性能不掉。这把其余一切都重新框定了。本轮最锋利的一句就从这里长出来——自我改进的循环会先攻那个「有便宜验证器」的层,这也解释了为什么这项技术如今殖民了 kernel、上下文管理和训练数据,却完全没碰任何定性…
2026年9月20日
Loop 日报: 2026-09-20
今天这批数据里最强的结果根本不是一次优化——一个 autoresearch agent 自己挑了目标、自己去查,发现一份已通过但尚未激活的 Solana 提案会让 433 个本应作废的权限密钥重新变得可签。问题在激活之前就被上报并修掉了。其余的东西聚成两个问题。第一,钱究竟花在哪儿:一篇让自动研究循环去改写 agent harness 而不是改写模型的论文,…
2026年9月19日
Loop 日报: 2026-09-19
这一周,循环不再是演示,它开始产出必须有人去应对的东西。一个 autoresearch agent 自己挑了目标,在一份已通过但尚未激活的 Solana 提案里找到了签名验证漏洞——如果上线,433 个把权限置零的账户会重新变得可签——并赶在激活前推动修复。一笔抗量子比特币交易的算力成本,在搜索向互相竞争的 agent 开放之后,一天之内降到四分之一。Amp…
2026年9月18日
Loop 日报: 2026-09-18
本轮有两个结果都在一根权重都没碰的前提下改进了循环,而它和其他所有东西的对比才是重点。Google 的 Dream-RSI 把模型完全冻住,只递归改进搜索,把记录下来的发现历史当成便宜的模拟器回放,算力调用少了 162 倍。Salesforce 的 DarwinX 不重训任何模型,只进化提示词、工具和工作流这一层,把 agent 任务完成率从 43.5% 拉…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Replit
Engineering Manager, Site Reliability Engineering
Replit
Senior Software Engineer, Compute Platform
Perplexity
Engineering Manager, (Multimodal)
OpenAI
Technical Recruiter
OpenAI
Deal Lead, Special Situations
Vercel
Product Manager, Dashboard