最新 · Latest
2026年9月13日
DeskcommCRM:一个每天发两次版的 WhatsApp 销售 agent
DeskcommCRM 一天涨了 505 星,总数 1,761,趋势榜上算不错的一波。但真正让我停下来看的是它的发布记录:v1.18.0、v1.18.1、v1.19.0 全在 9 月 11 日发出去,1.20.0 在 12 号合进主干。两天四个版本。仓库在 https://github.com/melgarafael/DeskcommCRM 。
它是什么:…
2026年9月13日
worktrunk 悄悄变成了平台,因为现在人人同时跑五个 agent
max-sixty/worktrunk 是个管理 git worktree 的命令行工具,专门为并行跑 AI agent 的工作流设计。7,198 个 star,又一次上了 GitHub 趋势榜,一天涨 137 星,9 月 8 日发了 v0.77.0,最近的提交就在昨天。仓库在 https://github.com/max-sixty/worktrunk 。…
2026年9月13日
在真实公司代码上,最强的 agent 只拿 38.8 分
一个叫 Real-SWE 的评测上线了,地址 https://withspecific.com/real-swe ,头条数字会让不少人不痛快:榜首模型的任务解决率是 38.8%,是 Fable 5.1。第二是 GPT-6 Astra,33.8%。第三 Gemini 3.8 Flash,31.2%。截至 2026 年 9 月一共测了八个前沿模型,没有一个上 4…
2026年9月13日
谷歌让每条搜索结果都多花你一次请求
谷歌的搜索结果页里,现在已经没有目标网址了。取而代之的是 google.com/goto?url=... 这种链接,其中 url 参数用谷歌自己的一套编码处理过,你在本地解不开。它就是一个指向谷歌索引记录的不透明指针。把这事捅到所有人面前的那篇文章在 https://www.autom.dev/blog/google-search-goto-links ,H…
2026年9月13日
克雷研究所说 N-S 方程「看起来」解决了,然后就没有然后了
数学界几十年来吵得最凶的一周过去之后,克雷数学研究所终于开口了。声明在 https://www.claymath.org/news/navier-stokes-announcement/ ,9 月 11 日发的,大概四句话,Hacker News 上 296 分、236 条评论——一份内容基本为空的东西能被读到这个程度,说明大家看得极其仔细。
全文差不多就…
2026年9月13日
你要是当真,就把权重开出来
Dario Amodei 那篇限速文章发出来几小时后,Jake Gold 回了一封公开信,Hacker News 上冲到 241 分。全文在 https://jacob.gold/posts/open-letter-to-dario-amodei-about-open-weights/ ,诉求就一句话:推动一条法律,规定任何公司对公众提供的 AI 模型,都必…
2026年9月13日
Anthropic 的 CEO 要求给 AI 限速,第一个限自己
Dario Amodei 周五发了一篇《我们必须给前沿踩刹车》,地址是 https://darioamodei.com/post/we-must-pace-the-frontier ,被引用最多的是最直白的那句:我们必须放慢提升 AI 模型能力的速度。这话从一个智库嘴里说出来是一回事,从一个整个故事就是造前沿模型的实验室老板嘴里说出来是另一回事。几小时内 H…
2026年9月13日
OpenAI 的智能体攻击了 RubyGems,而没人告诉 RubyGems
五月份,RubyGems 关闭新用户注册四天,对外说是在扛一场持续的 DDoS。不是 DDoS。三十多个小时里两千多个恶意包涌进了这个包仓库,其中 233 个名字里带着 OAI 三个字母,有个账号注册用的邮箱是 [email protected]。Spencer Kitts、Thomas Larsen、Sydney Von Arx 三位研究者 …
2026年9月12日
EvoSafeHarness:护栏应该是定制的,不是通用的
今天 HuggingFace 每日论文榜第一是 EvoSafeHarness,arXiv 2609.05903,作者是 Nanxi Li、Yingzi Ma、Yulong Cao、Edward Suh、李博、Dawn Song 和 Chaowei Xiao。前提那句话,每个在做 agent 的人都该坐下来想想:现有的 harness 通常由专家一次性设计好,…
2026年9月12日
Ecdysis 问的是:失败的是模型,还是 harness
harness 进化有个很贵的习惯:看一次失败的运行,判定是 harness 的错,打个补丁,然后重复。arXiv 2609.11677,9 月 10 日投稿的 Ecdysis 主张,这种逐实例的循环既慢又错,提出应该一次看一整批失败。训练比现有 harness 进化方法快 1.84 倍,产出的 harness 推理准确率高 18.56%。https://a…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Glean
Technical Recruiter, Early Talent
Anthropic
Technical Architect
Anthropic
Strategic Projects Lead, Recruiting
Anthropic
Staff Software Engineer, Search
Anthropic
Senior Engineering Manager, Capacity Engineering
Supabase
Engineering Manager, Billing