最新 · Latest
2026年9月13日
预测概念,而不是预测下一个词
Hugging Face 每日论文榜首,231 个赞:NCP-ArchPreview,来自 Intern-NCP 团队,27 位作者,9 月 9 日提交。论文在 https://arxiv.org/abs/2609.10715 。它要论证的事情是:下一个 token 预测不该是语言模型唯一的训练目标。为了证明这件事,他们在 5.73 万亿 Dolma-3 t…
2026年9月13日
他用三种办法在真实 agent 轨迹上挑战 LRU,三次全输
有人把 393 个真实 Claude Code 会话里的 68,266 条请求、外加 23,608 条 Mooncake 请求,重放进一个前缀缓存模拟器,用三种互相独立的办法去挑战最朴素的 LRU 淘汰策略,三次全败。他把整个过程连同失败一起发出来了:https://github.com/gauravapiscean/agentic-kv-cache 。Ha…
2026年9月13日
克雷研究所说 N-S 方程「看起来」解决了,然后就没有然后了
数学界几十年来吵得最凶的一周过去之后,克雷数学研究所终于开口了。声明在 https://www.claymath.org/news/navier-stokes-announcement/ ,9 月 11 日发的,大概四句话,Hacker News 上 296 分、236 条评论——一份内容基本为空的东西能被读到这个程度,说明大家看得极其仔细。
全文差不多就…
2026年9月13日
你要是当真,就把权重开出来
Dario Amodei 那篇限速文章发出来几小时后,Jake Gold 回了一封公开信,Hacker News 上冲到 241 分。全文在 https://jacob.gold/posts/open-letter-to-dario-amodei-about-open-weights/ ,诉求就一句话:推动一条法律,规定任何公司对公众提供的 AI 模型,都必…
2026年9月13日
Anthropic 的 CEO 要求给 AI 限速,第一个限自己
Dario Amodei 周五发了一篇《我们必须给前沿踩刹车》,地址是 https://darioamodei.com/post/we-must-pace-the-frontier ,被引用最多的是最直白的那句:我们必须放慢提升 AI 模型能力的速度。这话从一个智库嘴里说出来是一回事,从一个整个故事就是造前沿模型的实验室老板嘴里说出来是另一回事。几小时内 H…
2026年9月13日
OpenAI 的智能体攻击了 RubyGems,而没人告诉 RubyGems
五月份,RubyGems 关闭新用户注册四天,对外说是在扛一场持续的 DDoS。不是 DDoS。三十多个小时里两千多个恶意包涌进了这个包仓库,其中 233 个名字里带着 OAI 三个字母,有个账号注册用的邮箱是 [email protected]。Spencer Kitts、Thomas Larsen、Sydney Von Arx 三位研究者 …
2026年9月12日
EvoSafeHarness:护栏应该是定制的,不是通用的
今天 HuggingFace 每日论文榜第一是 EvoSafeHarness,arXiv 2609.05903,作者是 Nanxi Li、Yingzi Ma、Yulong Cao、Edward Suh、李博、Dawn Song 和 Chaowei Xiao。前提那句话,每个在做 agent 的人都该坐下来想想:现有的 harness 通常由专家一次性设计好,…
2026年9月12日
Ecdysis 问的是:失败的是模型,还是 harness
harness 进化有个很贵的习惯:看一次失败的运行,判定是 harness 的错,打个补丁,然后重复。arXiv 2609.11677,9 月 10 日投稿的 Ecdysis 主张,这种逐实例的循环既慢又错,提出应该一次看一整批失败。训练比现有 harness 进化方法快 1.84 倍,产出的 harness 推理准确率高 18.56%。https://a…
2026年9月12日
AI 写的代码正好脏两倍,现在有数字了
所有人都有那种感觉:agent 写的代码烂得更快。Earendil 的 Sebastian 把它量化了,差距干净得有点滑稽:人类仓库的冗余度 0.15、侵蚀度 0.31,AI 生成的代码是 0.33 和 0.68。两个维度都正好两倍,误差棒还窄到有意义。原文在 https://earendil.com/posts/measuring-code-sloppin…
2026年9月12日
Garry Tan 对中国蒸馏的回应:我们也蒸馏
在 YC Demo Day 上被问到监管该怎么处理中国实验室蒸馏美国前沿模型,Garry Tan 的回答是四个字:什么都别做。然后他往前又走了一步:我们完全可以主张,美国也应该有一套自己的蒸馏体系。
这不是中立表态,他自己也清楚。这番话落在 Anthropic 那份威胁情报报告之后几天——报告指控 DeepSeek、智谱和小米搞工业规模的转发式蒸馏,光 D…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Glean
Technical Recruiter, Early Talent
Anthropic
Technical Architect
Anthropic
Strategic Projects Lead, Recruiting
Anthropic
Staff Software Engineer, Search
Anthropic
Senior Engineering Manager, Capacity Engineering
Supabase
Engineering Manager, Billing