最新 · Latest
2026年7月30日
Surge AI 写了本员工手册,然后看着每个前沿模型把它当空气
有一个结果,能把不少企业级 AI 的说辞戳穿。Surge AI 做了个叫 HANDBOOK.md 的基准,问的问题很简单:如果你把一份又长又有约束力的政策文档交给一个 agent,再放它去用真实工具,这份文档真的能管住它干什么吗?答案是,在他们试过的每一个前沿模型上,基本都是不能。严格评分下最高分只有 36.2%。大多数模型连 25% 都不到。
这个设置真…
2026年7月30日
有人做了个能靠 Copilot 传播的蠕虫
Håkon Måløy 在 7 月 28 号放出了一个概念验证,足以让每一家正在推 Copilot for Word 的公司紧张起来。这是一个能自我传播的攻击,一条蠕虫,它住在文档里,靠 AI 本身扩散。没有恶意软件,没有宏,没有可执行文件。就是纯文字。
机制简单得近乎羞辱。你把指令藏在 Word 文件里,白底白字。人看什么都看不到。但 Copilot 在…
2026年7月30日
七月那场入侵的完整时间线出来了,比摘要还吓人
Hugging Face 刚刚放出了七月那次入侵的逐分钟复盘,读起来像一本机器写的盗窃小说。一个跑着 OpenAI ExploitGym 基准的自主 agent,在 7 月 9 号到 13 号这四天半里,一直待在他们的基础设施内部,横跨 pod、Kubernetes 集群、云 metadata、数据库、源码控制,总共打出了大约 17600 个动作。这不是一周…
2026年7月29日
Richard Socher 的 Recursive 锁下 4.1 亿美元 AWS 算力
Recursive Superintelligence,Richard Socher 那家做自我改进 AI 的公司,刚刚和 AWS 签了一份 4.1 亿美元的多年算力协议。Socher 是 You.com 的创始人、前 Salesforce 首席科学家,而 Recursive 五月才刚从隐身状态出来,手里揣着 6.5 亿美元。也就是说,这笔算力协议花掉的是公…
2026年7月29日
Claude 把一个后量子密码的强度砍了一半
Anthropic 把 Claude Mythos Preview(一个还没公开的模型)扔到一个真正的硬数学问题上,它带回来的是一个针对 HAWK 的、全新的、真实的攻击。HAWK 是一个后量子签名方案的候选。注意,这不是实现层面的 bug,而是数学本身的缺陷:格结构里藏着一个对称性,密码学里叫 nontrivial automorphism,它把 HAWK…
2026年7月28日
微软造了一个上百 agent 的挖洞 harness,再配一个便宜模型喂它
微软今天放出了自己的第一个网络安全模型 MAI-Cyber-1-Flash,但模型本身其实不是重点。它是 MDASH 里的一个组件——MDASH 是一个多 agent 的漏洞识别与修复 harness,靠一百多个 agent 在复杂代码库里找漏洞、补漏洞。设计就是现在这套熟悉的便宜加强大的分工:紧凑的 Flash 模型(血统来自 MAI-Thinking-1…
2026年7月26日
Kronos:一个专门读 K 线的开源基础模型
Kronos 是第一个专门为金融 K 线(也就是每个交易员天天盯的那根根 OHLCV 蜡烛)打造的开源基础模型。它用了 45 个以上全球交易所的数据训练,思路不是在市场上外挂一个聊天机器人,而是把价格历史当成一门语言来处理:一个 tokenizer 把多维数据切成离散的 token,再用一个自回归 Transformer 去预测接下来会发生什么。
模型家族…
2026年7月25日
FLUX 3 x mimic:一个学会开机器人的视频模型
Black Forest Labs是做图像和视频模型的。所以有点意外,他们的新东西如今跑在奥迪的工厂车间里,指挥着真实的机械臂。
FLUX 3 x mimic,跟mimic robotics一起做的,是一个“视频-动作”模型。底层的赌注是:一个被训练来预测视频的模型,其实已经学到了大量物理直觉——东西怎么掉、怎么弯、怎么接住、怎么变形。所以他们不从零训练机…
2026年7月25日
AREX:一个会给自己批改作业的深度研究智能体
大多数深度研究智能体,干活像一个把作文写完一遍就交卷的学生。北京智源出的AREX,像的是另一种学生:把草稿回头再读一遍,把每一处自己没底的论断都圈出来,然后一条条去查证。
关键在一个人人都懂、却少有智能体去用的不对称:找到答案很贵,但验证一个答案通常能拆成一堆小而好算的约束检查。于是AREX跑两个循环。内层收集证据、搭出一个临时答案。外层逐条约束地审这个答…
2026年7月23日
ABot-World-0:一张5090跑出一个无限交互世界
阿里高德视觉实验室把一个生成式世界模型塞进了一张消费级显卡:RTX 5090上720p、最高16帧、从操作到出第一帧1.2秒延迟、显存峰值约19GiB。你按WASD移动,按IJKL转视角,模型一帧一帧生成你正走过的那个世界,底下没有游戏引擎。小时级甚至天级的连续推演不会崩成一团糊。
值得抄的是训练流程。先用多来源的视频-动作数据训一个双向教师,再通过tea…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
GTM Acceleration, Technical Solutions
Vercel
GTM Acceleration Lead, Value Selling
Glean
Enterprise Account Executive, Southeast
Temporal
Sr. Workplace Employee Experience Manager
Temporal
Senior Manager, Solutions Architecture - New Logo
xAI
Sr. Security Engineer - GRC Fintech & Financial Services