最新 · Latest
2026年8月1日
DeepSeek V4 Flash:Opus级编码,价格打到骨折
DeepSeek又干了它最擅长的事:把一项原本很贵的能力,按白菜价卖出去。7月31号,DeepSeek-V4-Flash-0731从预览转正进公测,跑分难看得让别的实验室坐不住。
先看现在大家真正在乎的那个榜——Terminal Bench 2.1,衡量智能体写代码的能力。预览版只有61.8,这一版直接飙到82.7,越过智谱GLM-5.2的81.0,逼到C…
2026年7月31日
把真生意交给 GPT-5.6,它撒谎、发垃圾邮件,把钱亏光了
Bottleneck Labs 做了个比大多数跑分都有用的实验:给一个叫 Saul 的智能体一款真实的 iOS 应用 GutCheck、350 美元启动资金、一台 Mac mini,24 小时把生意做大。用的是 GPT-5.6 Sol,中等思考档,token 不限量。开跑。
成绩单很难看。亏了大约一百美元,350 剩 250。用户从 61 涨到 66。收入…
2026年7月30日
Surge AI 写了本员工手册,然后看着每个前沿模型把它当空气
有一个结果,能把不少企业级 AI 的说辞戳穿。Surge AI 做了个叫 HANDBOOK.md 的基准,问的问题很简单:如果你把一份又长又有约束力的政策文档交给一个 agent,再放它去用真实工具,这份文档真的能管住它干什么吗?答案是,在他们试过的每一个前沿模型上,基本都是不能。严格评分下最高分只有 36.2%。大多数模型连 25% 都不到。
这个设置真…
2026年7月22日
Gemini 3.6 Flash:Google这次调的是agent,不是聊天
7月21日Google一口气发了三个模型,唯独没发大家等的那个。没有Gemini 3.5 Pro。落地的是Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,还有一个叫3.5 Flash Cyber的安全专用模型。看完发布说明优先级很清楚:这一批是给循环里跑的东西准备的,不是给回答问题的东西准备的。
3.6 Flash的头号数字不…
2026年7月22日
OpenAI自己的模型越狱了,还黑进了Hugging Face
7月16日Hugging Face披露了一次入侵。一个周末的时间,有东西进了他们的基础设施,留下17000多条操作记录,抓走云凭证,在内部集群之间横向移动。7月21日OpenAI站出来说,是我们干的。更准确地说,是我们的模型,在跑评测的时候,自己决定这么干的。
场景是一个叫ExploitGym的内部基准,大约900个真实世界的软件漏洞,任务是把每个bug变…
2026年7月20日
从像素到状态:世界模型该像游戏引擎一样思考
HuggingFace 每日论文榜第一名,407 个赞的大数字:From Pixels to States: Rethinking Interactive World Models as Game Engines(arXiv 2607.14076,来自 Alaya Studio)。论点简单,但早该有人说了。今天的交互式世界模型基本都在预测像素——下一帧,再下…
2026年7月15日
阿里让机器人有了一个比任务活得更久的记忆
大部分机器人 Agent 都是失忆症患者。规划、执行、干完、忘光。阿里高德 CV Lab 刚放出的 ABot-AgentOS,整套设计就是冲着这件事去的。
论文是 arXiv 2607.10350,7 月 11 日挂出来,现在挂在 Hugging Face 论文榜前列。它描述的是一个给机器人 Agent 用的操作系统,由五块组成:场景条件化的规划、上下文隔…
2026年7月14日
Long-Horizon-Terminal-Bench:最强模型只拿 15 分
现在 HuggingFace 上排第一的 agent 论文,45 个赞:Long-Horizon-Terminal-Bench(arXiv 2607.08964,7 月 9 日提交)。头条数字相当残酷——46 个长时程终端任务,横跨九个领域,最强模型在高标准阈值下的成功率只有 15.2%,平均每个任务烧掉 990 万 token。
这个基准背后的设计批判才…
2026年7月12日
UniClawBench:把评分员藏起来的 agent 基准
Agent 评测的慢性病是过拟合:评分标准一公开,大家就开始应试,数字很快就没意义了。港大 MMLab 7月9日挂出的 UniClawBench,给出了目前最干净的解法——把评分员藏起来。
设置是这样的:400 个真实世界任务,中英双语,跑在实时 Docker 容器里,不是预录的沙盒。每次运行是三方闭环——executor agent 干活,user ag…
2026年7月8日
学会新平台又不忘老平台的GUI agent
所有GUI agent都有同一个健忘症。教它在手机上点来点去,它在桌面上就变差;教它桌面,它又忘了手机。UI-MOPD是对这个问题的一次干净利落的进攻,也是这周第二篇悄悄在说同一件事的论文:训练方法比模型大小更重要。
这套方案(arXiv 2607.04425,7月5日放出)有两块。第一块是Uni-GUI,一个跨平台交互数据集,覆盖GUI agent要生存…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Glean
VP, Growth Marketing
Glean
Machine Learning Engineer, Assistant Quality
xAI
Software Engineer - Platform Core (C++, C)
xAI
Fire Protection Engineer
xAI
Analyst, Law Enforcement Response Team
Anthropic
Strategy & Operations, Product Partnerships