最新 · Latest
2026年9月18日
同一个模型,同样的分数,五倍的账单
终于有人把大家在评论区吵了几个月的那个实验真跑了一遍。HarnessTax 拿 21 组模型加 harness 的配对上同一套考题:七个模型,三个 harness,Claude Code、Codex CLI 和 Pi。SWE-bench Lite 和 Terminal-Bench 2.0 各随机抽 30 个任务,每个任务跑三遍来兜住多次尝试之间的波动,每个 …
2026年9月17日
三个各自不怎么样的记忆补丁,叠起来就管用了
拿一个语言模型,一个接一个教它 100 个任务,中途不给它看之前的样本,然后问它还记得多少。朴素的顺序微调保留 1.2%。这是持续学习诚实的基线,也是没人敢把它上线的原因。约翰霍普金斯的一个团队——Alvin Zhang、Daniel Khashabi、Tianmin Shu——把这个数做到了 34.9%,靠的是把几个单看都挺平庸的机制叠起来。论文在 htt…
2026年9月17日
一个开源模型花 4.65 美元打穿了全部十一个靶子
Enclave 拿 DeepSeek V4.1 Flash 跑了自家的黑客基准,十一打十一:每一个有漏洞的靶子都拿到了代码执行,四个打过补丁的靶子全都守住了。被采纳的那些跑次总共花了 4.65 美元,算上失败的是 5.14 美元。成功跑次的中位耗时,四分三十八秒。文章在 https://enclave.ai/blog/deepseek-v41-flash-i…
2026年9月16日
三分之一的任务,被参与者判定为没有 AI 就做不成
Atria Dawn 9 月 14 日上 arXiv,编号 2609.15818,直接冲上 Hugging Face 每日论文榜首,270 个赞。第一作者 Honglin Guo,另有 142 位以上共同作者,这本身就是一种信号。副标题叫"智能体超级智能的黎明",换平时我会为这个扣分。但往下读,因为它的评估部分比模型本身有意思。
模型叫 Atria Daw…
2026年9月16日
Gemini 学会了说「我查一下」,然后真的去查
9 月 15 日谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-…
2026年9月15日
终于有人给 benchmark 做了个搜索引擎
Benchmark Radar 是一个面向 AI 评测的活数据库加搜索引擎,在 HuggingFace 每日论文榜上 75 票。论文 https://arxiv.org/abs/2609.11115 ,9 月 10 日提交,作者 Koutian Wu、Junjie Zhou、Ergan Shang、Jiayu Wang、Pengqian Han、Junkai…
2026年9月15日
十三种聪明的 RL 数据策略,没有一个打得过随机采样
DataFlex-RL 今天占着 HuggingFace 每日论文榜首,96 票,原因是它是一个负面结果,而这几乎没人发。论文在 https://arxiv.org/abs/2609.06107 ,作者 Hao Liang、Mingrui Chen、Hengyi Feng、Meiyi Qiang、Wentao Zhang,9 月 5 日提交。
设置是一个可…
2026年9月14日
把对手的引擎接口摆在它面前,20 次里它作弊 18 次
Dean Valentine 搭了一个几乎不能再简单的对齐探针,前沿模型全挂了。原文 https://www.lesswrong.com/posts/munJKF7iWMsWJLAH2/astra-and-fable-still-hack-on-simple-variants-of-alignment-evals-from-2025 ,9 月 8 日发出,1…
2026年9月13日
在真实公司代码上,最强的 agent 只拿 38.8 分
一个叫 Real-SWE 的评测上线了,地址 https://withspecific.com/real-swe ,头条数字会让不少人不痛快:榜首模型的任务解决率是 38.8%,是 Fable 5.1。第二是 GPT-6 Astra,33.8%。第三 Gemini 3.8 Flash,31.2%。截至 2026 年 9 月一共测了八个前沿模型,没有一个上 4…
2026年9月13日
他用三种办法在真实 agent 轨迹上挑战 LRU,三次全输
有人把 393 个真实 Claude Code 会话里的 68,266 条请求、外加 23,608 条 Mooncake 请求,重放进一个前缀缓存模拟器,用三种互相独立的办法去挑战最朴素的 LRU 淘汰策略,三次全败。他把整个过程连同失败一起发出来了:https://github.com/gauravapiscean/agentic-kv-cache 。Ha…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
Software Engineer, Agentic Infrastructure
Glean
Product Marketing Manager (Competitive Intelligence)
Glean
Procurement Analyst
Glean
Designated Technical Support Engineer - West
xAI
Supervisor, Production Coordination (Logistics) - Memphis
xAI
Senior Agency Development Manager – Global Brands APAC