最新 · Latest
2026年9月18日
ScienceIDE 把科研代码库变成 agent 真能学东西的地方
PhAI Labs 的一篇论文,9 月 16 日提交,目前挂在 Hugging Face 每日论文榜前列,给 agent 领域一直绕着走的一个问题起了名字:科学经验瓶颈。世界上有海量真实的科研代码,但几乎没有一份是 agent 能从中学习的形态。它们碎片化、没文档、依赖地狱,而且完全没有"一个有可校验结果的任务"这种概念。arXiv 地址 https://a…
2026年9月18日
小米把强化学习跑训练开直播了,别家没一个敢的
罗福莉,小米 MiMo 团队的负责人、DeepSeek 出身,9 月 16 日打破了将近半年的沉默,方式是做了一件最不像实验室会做的事:把训练跑成了直播。https://mimo.xiaomi.com/rl 这个看板实时推送 MiMo-V2.6 的强化学习后训练过程。实时成本、token 吞吐、benchmark 表现、任务构成、上下文长度、每一步的墙钟时间…
2026年9月17日
一个 4B 模型花 1200 美元打赢了 Postgres 的查询规划器
Postgres 的查询规划器被一群非常聪明的人调了三十年。Rohan Bansal 训了一个 4B 模型去写 hint,在 Join Order Benchmark 上几何平均快了 1.81 倍,113 条查询里 68 条变快,用 best-of-3 的话零回退。总花费大约 1200 美元。文章在 https://rohanbansal.com/qorl …
2026年9月17日
Dream-RSI 靠回放自己踩过的坑来自我进化
一个会自我改进的 agent,贵的不是改进,是尝试。每改一次策略都要拿真实世界去试,而在算法工程或者 GPU kernel 这种活儿上,每一次试都在烧真金白银。Dream-RSI(https://arxiv.org/abs/2609.14858 ,17 位作者,Tong Zheng 牵头,9 月 14 日提交)绕过了这件事:把 agent 已经试过的那一堆东…
2026年9月15日
十三种聪明的 RL 数据策略,没有一个打得过随机采样
DataFlex-RL 今天占着 HuggingFace 每日论文榜首,96 票,原因是它是一个负面结果,而这几乎没人发。论文在 https://arxiv.org/abs/2609.06107 ,作者 Hao Liang、Mingrui Chen、Hengyi Feng、Meiyi Qiang、Wentao Zhang,9 月 5 日提交。
设置是一个可…
2026年9月10日
Miles v0.1:把大厂通常不外传的后训练全家桶开源了
RadixArk 放出了 Miles v0.1,自称生产级后训练,名字无聊得很,但它是今天 Hugging Face 榜上最不无聊的东西。过去半年所有 agent RL 故事底下的那层管道,这次不是写成论文描述,是整套搬出来。
盒子里有什么:rollout 引擎跑在 SGLang 上,训练后端 Megatron-LM 和 PyTorch FSDP 都支持,…
2026年9月10日
NeoHorse-1 把大家嘴上害怕的那个循环,开源了
一边有研究员因为自我改进的 AI 从 Anthropic 辞职,另一边一个叫 TokenRhythm 的团队,把这东西的可用原型以 Apache 2.0 扔到了 Hugging Face 上。NeoHorse-1 是两个 checkpoint,4B 和 9B,从 Qwen3.5 后训练而来,论文副标题一点没绕:通过带路由 harness 的 agentic …
2026年9月6日
同一天两篇论文撞车,结论一致:agent RL 缺的不是模型,是环境
9 月 3 日两篇论文同天登上 arXiv,从相反的方向说了同一件事:agent RL 的瓶颈已经不是模型也不是算力,是拿来训练的环境不够用了。其中 Terminal-Universe(https://arxiv.org/abs/2609.04148)还以 254 个赞登顶了 Hugging Face 日报的 agent 板块。
Terminal-Univ…
2026年9月1日
J-Zero:从零数据长出出题人、答题人和裁判
自我改进循环有一个标准死法:裁判。把 reward model 或者 LLM 裁判焊死,让策略对着它进化,两轮之内策略学会的就不是任务,是裁判本身。KAIST 梁恩镐(Eunho Yang)组的 J-Zero 直接冲这个病根去:谁都不许焊死。Challenger 出越来越难的题,Solver 答题,Judge 学着打分,三个角色从零外部数据开始共同进化。论文…
2026年8月29日
让 agent 造游戏,给世界模型当数据工厂
Hugging Face 日榜第一的论文(118 赞)把 agent 和环境的常规关系倒了过来。不是在游戏里训练 agent,而是让 agent 造游戏——开发过程本身变成世界模型训练数据的工厂。论文叫"Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling Wo…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Vercel
Software Engineer, Agentic Infrastructure
Glean
Product Marketing Manager (Competitive Intelligence)
Glean
Procurement Analyst
Glean
Designated Technical Support Engineer - West
xAI
Supervisor, Production Coordination (Logistics) - Memphis
xAI
Senior Agency Development Manager – Global Brands APAC