最新 · Latest
2026年8月4日
RLSVR:不请裁判,让模型玩谍战游戏自己发奖励
Hugging Face日榜第一,143个赞:From RLVR to RLSVR。问题大家都熟:可验证奖励的RL在数学和代码上好使,因为答案能查;写作、总结这类开放任务没有标准答案,只能靠奖励模型或LLM裁判,而裁判会漂移、会被钻空子、还烧推理费。
他们的解法:别去评判输出,把任务本身改造成环境自己会打分的形状。落地实现叫SpyRL,一个信息不对称的自博…
2026年7月31日
SkillRise:让智能体积累技能,而不是每次重学
一篇叫 SkillRise 的新论文(arXiv 2607.26784)盯上了当下智能体一个挺诚实的短板:什么都从头学。解完一个任务,把琢磨出来的东西一扔,明天碰到类似的任务,重新开始。SkillRise 提出一套智能体强化学习的做法,让智能体把技能攒下来、跨任务带走,能力是复利式累积,而不是每次归零。
底下押的注值得直说。一个一次性智能体和一个会越来越强…
2026年7月28日
英伟达 Molt:一个小到能让 agent 自己读完的 RL 框架
英伟达 NeMo 团队今天放出了 Molt,直接冲上 Hugging Face 论文榜第一,647 个赞。它是一个 PyTorch 原生的、面向 agentic 强化学习的训练框架,整套设计哲学就是冲着这类技术栈越做越臃肿去的。它的 RL 内核大约九千行代码,能训练到 7000 亿参数的模型。这个数字才是重点:小到一个研究员能把整个算法装进脑子里,也小到一个…
2026年7月22日
DeepSearch-World:一个9B的搜索agent,没老师,自己教会了自己
现在做一个好用的搜索agent,默认配方是:拿个小模型,从前沿模型里蒸馏轨迹,发布。港科大的DeepSearch-World,arXiv 2607.07820,没走这条路,结果一个9B模型在BrowseComp上31.2%,GAIA上61.5%,HotpotQA上93.4%。
诀窍在环境。DeepSearch-World是一个给web agent用的确定性…
2026年7月19日
LongStraw:人人都能推理100万token,几乎没人能在上面训练
agent技术栈里有个尴尬的不对称:推理系统轻轻松松伺候百万token的上下文,但RL后训练——真正让agent在长任务上变强的那件事——却卡在25.6万token左右。于是一个攒出两百万token观察轨迹的agent,没办法端到端地从自己的轨迹里学习。所有人都在测长程能力,几乎没有人能针对它训练。
LongStraw,今天HuggingFace论文榜第一…
2026年7月18日
SEED:让agent一边玩一边给自己打分
用RL训练长链条agent有个很蠢的毛病:一整个回合到底成没成,只有最后才知道,所以模型几乎拿不到任何信号来判断中间那一百个动作哪个好哪个坏。清华联合几家实验室的SEED,用一个办法补上了这个洞——让agent自己当自己的老师。
说白了就这么个套路。第一步,教模型看着一条跑完的轨迹,用大白话写下自己刚用了什么技能。第二步,在RL训练时,把当前的checkp…
2026年7月11日
Prime Intellect融资1.3亿美元:让企业自己训练Agent
Prime Intellect在7月8日宣布完成1.3亿美元A轮融资,估值10亿美元,Radical Ventures领投,Nvidia Ventures、Intel Capital、Dell Technologies Capital、Iconiq跟投,天使投资人里有Perplexity、Box、Harvey、Cognition、Mercor的创始人。公司2…
2026年7月10日
SAO:让长链条 agent 训练不炸的那个 RL 招
人人都想要能跑几百步的 agent,可几乎没人能在强化学习不崩的前提下把它训出来。智谱/GLM 团队一篇新论文——Single-Rollout Asynchronous Optimization,arXiv 2607.07508——就是直接撞这堵墙的,而且不是玩具:他们用它训练了 GLM-5.2,一个 7500 亿参数的模型。
它解的问题又具体又难缠。异步…
2026年7月9日
Cognition的SWE-1.7:赌能力天花板是假的
Cognition今天发了SWE-1.7,就是跑在Devin里的那个编程模型。它的核心卖点不是打赢所有人,它没打赢。在FrontierCode 1.1上它42.3%,GPT-5.5是43.0%、Opus 4.8是46.5%;Terminal-Bench 2.1上它落后两家;SWE-Bench Multilingual上它险胜GPT-5.5但远低于Opus。贴…
2026年7月7日
这篇论文说,大家在LLM强化学习里一直在优化错的那个policy
阿里淘宝那边的一个团队甩出一篇论文,标题很不客气:优化训练policy是一场幻觉。它的说法是,在LLM的强化学习里,我们一直在优化错的东西。训练的时候,模型的概率来自训练引擎;部署的时候,来自另一个推理引擎,这俩对不上。于是你可以把训练policy一路往上推,而你真正上线的那个东西,推理policy,几乎不动,甚至更差。你优化的是一个数,但不是那个真正该优化…
第 1 页
较早 →
招聘 · Hiring
AI Agent 公司最新职位,开放即收录。
Glean
VP, Growth Marketing
Glean
Machine Learning Engineer, Assistant Quality
xAI
Software Engineer - Platform Core (C++, C)
xAI
Fire Protection Engineer
xAI
Analyst, Law Enforcement Response Team
Anthropic
Strategy & Operations, Product Partnerships