2026年8月23日AgentsResearchRL

Inherent 用 27B 模型,在复现科研上打赢了 Opus 4.8

伦敦国王十字一间办公室里的十几个人,用一个 270 亿参数的模型,在一件事上赢了前沿实验室。Inherent,DeepMind 系创业公司(首席科学家 Edward Hughes,加上 Louis Kirsch、Kaloyan Aleksiev、Tantum Collins),今天通过 TechCrunch 宣布:他们的 agent Faraday 在"独立复现已发表论文的研究结果"这件事上,超过了 Claude Opus 4.8 和 GPT-5.5。

有意思的是构造方式。Faraday 基于 Qwen 3.6 27B 做强化学习训练——而且它自己不写代码,写代码外包给 GPT-5.5 Codex。这个小模型真正被训练的能力,是团队所说的 research taste:哪些实验值得跑、什么才算严谨的实验设计的直觉。判断力放在自己训的权重里,苦力活租前沿 API 的。

值得关注的理由有两个。第一,复现是 AI for Science 技术栈里的验证层,而验证层是整个栈里最空、也最值钱的位置——一个能可靠检验已发表结果是否成立的系统,是上游一切(文献筛选、自动发现)的基础设施。可复现性危机本质是劳动力短缺,这是第一个可信的机器劳动力对准了它。

第二,这是几天前英伟达 NOOA 在 ARC-AGI-3 上那个论点的又一个数据点:结构对了的小模型,打得过裸奔的大模型。Inherent 五月出关前拿了 5000 万美元种子轮,今年也只打算扩到 25 人左右——赌的就是 taste 加 harness 比人头更能规模化。

技术细节:https://inherentlabs.ai/research/training-to-replicate TechCrunch:https://techcrunch.com/2026/08/22/inherent-founded-by-deepmind-alumni-says-its-ai-teammate-just-outperformed-anthropic-and-openai-at-replicating-research/
← 上一篇
sub2api:把你的 Claude 订阅变成一门 API 生意
下一篇 →
Anthropic 在悄悄测试:你调的 High,给你 Low 的量
← 返回所有文章

评论

加载中...
>_