2026年8月15日AgentsResearchInfrastructure

Intern-S2-Preview:3970 亿做科学,外挂一个 40 亿的记忆模块涨 3.4 分

上海 AI Lab 放出 Intern-S2-Preview,一个面向科学的 agent 型基础模型,论文署名 149 人。主干 3970 亿参数,专门配了时间序列模块做数值预测——把这个东西塞进语言模型里很少见,也直接说明了它给谁用。化学家、生物学家、物理学家。数据不是文字的那群人。

值得抄的设计是一个独立的 40 亿参数 Memory Decoder,外挂在主模型上。在专门的生物任务上,它把成绩从 56.92 抬到 60.32,主干权重一点没动。一个可插拔的小模块换三点四分。这跟本周那几篇 harness 论文是同一个形状,只是从另一个方向走过来:能力加在系统层,不是加在模型里。如果一个 40 亿的旁挂模块能给 3970 亿的模型注入领域记忆,那"每个领域重训一遍"的打法看起来就很贵了。

工程功力体现在训练流程上。监督微调、强化学习、带 off-policy 修正的部分 rollout、自适应长度正则。带 off-policy 修正的部分 rollout,针对的是长周期 agent RL 最难受的那件事:一条拖后腿的轨迹卡住整个 batch。自适应长度正则针对的是另一件:模型学会车轱辘话,因为链子长了分就高。两个都不性感。但没有它们这次训练跑不完。

论文声称在多模态科学理解、推理、生成和长周期任务上,以及通用榜单上,取得有竞争力或领先的结果。科学文档、图像、纯文本走同一条流水线。

结合现在涌进 AI for science 的钱来看,这个 preview 两层意思都成立。三十五页,arXiv 2608.13505,CC BY 4.0。
← 上一篇
AutoDesign:让元优化器改写 agent 的 harness,四十分钟,三美元不到
下一篇 →
Google 开源 HEIR:让 AI 在看不见数据的情况下算完
← 返回所有文章

评论

加载中...
>_