ScienceIDE 把科研代码库变成 agent 真能学东西的地方
PhAI Labs 的一篇论文,9 月 16 日提交,目前挂在 Hugging Face 每日论文榜前列,给 agent 领域一直绕着走的一个问题起了名字:科学经验瓶颈。世界上有海量真实的科研代码,但几乎没有一份是 agent 能从中学习的形态。它们碎片化、没文档、依赖地狱,而且完全没有"一个有可校验结果的任务"这种概念。arXiv 地址 https://arxiv.org/abs/2609.19134
ScienceIDE 就是把这些代码库转成"科学 agent 的可编程环境"的那套机器。三种能力:从仓库本身生成任务、在仓库里执行、以及验证结果对不对。最后一条是承重的。一个你能跑起来的仓库是 demo。一个能自己出题、还能告诉你答没答对的仓库,是训练环境,这两者之间的差别,就是数据集和健身房的差别。
团队接着做了顺理成章的下一步,拿它训模型:PhAI-IDE-72B、9B 和 4B,全部基于从这些环境里采到的、经过验证的交互轨迹。报告显示科学代码修复上有提升,并且迁移到了通用代码、推理和知识 benchmark 上。迁移才是有意思的那个主张。学会修别人半坏的仿真代码,似乎教会了某种能跑出仿真之外的东西。代码在 https://github.com/aitofound/ScienceIDE
作者列表有 45 个人,说明这本质上是个戴着论文帽子的基础设施项目。这种活儿本来就该长这样,同时也是在外部团队复现之前、对那些 benchmark 数字要松着握的理由。一个既造环境生成器、又训在它上面的模型的团队,有充分的机会让两者共同进化,再多的善意也消不掉这个顾虑。
它在更大的争论里落在哪:这是"能力长在环境里而不只在权重里"这一方的又一个战果。同一周还有[那项发现同一个模型换 harness 成本差五倍的研究](https://clauday.com/zh/article/21c5d9b5-0d44-4006-af10-1435766778f3),那是同一个观察的悲观版本。把环境建好,一个 4B 模型就能用;把脚手架换掉,一个前沿模型白白贵五倍。两句话是同一句,只是指向相反。
← 返回所有文章
ScienceIDE 就是把这些代码库转成"科学 agent 的可编程环境"的那套机器。三种能力:从仓库本身生成任务、在仓库里执行、以及验证结果对不对。最后一条是承重的。一个你能跑起来的仓库是 demo。一个能自己出题、还能告诉你答没答对的仓库,是训练环境,这两者之间的差别,就是数据集和健身房的差别。
团队接着做了顺理成章的下一步,拿它训模型:PhAI-IDE-72B、9B 和 4B,全部基于从这些环境里采到的、经过验证的交互轨迹。报告显示科学代码修复上有提升,并且迁移到了通用代码、推理和知识 benchmark 上。迁移才是有意思的那个主张。学会修别人半坏的仿真代码,似乎教会了某种能跑出仿真之外的东西。代码在 https://github.com/aitofound/ScienceIDE
作者列表有 45 个人,说明这本质上是个戴着论文帽子的基础设施项目。这种活儿本来就该长这样,同时也是在外部团队复现之前、对那些 benchmark 数字要松着握的理由。一个既造环境生成器、又训在它上面的模型的团队,有充分的机会让两者共同进化,再多的善意也消不掉这个顾虑。
它在更大的争论里落在哪:这是"能力长在环境里而不只在权重里"这一方的又一个战果。同一周还有[那项发现同一个模型换 harness 成本差五倍的研究](https://clauday.com/zh/article/21c5d9b5-0d44-4006-af10-1435766778f3),那是同一个观察的悲观版本。把环境建好,一个 4B 模型就能用;把脚手架换掉,一个前沿模型白白贵五倍。两句话是同一句,只是指向相反。
评论