CodeMidas 把 3185 个随机仓库变成了写代码 agent 的训练场
用强化学习训练一个写代码的 agent 需要两样很难同时拿到的东西:足够多样的任务,和你敢信的验证器。CodeMidas,arXiv 2609.22068,9 月 18 日提交,今天在 HuggingFace 榜上 86 票,解法是挖开源代码,自动把它变成可执行的 RL 环境。
流水线让 agent 去干无聊的那部分。一个从一段代码里提炼出行为规范,另一个照着规范写测试,再一个验证产出的任务真的可解、真的在检查东西。产出:5545 个训练任务,来自 3185 个代码库,覆盖 23 种语言、15 个领域。每个任务自带验证器,因为验证器和任务是从同一份源码里长出来的。
增益能迁移,这才是值得记的部分。DeepSWE 的 issue 修复提升 11.7%。ProgramBench 的整程序构建提升 17%。Terminal-Bench v2.1 的终端作业提升 8.5%。三种任务形态、三个基准,没有一个是训练分布。整程序构建涨得最多是说得通的,因为照着规范从头造东西,最接近这些环境真正在教的事。
真正重要的框架是供给。agent RL 有用这件事没人争。瓶颈一直是环境,而环境贵是因为得有人写任务、再写一个判定你过没过的东西。公司们手工造这些,然后当护城河守着。CodeMidas 的主张是:GitHub 里已经有这些环境了,你缺的只是一条读代码、吐出规范加测试的流水线。
跟过去一个月的论文趋势放在一起,形状更清楚了:造好环境,小模型就变得有用,而不是造更大的模型然后祈祷。我想从这篇里拿到但摘要页上没找到的,是这些环境本身有没有开放。5545 个任务才是资产。方法是一篇论文;训练场是一件公共品,这是非常不同的两种贡献。https://arxiv.org/abs/2609.22068
← 返回所有文章
流水线让 agent 去干无聊的那部分。一个从一段代码里提炼出行为规范,另一个照着规范写测试,再一个验证产出的任务真的可解、真的在检查东西。产出:5545 个训练任务,来自 3185 个代码库,覆盖 23 种语言、15 个领域。每个任务自带验证器,因为验证器和任务是从同一份源码里长出来的。
增益能迁移,这才是值得记的部分。DeepSWE 的 issue 修复提升 11.7%。ProgramBench 的整程序构建提升 17%。Terminal-Bench v2.1 的终端作业提升 8.5%。三种任务形态、三个基准,没有一个是训练分布。整程序构建涨得最多是说得通的,因为照着规范从头造东西,最接近这些环境真正在教的事。
真正重要的框架是供给。agent RL 有用这件事没人争。瓶颈一直是环境,而环境贵是因为得有人写任务、再写一个判定你过没过的东西。公司们手工造这些,然后当护城河守着。CodeMidas 的主张是:GitHub 里已经有这些环境了,你缺的只是一条读代码、吐出规范加测试的流水线。
跟过去一个月的论文趋势放在一起,形状更清楚了:造好环境,小模型就变得有用,而不是造更大的模型然后祈祷。我想从这篇里拿到但摘要页上没找到的,是这些环境本身有没有开放。5545 个任务才是资产。方法是一篇论文;训练场是一件公共品,这是非常不同的两种贡献。https://arxiv.org/abs/2609.22068
评论