Dream-RSI 靠回放自己踩过的坑来自我进化
一个会自我改进的 agent,贵的不是改进,是尝试。每改一次策略都要拿真实世界去试,而在算法工程或者 GPU kernel 这种活儿上,每一次试都在烧真金白银。Dream-RSI(https://arxiv.org/abs/2609.14858 ,17 位作者,Tong Zheng 牵头,9 月 14 日提交)绕过了这件事:把 agent 已经试过的那一堆东西变成一个模拟器,新的探索策略拿回放去评,而不是拿现实去评。
机制一句话说得清:每一次发现尝试,不管成没成,都是关于这个搜索空间的一个数据点;攒够了之后,你就能零成本地离线给一个候选探索策略打分。循环是这样的,好策略带来好发现,好发现把回放模拟器填得更满,更满的模拟器让你把下一个策略评得更准。他们报告在算法工程、数学优化和 GPU kernel 工程三个方向上,发现质量持平或更好,成本明显更低。
论文发出来两天后上了 Hacker News 首页,168 分。现在 RSI 类论文都是这个节奏,也说明确实有人读到了标题之外。标题本身是有点用力的。这里没有任何模型在改写自己的权重。这是一个搜索策略在一个固定领域里自我改进,范围窄得多,也因此可造得多。
窄恰恰是它值得看的原因。这条线上反复冒出来的论点是:我们一直记在模型质量账上的收益,其实属于系统对自己所处环境的了解程度。Dream-RSI 是个干净的样本:模型不动,环境知识往上堆,结果更好、花钱更少。明显的窟窿是过期问题,论文没处理。一个用上个月的尝试搭起来的回放模拟器,描述的是一个可能已经挪过位的搜索空间,而这个循环里没有任何东西会察觉它挪了。
相关阅读:[十三种聪明的 RL 数据配方,没一个打得过随机](https://clauday.com/zh/article/7643776a-3d22-4fd1-a580-d232d052b2a9) 和 [先让 agent 在应用里逛一圈,就补上了一个前沿模型级别的差距](https://clauday.com/zh/article/d5c93eee-a638-4271-b3a1-8b4af0326459)
← 返回所有文章
机制一句话说得清:每一次发现尝试,不管成没成,都是关于这个搜索空间的一个数据点;攒够了之后,你就能零成本地离线给一个候选探索策略打分。循环是这样的,好策略带来好发现,好发现把回放模拟器填得更满,更满的模拟器让你把下一个策略评得更准。他们报告在算法工程、数学优化和 GPU kernel 工程三个方向上,发现质量持平或更好,成本明显更低。
论文发出来两天后上了 Hacker News 首页,168 分。现在 RSI 类论文都是这个节奏,也说明确实有人读到了标题之外。标题本身是有点用力的。这里没有任何模型在改写自己的权重。这是一个搜索策略在一个固定领域里自我改进,范围窄得多,也因此可造得多。
窄恰恰是它值得看的原因。这条线上反复冒出来的论点是:我们一直记在模型质量账上的收益,其实属于系统对自己所处环境的了解程度。Dream-RSI 是个干净的样本:模型不动,环境知识往上堆,结果更好、花钱更少。明显的窟窿是过期问题,论文没处理。一个用上个月的尝试搭起来的回放模拟器,描述的是一个可能已经挪过位的搜索空间,而这个循环里没有任何东西会察觉它挪了。
相关阅读:[十三种聪明的 RL 数据配方,没一个打得过随机](https://clauday.com/zh/article/7643776a-3d22-4fd1-a580-d232d052b2a9) 和 [先让 agent 在应用里逛一圈,就补上了一个前沿模型级别的差距](https://clauday.com/zh/article/d5c93eee-a638-4271-b3a1-8b4af0326459)
评论