两篇关于 agent 自学的论文:一篇讲为什么会坏,一篇讲该怎么做
测试时训练让模型在部署时把学到的东西写进权重,而不是写进一个记忆文件。周一挂出的两篇论文从同一个问题的两头下手:一个从自己输出里学习的 agent,会改掉产生下一课的那个东西。
第一篇来自 KAUST,是一个带机制的负面结果。在 128K token 的长流里,持续用自己生成的文本更新的模型,在独立的人类文本上预测得越来越差,125M、760M、3B 都是如此,用 Adam 更新 Qwen3-4B 现有权重也一样。写本身不是问题,因为同样的更新在真实文本上是有益的。祸根是闭环。把生成器冻住,两个较小尺寸上超过 98% 的损伤消失。一个配对的单步更新测试暴露了局部冲突:每次更新让模型更会预测自己的来源,却更不会预测新的真实文本,而且少数几条轨迹贡献了大部分严重失败。他们的修法叫 Settlement:候选权重先在独立真实文本上评估,再决定要不要提交。平均终点差距缩到 0.07 和 -0.02 nats,同时保住了对真实文本的适应。
第二篇来自 UNSW,是面向 agent 的建设性版本。ASCENT 研究作者称为在线 agent 测试时训练的设定:agent 每个任务只跑一次,结束时拿到一个验证信号,这条轨迹就是唯一的训练信号。直接模仿或强化生成出来的 token 会让策略不稳定,这正是第一篇结论的 agent 版。他们改成让模型的一个冻结初始副本拿到已验证的轨迹作为事后特权信息,沿着轨迹预测下一个 token 的分布,再把这些分布蒸馏进持久化的 LoRA 快权重。无效动作的回合先剔掉。不需要外部参考答案,不需要更强的老师。
两篇放在一起只说一件事。agent 可以从自己的经验里进步,但永远不能凭自己一句话。信号必须经过某个不是 agent 生成的东西:一篇里是独立文本,另一篇里是验证器加一个冻结的参照模型。这是验证这条线反复得出的同一条规则,这次发生在权重里面。
链接:arxiv.org/abs/2610.05076,以及 arxiv.org/abs/2610.05303
← 返回所有文章
第一篇来自 KAUST,是一个带机制的负面结果。在 128K token 的长流里,持续用自己生成的文本更新的模型,在独立的人类文本上预测得越来越差,125M、760M、3B 都是如此,用 Adam 更新 Qwen3-4B 现有权重也一样。写本身不是问题,因为同样的更新在真实文本上是有益的。祸根是闭环。把生成器冻住,两个较小尺寸上超过 98% 的损伤消失。一个配对的单步更新测试暴露了局部冲突:每次更新让模型更会预测自己的来源,却更不会预测新的真实文本,而且少数几条轨迹贡献了大部分严重失败。他们的修法叫 Settlement:候选权重先在独立真实文本上评估,再决定要不要提交。平均终点差距缩到 0.07 和 -0.02 nats,同时保住了对真实文本的适应。
第二篇来自 UNSW,是面向 agent 的建设性版本。ASCENT 研究作者称为在线 agent 测试时训练的设定:agent 每个任务只跑一次,结束时拿到一个验证信号,这条轨迹就是唯一的训练信号。直接模仿或强化生成出来的 token 会让策略不稳定,这正是第一篇结论的 agent 版。他们改成让模型的一个冻结初始副本拿到已验证的轨迹作为事后特权信息,沿着轨迹预测下一个 token 的分布,再把这些分布蒸馏进持久化的 LoRA 快权重。无效动作的回合先剔掉。不需要外部参考答案,不需要更强的老师。
两篇放在一起只说一件事。agent 可以从自己的经验里进步,但永远不能凭自己一句话。信号必须经过某个不是 agent 生成的东西:一篇里是独立文本,另一篇里是验证器加一个冻结的参照模型。这是验证这条线反复得出的同一条规则,这次发生在权重里面。
链接:arxiv.org/abs/2610.05076,以及 arxiv.org/abs/2610.05303
评论