DART-SD:别让蒸馏把 agent 的路走窄了
蒸馏多轮工具调用 agent 的标准配方是全轨迹监督:拿一条成功记录,让学生模型从头到尾复刻。DART-SD 的作者点破了这个配方悄悄毁掉的东西:真实工具任务大多是菱形不是直线,很多条有效路径在起点后分叉、在终点前汇合,只对着一条标准轨迹训练,等于教会模型"其他所有走得通的路都是错的"。论文:arXiv 2608.18524,Hugging Face 每日论文榜 60 赞。
他们的解法是把执行过程建模成交互状态转移图,找出学生模型探索真正失败的那些状态,只对这些恢复步骤做监督,前面的推理一律不碰梯度。外科手术式纠错,而不是全身打石膏。在多轮工具调用基准上,大幅超过全轨迹自蒸馏。
教训比蒸馏本身更通用:agent 训练一直在从单轮指令微调那里继承习惯,其中最毒的一条就是"只有一个正确答案"。agent 的本事恰恰是一个 API 挂了还有五条绕路。保住路径多样性而不是压平它的训练方法,才能让小模型学到真的 agent 能力,而不是背下一个剧本。
← 返回所有文章
他们的解法是把执行过程建模成交互状态转移图,找出学生模型探索真正失败的那些状态,只对这些恢复步骤做监督,前面的推理一律不碰梯度。外科手术式纠错,而不是全身打石膏。在多轮工具调用基准上,大幅超过全轨迹自蒸馏。
教训比蒸馏本身更通用:agent 训练一直在从单轮指令微调那里继承习惯,其中最毒的一条就是"只有一个正确答案"。agent 的本事恰恰是一个 API 挂了还有五条绕路。保住路径多样性而不是压平它的训练方法,才能让小模型学到真的 agent 能力,而不是背下一个剧本。
评论