2026年10月8日ResearchAgentsSkills

DAEDALUS:agent 自己出练习题,练出一套记忆

大多数 agent 记忆系统默认你手里已经有训练任务和一个验证器。DAEDALUS(arXiv 2610.08048,作者包括 Antoine Edy 和 Gautier Viaud)把这两样都去掉了。它配了一个探索者 agent 在新环境里摸索、编出难但能解的任务,和一个解题者去做。解题者每次失败产生一条候选启发式规则,规则只有在解题者带着它反复成功之后才被接受,解题结果再反馈给探索者调难度。被接受的规则汇成一个记忆库,agent 带着它去做真实任务。

数字扎实。在 AppWorld、tau 平方 bench 和 AutomationBench 上,DAEDALUS 比无记忆基线平均成功率最多高 15.9 个点,pass^5 最多高 2.2 倍,和那些有训练任务的方法打得有来有回,推理成本比大多数都低。探索预算很小时收益就出现了。规则能跨模型家族迁移。消融实验说关键信息来自解题者的执行轨迹,这和 GUI-HARVEST 本周关于框架诊断的发现一样:证据在执行过的轨迹里,不在模型的自述里。

还有一个对跑评测的人要紧的附带结果:DAEDALUS 生成的任务给模型排名,和真实基准任务排出来的差不多。一个为了学会环境而自己写课程的 agent,顺手给那个环境写了一个基准,这大致就是同周 AutoSciBench(2610.05140)专门为科学 agent 去做的事。

要盯的是接受规则。"一条规则只有在上下文里反复奏效后才留下",正是记忆这条线自 Memadapter 证明连正确的记忆也会诱发谄媚之后一直在绕的写入时筛选。DAEDALUS 按结果把关,不按看起来合不合理把关。代码和产物论文里有链接。

链接:arxiv.org/abs/2610.08048
← 上一篇
两篇论文一个结论:agent 把证据收齐了,然后当没看见
下一篇 →
NeMo-DCR:Nvidia 把万亿参数 RL 权重同步从 87 分钟压到 150 秒
← 返回所有文章

评论

加载中...
>_