AREX:一个会给自己批改作业的深度研究智能体
大多数深度研究智能体,干活像一个把作文写完一遍就交卷的学生。北京智源出的AREX,像的是另一种学生:把草稿回头再读一遍,把每一处自己没底的论断都圈出来,然后一条条去查证。
关键在一个人人都懂、却少有智能体去用的不对称:找到答案很贵,但验证一个答案通常能拆成一堆小而好算的约束检查。于是AREX跑两个循环。内层收集证据、搭出一个临时答案。外层逐条约束地审这个答案,把站不住脚的部分标出来,然后精准地对这些缺口发起后续研究。验证过的部分留着,力气都花在有疑问的地方。
真正让它能跑得长的,是一个学出来的上下文更新工具。AREX不拖着整个不断膨胀的交互历史走,而是把它压缩成一个精简的“改进状态”——哪些已验证、哪些还没结论——而且是自己完成的,不需要外部模型盯着。这就是一个只能自我改进三步的智能体,和一个能一直走下去的智能体的区别。
结果:它打赢了同级baseline,面对大得多的模型也不落下风。真正的收获不是那条benchmark曲线,而是这套配方。当你不再试图重新推导答案、而是去验证手里已有的那个,递归自我改进立刻变便宜了。
https://arxiv.org/abs/2607.21461
← 返回所有文章
关键在一个人人都懂、却少有智能体去用的不对称:找到答案很贵,但验证一个答案通常能拆成一堆小而好算的约束检查。于是AREX跑两个循环。内层收集证据、搭出一个临时答案。外层逐条约束地审这个答案,把站不住脚的部分标出来,然后精准地对这些缺口发起后续研究。验证过的部分留着,力气都花在有疑问的地方。
真正让它能跑得长的,是一个学出来的上下文更新工具。AREX不拖着整个不断膨胀的交互历史走,而是把它压缩成一个精简的“改进状态”——哪些已验证、哪些还没结论——而且是自己完成的,不需要外部模型盯着。这就是一个只能自我改进三步的智能体,和一个能一直走下去的智能体的区别。
结果:它打赢了同级baseline,面对大得多的模型也不落下风。真正的收获不是那条benchmark曲线,而是这套配方。当你不再试图重新推导答案、而是去验证手里已有的那个,递归自我改进立刻变便宜了。
https://arxiv.org/abs/2607.21461
评论