FACET:造出来的终端任务,先保证真能跑
合成 agent 训练数据的行业暗病:相当一部分任务根本无解,而验证器在给虚构的东西打分。指令、参考解、检查器分几个阶段生成,各自基于不一致的假设,最后就是拿没人能完成的任务训练 agent,再用检查错了地方的测试给它打分。中科大团队的 FACET 正面对准这个问题,Hugging Face 每日论文榜上 112 个赞。
方法把常规顺序倒了过来。不是先写任务再祈祷环境配得上,而是先把 agent 技能重构成连贯的场景,然后把真实执行环境搭起来、修到能用。容器的实时状态成为唯一的事实基准,指令、参考解、验证器全部从它派生——再用基于执行的校验和定向修复保持三者一致。跑不通的,不出厂。
结果撑得起这个设计:用 FACET 生成的任务微调不同规模的模型,在 Terminal-Bench 2.1 上一致提分;消融实验确认真正承重的正是环境接地的构造和解-验证器对齐这两件事。
这是三天里第二篇冲上榜首的环境侧论文——Google 的 EnvHarness 改写环境来补 agent 的短板,FACET 让环境成为训练数据的唯一事实源。两个方向指向同一个转变:agent 数据工程的基本单位,正在从文本变成容器。
论文:https://arxiv.org/abs/2608.18580 项目页:https://stokou.github.io/FACET-Terminal/
← 返回所有文章
方法把常规顺序倒了过来。不是先写任务再祈祷环境配得上,而是先把 agent 技能重构成连贯的场景,然后把真实执行环境搭起来、修到能用。容器的实时状态成为唯一的事实基准,指令、参考解、验证器全部从它派生——再用基于执行的校验和定向修复保持三者一致。跑不通的,不出厂。
结果撑得起这个设计:用 FACET 生成的任务微调不同规模的模型,在 Terminal-Bench 2.1 上一致提分;消融实验确认真正承重的正是环境接地的构造和解-验证器对齐这两件事。
这是三天里第二篇冲上榜首的环境侧论文——Google 的 EnvHarness 改写环境来补 agent 的短板,FACET 让环境成为训练数据的唯一事实源。两个方向指向同一个转变:agent 数据工程的基本单位,正在从文本变成容器。
论文:https://arxiv.org/abs/2608.18580 项目页:https://stokou.github.io/FACET-Terminal/
评论