2026年7月23日AgentsMCPResearch

DataFlow-Harness:别再让agent写一次性脚本了

让编程agent搭一条数据流水线,你会拿到一个Python脚本。能跑,能用,然后它就变成一个没人能改、没法监控、没法复用的死物。北大的DataFlow-Harness把这个问题命名为NL2Pipeline鸿沟,解法是让agent在真实平台里搭一个可编辑的DAG,而不是往文件里吐代码。

机制是一套跑在MCP工具上的"请求-校验-提交"协议。agent不生成流水线,它是针对平台的实时状态提出算子,后端校验算子之间的schema兼容性,通过了才提交。配套有一个同步的Web界面,对话式编辑和可视化编辑看的是同一个对象,再加一层DataFlow-Skills,把领域构造模式编码进去——不然这些东西agent只能靠猜。

数据是论证本身。十二个任务的基准上端到端通过率93.3%,跟直接让模型写脚本只差0.9个点,但成本低72.5%,延迟低49.9%。这个组合很不寻常,值得盯着看一会儿。把agent锚定在校验过的平台状态上,比代码生成更便宜而不是更贵,因为agent不再烧token去重新推导那些本来可以查询的结构,也不再反复重试那些从一开始就通不过类型检查的流水线。消融实验说贡献最大的单块是流程性引导,也就是skills那一层,四个点,而且恰好体现在需要隐性领域知识的任务上。

普适的教训远超出数据流水线。agent的默认输出是代码,因为训练数据奖励的就是代码,但当后面要有个人接手为结果负责时,代码是最糟糕的交接格式。任何底下有真实平台的领域——BI看板、ETL、基础设施、CI配置——面对的都是同一个选择:让agent写一个绕过平台的脚本,还是给它MCP工具让它成为平台的一等公民用户。后者更难做,也是唯一能在跟运维团队接触之后活下来的那个。

https://huggingface.co/papers/2607.16617
← 上一篇
卡兰尼克融了17亿美元,去造原子做的计算机
下一篇 →
ABot-World-0:一张5090跑出一个无限交互世界
← 返回所有文章

评论

加载中...
>_