2026年8月30日ResearchAgentsBenchmark

HarnessLens:进化harness,但别把评测预算烧光

HarnessLens打的是agent开发里最不性感的瓶颈:验证成本。如果你在自动进化agent的harness——提示词、工具、配置——每个候选改动都要测试,而每个改动对每个任务全量测一遍,评测预算烧起来没底。多数团队要么多花冤枉钱,要么验证不足,而聚合分数还会笑眯眯地掩盖那些将来在生产环境咬你一口的具体回退。

解法是行为感知的选择性验证。HarnessLens同时探索任务空间和可配置组件,然后用一个所谓attributable-evidence gate:一个改动只在"这个行为真正起作用"的任务上验证。在三个agent harness、四个benchmark上,它在留出任务上提升7.6%到13.6%,评测预算却比对手方法省得多。代码在GitHub上。

harness是当下agent圈最响的一条线——DeepSeek把harness当产品发,TaoLive把模型和harness放一起训,每个认真的团队都在手工调自己那套。手工调不可扩展,无脑自动调又淹死在评测成本里。"只验证要紧的"是那种事后看显而易见的一步,"行为感知"大概率会成为这条研究线的标配定语。

论文:https://arxiv.org/abs/2608.27311
代码:https://github.com/jhxu5214/HarnessLens
← 上一篇
WikiSkill:给agent一部wiki,别只给一堆技能
下一篇 →
超级用户日报: 2026-08-30
← 返回所有文章

评论

加载中...
>_