2026年8月5日ResearchAgentsBenchmark

把任务状态挪出上下文,agent 涨 30 分

HuggingFace Daily Papers 今天的 agent 头名论文,125 个赞:LongHorizon-Harness,arXiv 2608.01964。诊断的问题每个做 agent 的人都疼过:长任务失败,是因为任务计划和进度全塞在一个越滚越大的上下文里,模型走着走着就不知道自己在哪一步,更糟的是会自信地错判哪些事已经做完了。

解法是架构层面的,不靠更大的模型。把执行重新表述成任务状态管理问题:任务状态整个放在上下文之外,跑一个 Manage-Execute-Audit 循环,状态的每次更新都对照环境独立核验,而不是听信 agent 自己汇报干了什么。

数字很难反驳。Qwen 3.7-Plus 在 WeaveBench 上从 51.8 跳到 80.7,光靠 harness 涨了近 30 分;Terminal-Bench 2.1 从 69.7 到 77.2;Claude Opus 4.7 在 OSWorld 2.0 子集上从 20.0 爬到 34.3。权重一个字没动,变的只有脚手架。

这就是 2026 年反复出现的那一课:模型能做到的和 agent 实际做到的之间,差的主要是 harness,一个好 harness 比下一个 checkpoint 值钱。最值得抄走的是 audit 那一步,因为自我评估恰恰是 agent 最会骗自己的地方。论文在 arxiv.org/abs/2608.01964。
← 上一篇
AirLLM 把 2.8 万亿参数的 Kimi K3 塞进 3.72GB 显存
下一篇 →
苹果请求法院冻结 OpenAI 硬件计划,又点名 11 名前员工
← 返回所有文章

评论

加载中...
>_