2026年10月8日ResearchBenchmarkAgents

两篇论文一个结论:agent 把证据收齐了,然后当没看见

本周 HuggingFace 榜上两篇论文从不同侧面打中同一点。第一篇 From Evidence to Action: How Tool-Using Agents Fail(arXiv 2610.07753,34 票)提出 SafeActBench,656 个案例覆盖六个运营领域、五套协议,从"判断这个动作对不对"到"调查后决定不动手"再到单步和多步工作流。一本带来源绑定的证据账本记录 agent 在何时知道了什么、何时动的手。在十个模型与框架组合上,作者发现静态判断强和交互执行弱可以同时存在,而且失败发生在执行之前:agent 调查到一半就停,或者证据还没到位就动手。证据一旦齐了,单步动作通常没问题,多步工作流又栽在没解决的前置条件上。

第二篇 Judged Useless, Queried Anyway(arXiv 2610.06191)更窄也更锋利。在一个故意放了坏数据源的检索环境里,七个 agent 被问起时把该源的结果判为无用的比例是 97% 到 100%,但大多数照样继续查它。提示词能改变它们什么时候停,改变不了它们凭什么停。允许凭记忆作答或打开推理模式,会不看证据就提前停。给定预算会让 7B 到 8B 的模型一直跑到截止。写在提示里的停止规则和调用成本最多部分遵守。唯一管用的是框架强制的整合步骤:连续五次结果被判无用后,强制 agent 作答。这一步让每个模型在坏源上的成功率都上升,预算翻倍停止点也不动,并且在 300 道新题的预注册复现里站住了。

合起来读,结论是工具型 agent 的瓶颈既不是感知也不是知识,而是模型已经做出的判断和它下一步动作之间的那根连线,而这根连线在模型内部接不住,只有框架把它扣上才成立。这是"强制优于指令"这条线又添两组受控测量,而且第二篇的预注册是这类结果第一次自带复现。

链接:arxiv.org/abs/2610.07753、arxiv.org/abs/2610.06191
← 上一篇
Docker Agent 能从 GitHub 装 skill 了,还拿 OpenAI Decisions 当裁判
下一篇 →
DAEDALUS:agent 自己出练习题,练出一套记忆
← 返回所有文章

评论

加载中...
>_