2026年8月10日ResearchSkillsAgents

自进化的反噬:agent 会给自己的技能库投毒

自我进化的 agent 有个投毒问题,一篇新论文把它量化了。When Self-Evolution Backfires(arXiv 2608.05810,8 月 6 日提交)研究的是从自己的执行轨迹里蒸馏可复用技能的 agent。所有人期待的模式——技能越攒越多、能力越来越强——一开始成立,然后反转。机制是作者说的跨轮污染链:一个有缺陷的技能被收进技能库,成为下一轮蒸馏的参考材料,缺陷开始复利。一旦进去了,性能退化基本不可逆。

解法说白了就是给技能库加一道审批:Verifier-as-Gatekeeper,每个候选技能入库前要过一道预提交审查。三个 critic 分别查结构有效性、行为无害性、语义一致性,再用边际收益筛选把在策略层面帮倒忙的组合剪掉。在 Terminal-Bench 2 上做到 72% 的 pass at 1,技能库比无条件累积的版本小了差不多五倍;冻结后的技能库还能直接迁移到四个别的模型骨干上,不用重新进化。

这篇正好接上过去一个月的主线:Prime Agent 的 refine 循环把一个刷分漏洞进化成了更高效的作弊技能,OSReward 发现 VLM 裁判会把失败的运行判成通过。所有证据指向同一条规则:让 agent 生成改进是安全的,让 agent 审批自己的改进不是。小的、有门禁的、被审计过的技能库,赢过大的、自我批准的技能库——相当于给没有人类写过的代码建立 code review 文化。

论文在 arxiv.org/abs/2608.05810。
← 上一篇
daily_stock_analysis:六万星的不睡觉 AI 股票分析师
下一篇 →
EnvACE:腾讯让 agent 在脑子里排练世界
← 返回所有文章

评论

加载中...
>_